Skill 生产线 · 代码实现 · Skill 解读 · WF-035
代码实现参考:SkillForge Core
一个本地优先的仓库蒸馏工作台,用 Web UI 把混杂文档扫描、证据抽取、能力聚类和 Skill 导出串成可审阅流水线。
SkillForge Core
一个本地优先的仓库蒸馏工作台,用 Web UI 把混杂文档扫描、证据抽取、能力聚类和 Skill 导出串成可审阅流水线。
这个能力解决什么问题
SkillForge-Core 解决的是团队已有材料太散,无法直接变成 AI Skill 的问题。它不是做 Agent 编排框架,而是实现一条从 repository/document corpus 到 skill package 的本地流水线:先扫描、解析、抽证据,再聚类成能力,最后编译并导出技能。
核心逻辑
真实输入是本地仓库或文档语料、job 名称、用户描述的提取目标、可选模型 API 配置。处理逻辑是:用户在 Web UI 创建 job;inventory 服务发现参考文件;parsing 解析 Markdown、txt、docx、pdf、xlsx;extraction 抽取 workflow-relevant evidence;clustering 把证据归成 capability;compiler 生成 skill plan 和 skill preview;exporter 写出 SKILL.md、references、scripts、assets。输出是可预览、可覆盖审查、可导出的 skill folder。
技术结构
- 关键模块:
backend/app/main.py启动 FastAPI;web.py负责服务端页面;api/routes/管 jobs、documents、evidence、inventory、skills、settings;services/jobs.py编排 pipeline;services/inventory.py扫描;services/parsing.py解析文档;services/extraction.py抽证据;services/distillation.py和services/compiler.py做能力聚类/编译;services/exporter.py输出;SSE 提供实时状态。 - 调用链路:创建 job -> scan/parse -> evidence workbench -> capability cluster preview -> skill plan/generated skill preview -> export 到 folder。
- 输入输出:输入是本地路径、目标描述、支持格式文档、模型配置;输出是 job 状态、解析文档、证据片段、能力 cluster、skill preview 和导出目录。
- 核心依赖:Python 3.11+、FastAPI、Jinja2、Uvicorn、Vanilla JS、SSE、Pydantic v2、SQLAlchemy/SQLite、Alembic、Celery/Redis 可选、python-docx、pypdf、openpyxl、OpenAI/Azure/Anthropic compatible 配置可选。
为什么值得参考
它的设计亮点是「可视化中间态」:不是一次性把资料扔给模型生成 Skill,而是让用户看到 parsed documents、evidence、capabilities、plan 和 generated skill。对实现自己的 Skill Forge,这种中间态审阅比黑盒生成更可靠。
为什么不建议直接套用
项目仍标注 local-first,README 说明 evidence extraction、clustering、planning、compilation 目前有 heuristic/local implementations;若想生成完整技能仍建议配置外部大模型。仓库还包含 __pycache__ 文件,工程洁净度需复核。对于纯 Markdown 卡片生产,启动 Web app、数据库、后台任务会过重。
如何改造成自己的版本
抽取它的 pipeline 而不是整套 UI:先做命令行版 scan -> parse -> evidence -> capability -> 草稿 -> export,每一步输出 Markdown/JSON 供人工审查。证据抽取先用规则和关键词,等样例稳定后再接模型。UI 可以最后做,只展示中间态和人工确认,不负责自动写入知识库。
适用场景
- 需要把一堆内部文档、SOP、研究材料转成 Skill 包。
- 需要审阅证据和 capability cluster,而不是盲生成。
- 需要本地优先,不强依赖外部模型。
不适用场景
- 只处理一两个 README,命令行足够。
- 需要成熟 SaaS 多租户能力。
- 不希望维护 FastAPI、数据库、文档解析和 UI。
参考信息
- 原项目:SkillForge-Core
- 作者:wwyharry
- 相关概念:[[仓库蒸馏]]、[[证据抽取]]、[[能力聚类]]
- 相关卡片:workflow-read-035
适用场景与行动
场景:Skill 生产线 / 代码实现
适合谁:关注 AI 工作流、Skill 生产和 Agent Building 的读者
下一步:先阅读边界说明,再判断它是否适合改造成自己的代码实现流程。
当前内容按公开来源和已审核草稿整理,只作为工作流理解与方法论参考。
涉及客户数据、外部平台、会议记录和业务系统的场景,必须保留人工确认与授权边界。