Skill 生产线 · 目标明确 · Skill 解读 · WF-023

目标明确参考:bot with plan

思行致远 · 2026/6/30 · 置信度:低
目标明确可行性判断Skill生产线

一个把 ReAct Agent 的「规划」和「函数调用」拆开的实验项目,用来判断任务是否应该先训练/约束 planner,而不是直接让模型调用工具。

bot with plan

一个把 ReAct Agent 的「规划」和「函数调用」拆开的实验项目,用来判断任务是否应该先训练/约束 planner,而不是直接让模型调用工具。

这个能力解决什么问题

bot-with-plan 面对的问题是:小模型或开源模型在 ReAct 流程里既要决定下一步做什么,又要写对工具参数,负担过重,容易产生错误工具调用。它把目标明确为「planner 只描述下一步任务并选择工具,具体函数参数由函数调用模型或工具侧处理」。对 Skill Forge 的启发是,做 Skill 前要先判断失败点在目标分解、工具选择还是参数执行,不要把三者混在一个提示词里。

核心逻辑

真实输入是用户请求、当前观察、可用工具列表,以及模拟或真实环境返回的 observation。处理逻辑是:planner 只生成下一步非正式任务描述和工具选择;工具或函数调用层把这个描述转成具体调用;环境执行后返回观察;循环直到 10 步内完成或失败。项目还用 GPT-4 planner 在 simulation 环境中生成 synthetic trajectories,再用这些轨迹 fine-tune Mistral-7B planner,并用 schema-guided generation/pydantic grammar 限制模块输出。

技术结构

  • 关键模块:simulation/ 负责模拟工具、轨迹生成和评估;gba/ 放真实 agent、planner、tool 接口;train/ 负责 planner fine-tuning;gba/tools/search/ 提供 SearXNG 搜索工具;notebook 展示 fine-tuned planner、zero-shot planner 和 JSON schema guided generation。
  • 调用链路:用户请求 -> planner 读 observation 并选择工具/描述任务 -> 工具层生成并执行具体函数调用 -> 环境返回 observation -> evaluator 用 pass rate、bad task rate、completion rate 评估轨迹。
  • 输入输出:输入是自然语言请求、工具 schema、观察记录和模拟轨迹;输出是下一步计划、工具调用、最终回答、训练数据集和评估指标。
  • 核心依赖:Python、Poetry、Conda、llama.cpp server、本地 GGUF 模型、SearXNG、OpenAI/GPT-4 生成轨迹或 baseline。

为什么值得参考

它的项目特定亮点是「降低 planner 的职责」:不要求 planner 同时会规划、写参数、懂每个 API,而是让它只做任务拆分和工具选择。这对 Skill 设计很有用:一个能力如果经常失败,可能不是说明书不够长,而是职责没有拆开。

为什么不建议直接套用

它是研究性仓库,README 的模型下载、GPU Docker、llama.cpp 端口和 SearXNG 依赖都偏重;评估集只有 50 个请求,场景集中在该项目定义的工具集。其术语也和常见 Agent 框架不同,直接搬会让团队把「任务」「动作」「工具调用」混淆。

如何改造成自己的版本

先不训练模型,只借它的分层:在每个 Skill 里区分 plan_outputtool_selectiontool_argumentsobservation。为失败案例标注是「计划错」「工具选错」还是「参数错」。如果同类任务很多,再积累 30-50 条内部轨迹,做小规模 regression eval,而不是一开始就 fine-tune planner。

适用场景

  • 需要让 Agent 在多工具任务里先稳定选步骤,而不是马上写调用参数。
  • 需要评估小模型是否能承担规划职责。
  • 需要把模拟环境轨迹用于 planner 训练或回归测试。

不适用场景

  • 只需要调用一两个稳定 API,没必要拆 planner。
  • 没有本地模型、GPU 或 SearXNG 环境。
  • 任务的关键风险在权限和数据安全,而不是步骤规划。

参考信息

参考对象信息

名称:bot-with-plan

作者:krasserm

链接:https://github.com/krasserm/bot-with-plan

适用场景与行动

场景:Skill 生产线 / 目标明确

适合谁:关注 AI 工作流、Skill 生产和 Agent Building 的读者

下一步:先阅读边界说明,再判断它是否适合改造成自己的目标明确流程。

当前内容按公开来源和已审核草稿整理,只作为工作流理解与方法论参考。

涉及客户数据、外部平台、会议记录和业务系统的场景,必须保留人工确认与授权边界。