Skill 生产线 · Testing & Evaluation
测试评估
用样例、失败条件、golden samples 和回归检查验证 Skill 是否稳定。
当前公开卡片 5 张
| 编号 | 词条 | 英文名 | 一句话摘要 | 标签 |
|---|---|---|---|---|
| WF-036 | 测试评估参考:claw bench | claw-bench | 一个让真实 AI Agent 直接完成任务、再用 pytest verifier 和加权检查点评分的公开 benchmark。 | |
| WF-037 | 测试评估参考:clawbench | clawbench | 一个从执行 trace、可靠性、噪声和失败动力学诊断 Agent 的 benchmark,重点不是只看最终输出是否通过。 | |
| WF-038 | 测试评估参考:crab | crab | 一个 Python-first 的跨环境 Agent benchmark 框架,用 Action、Environment、Task、Evaluator 和 Benchmark 组织多模态具身任务。 | |
| WF-039 | 测试评估参考:frontier swe | frontier-swe | 一个面向超长程高难软件工程任务的 benchmark,覆盖性能工程、计算科学和机器学习研究类真实问题。 | |
| WF-040 | 测试评估参考:TheAgentCompany | TheAgentCompany | 一个模拟软件公司的 Agent benchmark,用 GitLab、Plane、ownCloud、RocketChat 等服务测试数字员工式任务。 |