Skill 生产线 · Testing & Evaluation

测试评估

用样例、失败条件、golden samples 和回归检查验证 Skill 是否稳定。

当前公开卡片 5 张

测试评估词条列表
编号词条英文名一句话摘要标签
WF-036测试评估参考:claw benchclaw-bench一个让真实 AI Agent 直接完成任务、再用 pytest verifier 和加权检查点评分的公开 benchmark。
测试评估evalbenchmark
WF-037测试评估参考:clawbenchclawbench一个从执行 trace、可靠性、噪声和失败动力学诊断 Agent 的 benchmark,重点不是只看最终输出是否通过。
测试评估evalbenchmark
WF-038测试评估参考:crabcrab一个 Python-first 的跨环境 Agent benchmark 框架,用 Action、Environment、Task、Evaluator 和 Benchmark 组织多模态具身任务。
测试评估evalbenchmark
WF-039测试评估参考:frontier swefrontier-swe一个面向超长程高难软件工程任务的 benchmark,覆盖性能工程、计算科学和机器学习研究类真实问题。
测试评估evalbenchmark
WF-040测试评估参考:TheAgentCompanyTheAgentCompany一个模拟软件公司的 Agent benchmark,用 GitLab、Plane、ownCloud、RocketChat 等服务测试数字员工式任务。
测试评估evalbenchmark