Agent Building · Harness & Evaluation
Harness 与评估
eval harness、trace、回放、benchmark、guardrails 和验收机制。
当前公开卡片 5 张
| 编号 | 词条 | 英文名 | 一句话摘要 | 标签 |
|---|---|---|---|---|
| WF-091 | Harness 与评估参考:agent lens | agent-lens | 一个多会话 Agent 轨迹 harness,可运行 Claude Code/Codex、捕获 ATIF 轨迹、追踪文件 diff、重放/重采样并记录 subagent。 | |
| WF-092 | Harness 与评估参考:claude code hooks multi agent observability | claude-code-hooks-multi-agent-observability | 一个 Claude Code hooks 可观测系统,把 12 类生命周期事件通过 Python hook 发到 Bun/SQLite/Vue 实时仪表盘。 | |
| WF-093 | Harness 与评估参考:HALO | HALO | Hierarchical Agent Loop Optimizer,用 RLM 分析大量执行 trace,找出 harness 级失败模式,再让编码 Agent 修改 harness 并循环验证。 | |
| WF-094 | Harness 与评估参考:litefuse | litefuse | 一个开源 LLM engineering 平台,覆盖 trace、prompt management、eval、dataset、playground、API 和自托管部署。 | |
| WF-095 | Harness 与评估参考:www project agent observability standard | www-project-agent-observability-standard | OWASP 的 Agent Observability Standard,围绕 inspectable、traceable、instrumentable 定义 AOS、AgBOM、OpenTelemetry/OCSF、MCP/A2A hoo |