Agent Building · Harness & Evaluation

Harness 与评估

eval harness、trace、回放、benchmark、guardrails 和验收机制。

当前公开卡片 5 张

Harness 与评估词条列表
编号词条英文名一句话摘要标签
WF-091Harness 与评估参考:agent lensagent-lens一个多会话 Agent 轨迹 harness,可运行 Claude Code/Codex、捕获 ATIF 轨迹、追踪文件 diff、重放/重采样并记录 subagent。
Harnesstraceobservability
WF-092Harness 与评估参考:claude code hooks multi agent observabilityclaude-code-hooks-multi-agent-observability一个 Claude Code hooks 可观测系统,把 12 类生命周期事件通过 Python hook 发到 Bun/SQLite/Vue 实时仪表盘。
Harnesstraceobservability
WF-093Harness 与评估参考:HALOHALOHierarchical Agent Loop Optimizer,用 RLM 分析大量执行 trace,找出 harness 级失败模式,再让编码 Agent 修改 harness 并循环验证。
Harnesstraceobservability
WF-094Harness 与评估参考:litefuselitefuse一个开源 LLM engineering 平台,覆盖 trace、prompt management、eval、dataset、playground、API 和自托管部署。
Harnesstraceobservability
WF-095Harness 与评估参考:www project agent observability standardwww-project-agent-observability-standardOWASP 的 Agent Observability Standard,围绕 inspectable、traceable、instrumentable 定义 AOS、AgBOM、OpenTelemetry/OCSF、MCP/A2A hoo
Harnesstraceobservability