Skill 生产线 · 测试评估 · Skill 解读 · WF-039

测试评估参考:frontier swe

思行致远 · 2026/6/30 · 置信度:中
测试评估evalbenchmark回归检查

一个面向超长程高难软件工程任务的 benchmark,覆盖性能工程、计算科学和机器学习研究类真实问题。

frontier swe

一个面向超长程高难软件工程任务的 benchmark,覆盖性能工程、计算科学和机器学习研究类真实问题。

这个能力解决什么问题

FrontierSWE 解决的是普通代码 benchmark 过短、过窄,无法测出前沿 coding agent 在长周期技术挑战中的能力。它收集来自性能工程、科学计算、ML research 等领域的真实问题,并把每个任务做成包含环境、说明、测试、reward 计算和 solution 的独立目录。对 Skill 评估阶段的价值在于:它展示了如何把「难题」包装成可复现环境和可计算 reward。

核心逻辑

真实输入是某个 tasks/<task>/ 目录、agent CLI 适配器、Docker 环境、task instruction、oracle/reward/test 脚本。处理逻辑是:benchmark 在隔离环境中启动任务;agent 读取 instruction 并修改 workspace;测试脚本或 reward 计算检查性能、正确性或目标指标;harbor_ext/ 中的 Claude Code、Codex、Cursor、Gemini、OpenCode、Qwen 等适配器用于接入不同 agent;最终输出 reward/score 和 leaderboard 分析。

技术结构

  • 关键模块:tasks/ 包含 cranelift-codegen-opt、dart-style-haskell、ffmpeg-swscale-rewrite、git-to-zig、postgres-sqlite-wire-adapter、pyright-type-checking-optimization 等任务;每个任务含 environment/Dockerfileinstruction.mdjob.yamloracle.yamltask.tomltests/compute_reward.pytests/test.shharbor_ext/ 放各 agent CLI 适配、安全、网络 allowlist、timeout 和 modal 执行;docker/first_party_cli/ 预装一方 CLI。
  • 调用链路:选择任务 -> 构建/启动 Docker 环境 -> agent adapter 执行长程修改 -> tests/reward 脚本评估 -> scripts/score_from_reward.py 汇总得分。
  • 输入输出:输入是任务说明、代码库 workspace、agent CLI、运行预算;输出是修改后的代码、测试结果、性能 reward 和 benchmark 分数。
  • 核心依赖:Docker、uv/Python、Rust/Cargo、Haskell/Dart/Zig/C/C++ 等任务语言栈、Modal/Prime Intellect 环境、各类 agent CLI。

为什么值得参考

它最值得参考的是任务目录契约:instruction、environment、oracle、tests、reward 分离。评估复杂 Skill 时,也应该把「给 Agent 看什么」「环境怎么建」「真值怎么定义」「分数怎么算」分开,而不是把所有规则塞进一段说明。

为什么不建议直接套用

README 很短,很多理解必须读目录结构;任务高度专业,依赖多语言编译环境、性能基准和重型 Docker。它测的是 frontier coding agent 的极限,不适合作为普通 Skill 回归的默认标准。成本、运行时间和硬件要求都可能远超日常工作流。

如何改造成自己的版本

把每个内部高难任务也做成 task/ 目录:instruction.md 给 Agent,environment.md 或 Dockerfile 写依赖,oracle.md 写人工判据,tests/ 放自动检查,score.py 只计算分数。先用 3 个真实任务验证目录契约,再考虑接多 Agent CLI。

适用场景

  • 长周期代码任务、性能优化、编译器/系统/ML research 类挑战。
  • 需要评估 Agent 在真实工程环境里的坚持和调试能力。
  • 需要支持多个 coding agent CLI 适配。

不适用场景

  • 短脚本、普通 CRUD 或文档生成。
  • 没有 Docker/多语言工具链/性能测试环境。
  • 任务无法定义 reward 或 oracle。

公开版边界

  • 基于公开 README 解读。

参考信息

  • 原项目:frontier-swe
  • 作者:Proximal-Labs
  • 相关概念:[[长程软件工程评估]]、[[Reward 计算]]、[[任务环境契约]]
  • 相关卡片:workflow-read-037

参考对象信息

名称:frontier-swe

作者:Proximal-Labs

链接:https://github.com/Proximal-Labs/frontier-swe

适用场景与行动

场景:Skill 生产线 / 测试评估

适合谁:关注 AI 工作流、Skill 生产和 Agent Building 的读者

下一步:先阅读边界说明,再判断它是否适合改造成自己的测试评估流程。

当前内容按公开来源和已审核草稿整理,只作为工作流理解与方法论参考。

涉及客户数据、外部平台、会议记录和业务系统的场景,必须保留人工确认与授权边界。