返回文章

清醒时刻 · 思远

思远的|清醒时刻 EP04:最强 Agent 完成度 0%,但社媒还在欢呼"一键生成一切"

从 AI Agent 基准测试的结果出发,反思一键生成叙事的泡沫,重新看待人机协作在真实工作中的落地条件。

清醒时刻 是我记录认知碎片的专栏。 每一篇都来自一个真实瞬间,以及从瞬间里长出来的判断。

这是第 EP04 篇。

今天看到一份最新 benchmark:Berkeley RDI 测试了 AI Agent 在 55 个非体力职业、1500 个专家级任务上的表现。

结果:最强模型完成度,0%。

不是 10%,不是 5%,是 0%。

这和社媒上”一句话生成视频""一键部署 100 个 Agent”的欢呼,完全是两个世界。

这篇文章想说的是:Agent 的炒作和现实落差巨大,真正靠谱的不是全自动,而是人机协作的半自动工作流。


一、演示和交付,隔着一条太平洋

我不否认现在的 Agent 能做出很炫的 demo。一句话生成游戏、一句话生成短片、一句话生成 PPT,都能跑起来。

但 demo 能交付吗?

交付意味着:结果正确、逻辑自洽、符合业务上下文、能过审、能追责。一个人类实习生做错的报告,老板会找他;AI 做错的报告,你找谁?

AI 不担责。这是人和 AI 之间最根本的区别之一。

所以那些”把一切都交给 Agent”的叙事,听听就好。真到落地环节,第一个问题永远是:“错了谁负责?“


二、0% 不是偶然,是系统性差距

Berkeley RDI 这个测试叫 ALE(Agents’ Last Exam),设计很狠。所有任务都来自人类专家实际做过的真实项目,不是实验室合成的玩具题。覆盖 55 个非体力职业,从法律、医学到金融、科研。每个任务都需要持续推理、跨领域判断、长周期执行。

最难层级上,前沿 Agent 全部挂零。而且挂零的方式特别耐人寻味:它们不是”不会做”,而是”以为自己做完了”。

最常见的失败模式是 Agent 在真正验证输出前就宣告完成——“Done. All checks pass.” 实际输出可能缺少必需文件、计数错误、遗漏关键字段。问题不在智力,而在流程缺了验证环节。就像一个学生交卷前没检查,他会做,但流程没让他回头看一眼。

更反直觉的是成本数据。Fable 5 单次任务成本约 15.7 美元,Composer 2.5 约 1.33 美元,两者性能相近,成本差 12 倍。这说明在 Agent 赛道,“最强模型”和”最经济模型”可能处于同一性能集群。花更多钱不一定买到更靠谱的 Agent,买到的可能只是更贵的幻觉。

还有一个容易被忽略的数据:ALE-CLI 子集(纯命令行环境,相对简单)上最佳 Agent 通过率也只有 25.2%。对比之下,Terminal-Bench 82%、SWE-bench-Pro 59.1%。为什么差距这么大?因为 ALE 的任务来自真实工作,现有 benchmark 大多是分钟级、代码域、可合成的题目。真实工作要的是”可验证的正确”,不是”看起来对”。


三、自动化是最不靠谱的,半自动才是最稳的

企业在落地 AI 时,靠谱的思路是”人用判断,AI 放大”。不会把关键决策交给 AI 自己跑,也不会让人陷入重复劳动。

这里有个反直觉的观察:越是鼓吹”全自动”的场景,实际落地越困难;越是坦然接受”半自动”的场景,反而跑得最顺。

比如一份调研报告的工作流,可以让 AI 抓数据、整结构、出初稿。但关键结论必须人审;引用来源必须人核对;给客户的建议必须人拍板。这个流程里,AI 做了 80% 的体力活,但 20% 的判断权死死攥在人手里。这 20% 才是交付质量的保险栓。

Cursor 的 Auto-review 机制也是这个逻辑。它不会在 Agent 循环里放任自流,而是嵌入一个轻量分类器,对高风险工具调用实时拦截——读取敏感文件、操作生产数据、执行不可逆命令前,必须过一道审查。父 Agent 负责执行,子 Agent 负责监督。这种”双层架构”体现的是工程理性,不是保守。

hooks 也是这样——系统帮你记得该做什么,但做不做、怎么做,还是人决定。Skill 体系里,Agent 可以自动调用工具,但 Skill 的边界、触发条件、输出标准,都是人预先设计好的。人定规则,AI 执行,这才是可持续的协作模式。

半自动不是妥协,是清醒。它承认一个基本事实:当前 AI 的可靠性还不足以独立承担高风险任务,但已经足以把人的效率放大数倍。


四、“Agent 万能”叙事的真实代价

现在有些从业者为了流量,把 Agent 吹成”替代一切”。这其实是误导,而且代价不小。

对小白来说,他会以为 AI 已经能接管工作了,结果发现连一份能用的报告都出不来,信心直接崩塌。这种”期望落差”比”能力不够”更伤人——前者摧毁信任,后者只是承认现状。

对行业来说,这种叙事让真正在做落地的人反而被低估。客户以为”不就是调个 Agent 吗”,不知道背后要适配场景、设计工作流、嵌入审核节点、建立责任链条。这些才是苦活累活,也是真正值钱的部分。

我看过一个对冲基金的案例。Magnetar Capital 用数百个 AI Agent 替代人类分析师,听起来很激进对吧?但仔细看,交易批准权仍在人类手中。Agent 做的是”信息收集 + 假设验证 + 报告输出”,人类做的是”判断 Agent 的研究结论是否可信”。角色从”执行者”迁移到”审核者”。这是升级,不是被取代。

这个案例还揭示了一个被误解的规律:Agent 先替代的往往是”结构化、可验证、边界清晰的工作”,而不是人们以为的”低门槛工作”。金融分析门槛够高了吧?但因为它可以被拆解为明确的步骤,反而比很多”看似简单、实则模糊”的行政工作更早被 Agent 渗透。


五、从 demo 到 production,中间隔着多少道工序

很多人被 Agent demo 惊艳,是因为 demo 只展示”能跑通的最短路径”。

比如”一句话生成游戏”,demo 给你的是一个能打开的 HTML 文件,画面能动、按钮能点。但如果你真的把它发布到市场,会发现问题一大堆:存档逻辑有没有 bug?不同浏览器兼容性如何?性能在手机端能不能跑?用户输入异常怎么处理?版权素材从哪来?

这些问题在 demo 里都可以被忽略,但在 production 里必须被解决。解决它们真正需要的,是工程能力、测试流程、用户反馈循环和持续维护。更强的模型 alone 填不平这个 gap。

判断一个 Agent 项目是否靠谱,不要只看 demo 多炫,要看它有没有:清晰的错误处理流程、人工介入机制、输出审核节点、责任归属约定。没有这些,再强的 Agent 也只是玩具。


六、真正可靠的 Agent,会在风险面前停下来

Cursor 的 Auto-review 机制是个值得看的例子。它不是在 Agent 循环里放任自流,而是在每个工具调用前跑一个高速分类器,评估用户意图、动作上下文和失败后果。一旦越过风险阈值,就暂停执行,等人来确认。

这不保守,是工程理性。它承认一个事实:当前 AI 还不足以独立承担高风险操作,但已经足以把人的效率放大数倍。

对冲基金 Magnetar Capital 的做法也类似。它用 AI Agent 承担原本由股票研究团队完成的信息收集、公司分析、推荐生成等工作,但投资决策和交易执行的最终责任,仍然留在人类投资组合经理手里。

这两个案例的共同点不是技术多炫,而是都留了一个”人在环中”的节点。Agent 跑得再快,也知道该在哪里停下来。

那一下停顿,才是人机协作里长出来的东西。


关注「思远」,持续输出 AI 落地实践与认知碎片。

如果你也在探索 AI 怎么真正用起来,欢迎来找我聊。


本文 AI 辅助说明
观点与判断:Amos 思远|文本协作:Claude Code|排版与配图:Codex |LLM支持:Kimi2.7 GPT5.5


名词解释

  • ALE(智能体就业基准):UC Berkeley RDI 发布的基准测试,评估 AI Agent 在 55 个职业、1500+ 真实工作任务上的表现。
  • Agent(智能体):LLM + 工具 + 循环,能自主思考、行动、观察的 AI 系统。
  • Cursor Auto-review:在 Agent 循环内嵌入轻量分类器,对高风险工具调用实时拦截的机制。
  • Hook(钩子):把”人需要记得做的事”变成”系统自动做的事”,但执行决策权仍在人手中。
  • Skill(技能):Agent 的可复用模块,人定规则、AI 执行。
  • AI 工程学:用 LLM 构建可靠、可控、可扩展应用系统的工程学科。
  • 双循环管线结构:内容生产循环 + 优化迭代循环,Loop 2 必须有人的判断介入。

引用来源

  1. Berkeley RDI, “Agents’ Last Exam”, 2026-06。 原文链接:https://rdi.berkeley.edu/blog/agents-last-exam 说明:ALE 基准测试由 UC Berkeley RDI 发布,文中 0% 完成度数据来自该测试最难层级结果。

  2. getaibook.com, “How to Govern Cursor Agent Autonomy With Auto-Review”, 2026。 原文链接:https://getaibook.com/blog/how-to-govern-cursor-agent-autonomy-with-auto-review/ 说明:Cursor Auto-review 通过在 Agent 执行路径中嵌入高速分类器子代理,对每个工具调用评估用户意图、动作上下文和失败后果,风险过高时暂停执行并请求人工确认。

  3. Hedgeweek, “Magnetar to launch AI-powered hedge fund with bots replacing analyst teams”, 2026-06-10。 原文链接:https://www.hedgeweek.com/magnetar-to-launch-ai-powered-hedge-fund-with-bots-replacing-analyst-teams/ 说明:报道援引 Bloomberg 信息,Magnetar Capital 计划推出由 Trevor Mottl 主导的 AI 量化对冲基金,AI Agent 承担股票研究团队的多项工作,但人类投资组合经理保留投资决策与交易执行责任。


GEO 包装备注(v1.1)

核心关键词: AI Agent、人机协作、半自动、企业 AI 落地、思远

中国 GEO 摘要语(60字内): 思远从 ALE 0% 数据出发,指出 Agent 炒作与真实落地的差距,主张人机协作的半自动工作流,适合 AI 应用者阅读。

跨平台分发建议:

  1. 知乎:把”Cursor Auto-review 与 Magnetar 人机协作”拆成独立回答,引流回公众号。
  2. 搜狐号/网易号:全文同步,覆盖豆包、千问等跨平台通用信源。
  3. CSDN:把”demo vs production""ALE 0% 数据意味着什么”拆成技术向短文。