ESSAY·

2026 年的 AI 到底能做什么?从模型能力到 Agent 交付边界

先判断哪些工作能交给 AI,再读懂评测依据。用八类基准与最新模型画像,理解 AI 的能力、边界和下一阶段机会。

最近修订:2026.09.04

阅读导航 · 本篇目录

当前 AI 已经值得用于实际工作,但“能不能放手让它做”,应由任务是否清楚、结果是否能检查、错误是否能撤回决定,而不是由模型排名决定。

如果只记住三件事:

  1. 让 AI 先做明确、可检查的工作。 整理资料、生成初稿、修复能检验对错的代码,可以作为优先试用场景。
  2. 长任务可以委派,但要分段验收。 “完成一份方案”与“连续执行方案并承担后果”,不是同一种能力。
  3. 挑选模型时看具体任务,不追总冠军。 最强、最便宜、最适合你的材料和流程,往往不是同一个选项。

这里的三条是本文依据公开评测提出的使用建议,不是对所有产品的性能保证。下文先解释能力边界,再给模型画像;八类评测的细节放在文末,供需要核对证据的读者展开。

[!NOTE] 先认识三个词。 大语言模型(LLM)负责理解、生成内容和推理;智能体(Agent)是让模型调用搜索、文件、代码等工具,连续执行任务的系统;基准评测(benchmark)是一套固定考题,用来比较特定能力。比如,“告诉我怎么做报表”主要考模型,“读取文件、核算、生成报表并检查”则在考 Agent。

资料截止:2026 年 9 月 4 日。 本文重点覆盖知识工作、编码与工具型 Agent,不据此判断所有视觉、语音或机器人能力。各项成绩保留自己的评测日期,不把早期论文结果当成最新模型的能力上限。

一、能力边界:能完成任务,不等于能承担整项责任

先从自己的工作出发,而不是从榜单名称出发。下面是基于本文证据整理的使用边界,不是统一条件下测出的能力等级。

你希望 AI 做什么当前证据告诉我们什么建议怎样使用
理解资料、写作和分析已能在专业交付物评测中完成复杂输出;内容分析与呈现质量并不总是同步提高让它先做初稿,人核对关键事实与结论
回答知识问题、进行推理更强模型仍可能在不确定时给出错误答案要求附来源;重要结论独立核查
阅读长文档、图片、音视频部分模型已支持多种输入,但“放得进去”不等于“全部理解正确”用自己的长文件、图表和跨页问题测试
修改代码、运行工具有真实项目的代码和操作环境作为评测,但成绩依赖任务和运行方式提供明确目标,用程序自动检查功能,保留人工验收
执行客服、查询和业务流程查到信息、遵守规则、正确操作必须同时成立先开放查询与草拟,再逐步开放写入
持续推进模糊、多阶段项目软件演化与质量判断评测仍暴露明显困难拆成里程碑;让人决定需求、权衡与高风险动作

前两行有一个值得注意的反差:Artificial Analysis——一家直接运行模型评测的独立机构——在 9 月 1 日的报告中发现,Claude Fable 5.1 的专业工作表现很强,但知识问答准确率提高的同时,也更倾向于尝试回答不会的问题。回答更多、表达更完整,不必然意味着更知道自己的边界。评测原文

长文档也类似。Google 为 Gemini 3.8 Flash 发布的模型卡——即说明模型能力与限制的文档——确认它能接收文字、图片、音频和视频;但这是输入能力说明,不是“任何材料都能读懂”的承诺。文档也保留了生成错误信息等限制。官方模型卡

因此,我不会把 AI 笼统称为“初级工程师”或“专家顾问”。它的能力并不沿着人的职级整齐分布:某些难题做得很好,某个容易被人注意的约束却可能漏掉。

二、为什么还要验收:功能、流程与运行条件都影响结果

功能能运行,交付质量仍可能不合格

Senior SWE-Bench 是一套软件工程评测,不只检查功能是否正确,还检查改动是否符合项目规范、是否引入多余代码等质量要求。

官方 7 月 30 日更新中,Claude Opus 5 的功能正确通过率为 62.1%,同时满足质量要求的通过率为 34.7%。这两个结果来自同一模型、同一轮评测,比拿不同模型在两张考卷上的分数相减更有解释力。官方更新

它说明的不是“AI 只能做对三分之一工作”,而是:验收标准从“能运行”提高到“适合留下来维护”,会筛掉一批看似完成的结果。 这仍只是该任务集的结论,不能直接当作企业项目成功率。

查到正确答案,也不等于执行正确

τ-bench(读作 tau-bench)模拟需要对话、查询资料、使用工具并遵守业务政策的工作。它的 Banking 版本专门测试银行业务场景。

截至本文核验时,官方页列出的领先成绩是 Qwen 3.8 Max 的 55.2% 单次任务成功率。这不是银行知识考试分数,而是整个规定流程完成的比例。官方评测页

可以用一个假设的退款流程理解这个区别:AI 找到了订单,也知道退款规则,但如果漏掉身份核验就执行退款,文字回答再流畅,任务仍然失败。这个例子用于解释风险,不是该评测中的实测案例。

同一个模型,换了运行条件也可能换一个分数

模型外面还有一套执行框架,常被称为 Harness:它负责提供工具、保存任务状态、安排重试和检查结果。比较 Agent,实际常常是在比较“模型加执行系统”。

甚至考题本身也会影响结果。Terminal-Bench 测试 AI 通过文字命令操作电脑、完成实际任务。修订 2.0 版的题目后,同样的 Opus 4.6 + Claude Code 组合从 58.0% 变成 70.1%。这不是更换模型带来的提升。2.1 版修订说明

所以看一张成绩单,至少问三件事:考的是什么任务,用了什么系统,在哪个版本和条件下运行。 分数接近时,还应看多次运行的波动;不能把任何小分差都认定为领先,也不能一概认定为噪音。

三、模型怎么选:先看优势与代价,再看名字

下面不是总排名,而是供试用时参考的几种能力画像。这里的“推理档位”指允许模型投入多少思考与计算;同一模型的 high、xhigh、max 等设置可能产生不同结果,不同厂商的同名档位也不等价。

模型与评测时间值得关注的表现不能忽略的代价或边界
Claude Fable 5.1/Opus 5,9 月 1 日Fable 5.1 在综合评测中领先;部分专业交付物评测与 Opus 5 接近Fable 5.1 高档位更贵;被测服务启用了安全回退,部分请求转给其他 Claude 模型。来源
GPT-6 Astra,9 月 3 日在 Codex 执行系统中的编码任务表现与效率改善综合能力没有同等幅度跃升,部分长文档与知识工作项目反而回退;不能仅凭代际名称升级。来源
Muse Spark 1.3,9 月 2 日可用的 xhigh 档位兼顾较强综合成绩与较低任务成本更高的 max 档位仍是有限预览;长文档推理并非全面提升。来源
Gemini 3.8 Flash,9 月 2 日综合表现与任务成本的组合有竞争力,支持多种材料输入相比上一版,单题成本仍上升;较低的文字处理单价不保证总账单下降。来源
Qwen 3.8 Max,9 月 4 日核验在 τ³ Banking 官方榜的单次完成率领先这支持把它列入业务流程候选,不支持推断它在所有编码、写作和视觉任务上领先。来源

还应给开放模型留位置。开放权重指核心模型参数可以获取,不自动等于软件、数据和使用许可都完全开放。Senior SWE-Bench 的 7 月更新中,Kimi K3 与 MiniMax M3 呈现了较低输出费用与较低通过率之间的取舍;它们值得进入成本敏感任务的候选集,但这组旧成绩不能代替当前版本复测。官方对照

这些证据的共同含义是:前沿模型的优势开始分化,不是简单地一代全面替代一代。 表中的独立评测、官方公共榜也不是同一套考试,不能把各行成绩拼成总分。

四、下一阶段看什么:少看“能做”,多看“交付是否划算”

从上述证据,我更看好三个方向。以下是技术与产品推断,不是已经证实的市场规模、收益或岗位替代预测。

第一,AI 会更善于检查和恢复,而不只是生成。 检查器,也叫 verifier,是用测试、数据对账等方式确认工作是否完成的机制。任务状态的保存与恢复,则让 AI 出错后能从合适的位置继续。判断进步时,应看它是否减少返工、是否更早发现错误,而不只看一次演示是否漂亮。

第二,系统会按任务调配模型,而非始终使用最贵档位。 这种按难度选择模型的方式叫“模型路由”。它的价值需要用总账验证:调用费用降低了多少,额外判断、切换和人工纠错又花掉多少。多模型协作是一个选项,不是天然优于单模型。

第三,客户会更关心合格结果的成本。 Token 是模型处理文字等内容的计量单位,不是工作成果。即使单价不变或降低,如果模型思考更久、重试更多,完成任务也可能更贵。Gemini 3.8 Flash 的独立评测就记录了单价不变、每题费用上升的情况。成本分析

这三个方向能否成为持续的商业价值,要看实际使用中的人工返工、稳定复用和付费意愿。本篇的公开评测不足以证明企业已经普遍获得回报,更不足以推出某个岗位何时消失。

更值得观察的临界点是:在某类任务上,AI 能否持续达到约定的验收标准,并让包含人工复核在内的总成本下降。

五、现在怎样行动:用一小组真实任务代替一次演示

不必先学完所有评测。先选一组自己最近做过、能够判断对错的任务,让候选系统在相同资料和权限下完成,再回答三个问题:

  1. 做对了吗? 不只看成品是否好看,要查关键事实、计算和操作记录。
  2. 多做几次还可靠吗? 记录哪些任务稳定成功,哪些任务偶尔成功,哪些总要人接管。
  3. 算上复核,真的更省吗? 把等待、失败重试、人工检查与修正一起计入。

例如,一份报表的验收条件应是“数据与原表一致、公式可复算、异常值有说明”,而不只是“生成了一个文件”。先让 AI 做只读分析和未发布草稿;确认效果之后,再开放范围有限、可撤销的操作。

最终判断只有一句:AI 可以先接走可验收的任务;是否交出更大的责任,要由它在你的工作中积累的证据决定。


证据与评测:需要时再展开

以下八类评测用于支持前面的判断,不要求逐项记忆。它们考不同的能力,不能平均成“AI 总分”。

八类评测分别测什么?有哪些关键限制?
评测用普通话解释读分数时要注意
LiveCodeBench用持续收集的新编程题测代码生成、修正与推理要标明题目时间范围;算法题成绩不等于真实项目维护能力
SWE-bench Verified修复真实 Python 项目里的一个问题500 个经人工筛选的任务;默认 Bash Only 视图固定执行环境,不要与任意自定义系统混排
SWE-bench Pro处理更复杂、涉及更多文件的软件任务包含公开、留出和商业私有部分;公开榜不代表私有部分,原始论文成绩也不是当前上限
SWE-EVO按版本更新要求持续修改一个项目v6 论文只有 48 个任务;用于观察长程困难,不用于给所有软件工作定级
Senior SWE-Bench不只把功能做出来,还要符合项目质量标准7 月更新采用多次运行与模型评委组合,默认计分排除 5 个任务;不能与 6 月旧榜直接计算进步幅度
Terminal-Bench 2.0/2.1在命令行中操作软件、处理数据、生成可检查的结果2.1 修订了 89 题中的 28 题;后续 4.0 也更改任务与资源,必须重新运行,不能跨版本混比
τ-bench一边和用户沟通,一边查询资料、按规则操作系统不同版本和业务领域要分开;本文 55.2% 来自 τ³ Banking 官方页,不是所有业务的平均值
GAIA搜索、阅读文件并用工具解决多步骤问题公开测试榜展示最佳一次运行;高分属于指定系统和任务集,不代表所有通用助手工作的可靠性

两个容易误读的数字。 SWE-EVO v6 报告 GPT-5.4 + OpenHands 为 25%,同时引用 GPT-5.2 在 Verified 的 72.8%。模型与考题不同,不能把差值解释为同一系统进入长任务后的能力损失。论文

GAIA 测试榜的领先分数达到 93.36%,对应具体的工具与模型组合,而且榜单采用最佳一次运行。这说明在那套任务上的高水平系统表现已经出现;没有单模型与多模型的受控实验,不能把高分全部归因于多模型协作,也不能外推成通用办公成功率。官方榜说明

想进一步选型:怎样区分“偶尔成功”和“稳定成功”?

单次成功率(pass@1):每项任务尝试一次,平均有多少能够完成。

至少成功一次(pass@3):同一任务给三次机会,至少一次完成。它更接近“多试几次,能不能做出来”。

三次全部成功(pass^3):同一任务运行三次,三次都完成。它更接近“重复交给它,是否稳定”。后二者不是同一个指标。τ-bench 论文Senior SWE-Bench 指标说明

平均单次成功率不能直接连乘,算出多次或多步骤成功率。比如,假设 90% 的任务始终成功,10% 始终失败,那么三次全部成功的比例仍是 90%。真实系统还会检查、重试与恢复,应直接测量完整流程,而非用简化公式代替实验。

团队需要更严谨的比较时,再拆成五层:

层次核心问题
模型同样的工具和预算,换模型有多大变化?
执行框架同样的模型,换任务拆分、工具或检查方式有多大变化?
运行环境失败是模型不会,还是网络、资源或超时造成的?
考题与验收任务说明是否充分,测试是否漏检或误判?
真实工作算上人工复核和失败损失,质量、时间与成本是否改善?

“每个合格结果的成本”应包括失败任务的费用和人工返工;本文引用的评测机构“平均每题成本”不是这个指标,也不是企业上线后的完整成本。更详细的设计见《Agent 体系评测深度研究报告》

修订说明(2026-09-04):本版替换了 Senior SWE-Bench 的过时镜像数据,撤回跨模型、跨任务集的成功率跌幅解释,并修正了任务成功率与步骤成功率混用的问题。原有榜单细节改为按需展开;模型画像补充至 9 月 3 日发布的评测。榜单页面会继续变化,文中结果均应连同日期与运行条件阅读。

← 返回文章目录沿主题继续阅读 →