5 chapters · A connected inquiry

Agent 评测

把成功率还原为任务、样本、证据与回归,不让一个高分替代上线判断。

5 篇 · 总阅读约 29 分钟,实践另计
最近修订 2026.09.05

从第一篇开始

阅读目录

先看全景,再把细节连起来
  1. 01

    建立全景

    先搭一张从任务到上线决策的地图

    先理解任务契约、运行环境、证据、评委与发布决策,再进入指标和工程实现。

    6 min
  2. 02

    拆解与实践

    成功率、稳定性与成本,不能揉成一个分数

    正确区分 pass@k 与 pass^k,明确任务分母、失败成本和轨迹诊断边界。

    6 min
  3. 03

    拆解与实践

    先把题目和裁判做对,再谈排行榜

    用分层样本、独立验收和评委校准建立可复用评测集,明确公开基准的用途与边界。

    6 min
  4. 04

    拆解与实践

    把一次打分变成可重复的回归系统

    连接任务、试次、证据、评分与版本门禁,提供无需模型密钥的本地教学验收脚本。

    5 min
  5. 05

    回到整体

    高分为何不能直接兑换更大的行动权

    从评分契约、代理指标和分布变化重新理解评测,讨论上线范围、风险与组织责任。

    6 min

The question stays open

终篇不是句号。带着新的理解,回头检查第一篇的地图。

寻找下一条阅读路径 →