WRITING ARCHIVE

写作留下的,
不只是结论。

从时间出发,查看每个判断在何时被写下。热力图按真实发布日期统计,时间线保留文章当时的状态。

写作热力图

过去 53 周的发布节奏

48 ENTRIES

时间线

按发布时间倒序

01 MONTHS

2026年9月

48 篇
  1. Agent 评测(三):先把题目和裁判做对,再谈排行榜

    用分层样本、独立验收和评委校准建立可复用评测集,明确公开基准的用途与边界。

    文章6 min生长中
  2. Agent 评测(四):把一次打分变成可重复的回归系统

    连接任务、试次、证据、评分与版本门禁,提供无需模型密钥的本地教学验收脚本。

    文章5 min生长中
  3. Agent 评测(二):成功率、稳定性与成本,不能揉成一个分数

    正确区分 pass@k 与 pass^k,明确任务分母、失败成本和轨迹诊断边界。

    文章6 min生长中
  4. Agent 评测(五):高分为何不能直接兑换更大的行动权

    从评分契约、代理指标和分布变化重新理解评测,讨论上线范围、风险与组织责任。

    文章6 min生长中
  5. Agent 记忆设计(四):一条记忆开始跨团队流动之后

    从团队资产、Loadout 与 ACL 到删除传播和评测,检验长期记忆的治理边界。

    文章7 min生长中
  6. Agent 记忆设计(三):找到相关记忆,只完成了一半

    比较混合检索、目录导航与上下文装配,说明授权过滤、时间有效性和预算的不同责任。

    文章7 min生长中
  7. Agent 记忆设计(五):长期记忆的价值,在于能够改变认识

    从写入、检索和治理回到整体,讨论记忆的可修正性、知识污染与组织学习。

    文章8 min生长中
  8. Agent 记忆设计(二):保留历史,还是维护当前事实

    比较追加、合并和分层提炼的写入策略,建立有效时间、来源和纠错契约。

    文章7 min生长中
  9. AI 产品价值(二):测试通过之后,还需要哪些交付证据

    以登录超时修复为例,定义独立验收、缺陷检出与人工审查成本。

    文章7 min生长中
  10. AI 产品价值(四):文件能打开,为什么仍然不能交付

    用月报案例建立范围、数字、来源、编辑性和权限的独立验收链。

    文章8 min生长中
  11. AI 产品价值(五):能力进步,为什么未必等于交付变便宜

    统一成功率、费用与人工投入的口径,反思局部指标、审核瓶颈和净交付价值。

    文章8 min生长中
  12. AI 产品价值(三):听懂一句话,不等于改对一个闹钟

    从语音链路到设备终态,定义关键实体、时延、打断与重复执行的验收。

    文章7 min生长中
  13. 万级能力路由(二):从能力描述到检索与正文精排

    展开发现层:能力如何被描述、索引、召回与精排,以及怎样验证正文和检索策略的实际价值。

    文章8 min生长中
  14. 万级能力路由(四):用评测与治理建立生产信心

    把检索、方案、执行和结果分开评测,用授权、状态与版本治理明确自动执行的边界。

    文章9 min生长中
  15. 万级能力路由(三):从候选列表到可执行方案

    展开发现之后的方案选择:Skill 加载、MCP 调用、Agent 委派如何保留各自语义,并处理依赖与失败。

    文章9 min生长中
  16. 万级能力路由(五):重新理解路由——受约束的任务决策

    回到整个体系:为什么路由是受约束的任务决策,为什么局部最优不等于有效能力,以及复杂度应如何增长。

    文章9 min生长中
  17. Claude Code 产品设计(五):Agent 产品真正设计的是责任,而不只是操作

    从任务、信任和协作回到系统层面,讨论监督成本、证据债务与自动化的边界。

    文章6 min生长中
  18. Claude Code 产品设计(四):并行和跨端,首先是状态管理问题

    拆解 Worktree、上下文寿命、可组合扩展和远程控制,避免把聊天并发当成任务隔离。

    文章8 min生长中
  19. Claude Code 产品设计(二):从一句需求,到一条可以干预的任务旅程

    通过调用链、用户旅程、KANO 与任务契约,理解渐进披露和长任务交互。

    文章9 min生长中
  20. Claude Code 产品设计(三):少一点确认,不等于少一点边界

    区分权限模式、执行隔离和结果验证,用决策表取代线性的权限升级阶梯。

    文章7 min生长中
  21. DeepSeek Harness 架构(二):插件怎样出现、协作,并真正退出

    拆解 Cordis Effect、依赖、Waterfall、Profile 与 Preset,并通过能力接口控制替换成本。

    文章9 min生长中
  22. DeepSeek Harness 架构(四):工具、PTC 和多 Agent,怎样不放大副作用

    从冻结参数、单调 Guard、并发分类到沙箱边界,理解可扩展执行的约束。

    文章10 min生长中
  23. DeepSeek Harness 架构(三):历史不能丢,模型又不能看全部历史

    用 Turn、Step、Session Event 与上下文投影,理解恢复、压缩和多视图一致性。

    文章8 min生长中
  24. DeepSeek Harness 架构(五):自由不会消灭复杂度,它会改变复杂度的归属

    从生命周期、事实、权限和运行组合的责任,反思动态 Agent Runtime 的收益与代价。

    文章8 min生长中
  25. 产品分析框架(五):让一次发布留下结果,也留下可复用的认识

    用 OKR、复盘和决策记录,把版本投入转化为可检查的结果与下一轮学习。

    文章6 min生长中
  26. 产品分析框架(四):用户真的得到价值,生意才有机会成立

    用漏斗与根因假设定位价值断点,再用商业模式与成本口径检验持续性。

    文章8 min生长中
  27. 产品分析框架(二):从市场很大,到我们为什么能做

    串联 PEST、五力、TAM/SAM/SOM、SWOT 和价值曲线,形成可验证的进入策略。

    文章8 min生长中
  28. 产品分析框架(三):从用户旅程到一次有边界的发布

    用 KANO、用户旅程、RICE 和 MoSCoW,把用户证据变成可解释的版本选择。

    文章7 min生长中
  29. 产品分析框架(六):框架的终点,不是确定性,而是更好的判断

    回看 MeetFlow 的完整决策链,讨论代理指标、反证、证据成本与框架的适用边界。

    文章7 min生长中
  30. Agent 记忆设计(一):先把记忆放回完整生命周期

    从证据、提炼、演化、检索和治理理解三类开源记忆方案,建立系统骨架。

    文章6 min生长中
  31. AI Agent 八强竞品全景:谁在卖模型,谁在造 Harness,谁在争夺工作入口

    Claude Code、Codex、Kimi、WorkBuddy、豆包工作与 Hermes、Pi、DeepSeek Harness 并不处在同一条赛道。本文用三层市场、九个维度和一套选型方法重新理解 2026 年 Agent 竞争。

    文章23 min生长中
  32. AI Agent 的可靠性边界:Skills、RAG 与权限能解决什么

    从上下文、证据、执行和治理四个层面拆解 Agent 的可靠性瓶颈,对比 Claude Code、Codex、Kimi 与 WorkBuddy 的实际作用,并给出可验收的落地路径。

    文章16 min生长中
  33. AI 产品价值(一):先看交付结果,再给算法能力找位置

    从领域、任务、模型和系统建立能力地图,用三层指标连接算法诊断与产品价值。

    文章8 min生长中
  34. 万级能力路由(一):先看清 MCP、Skill 与 Agent 的系统全景

    从一张全景图理解能力供给、发现、方案选择、执行与反馈,为五篇系列建立统一架构。

    文章8 min生长中
  35. 国内办公 Agent 三强:Kimi Work、WorkBuddy、豆包工作,谁更接近“交付工作”

    从知识研究、办公制品、本地电脑、企业连接、多模态、长期任务与安全治理出发,对比 Kimi Work、腾讯 WorkBuddy 与豆包工作,并解释它们为何不该简单复制 Claude Code 和 Codex。

    文章28 min生长中
  36. Claude Code 产品设计(一):先看任务、执行与证据三个闭环

    从业务对象和模块职责理解 Claude Code,先搭架构骨架,再进入交互与实现。

    文章7 min生长中
  37. Coding Agent Harness 对决:Claude Code、Codex 与三种开源答案

    为什么相同模型装进不同 Harness 会像不同产品?从 Agent Loop、上下文、工具、验证、安全、并行和扩展七层,对比 Claude Code、Codex、Kimi Code、Hermes、Pi 与 DeepSeek Harness。

    文章31 min生长中
  38. DeepSeek Harness 架构(一):先理解能力组合与事实记录这两条主线

    从组合、执行、事件和治理建立高层地图,理解全插件运行时在解决什么问题。

    文章5 min生长中
  39. ECC 架构深度解读:把 AI 编程经验编译成可移植的工程系统

    从源码出发拆解 Everything Claude Code 的资产层、安装编译器、Hook 运行时、记忆与学习系统、安全边界及 ECC 2.0 控制平面,并分析它真正解决的问题与架构代价。

    文章28 min常青
  40. Hermes Agent 架构深度解读:一个会积累经验的个人 Agent OS

    从 Agent Loop、Prompt 分层、四类记忆、工具运行时、子 Agent、Gateway 与安全边界出发,拆解 Hermes Agent 的真实架构,并解释“自我进化”究竟发生在哪里。

    文章26 min生长中
  41. 2026 年的 AI 到底能做什么?从模型能力到 Agent 交付边界

    先判断哪些工作能交给 AI,再读懂评测依据。用八类基准与最新模型画像,理解 AI 的能力、边界和下一阶段机会。

    文章12 min生长中
  42. Pi 架构深度解读:把 Coding Agent 做成可改造的最小内核

    从模型适配、Agent Loop、Session 事件树、上下文压缩与扩展系统出发,拆解 Pi 如何用机制与策略分离构建极简 Harness,并分析其正在演进的分布式架构。

    文章24 min生长中
  43. Agent 评测(一):先搭一张从任务到上线决策的地图

    先理解任务契约、运行环境、证据、评委与发布决策,再进入指标和工程实现。

    文章6 min生长中
  44. 从“做产品”到“组织未知”:陆奇谈研究型创业者

    从生产力重组、NeoLab 组织范式到研究、创新与斜率三种思维,重新理解 AI 时代如何完成从 -1 到 1。

    文章14 min生长中
  45. TRACE 深度精读:从“答对”走向“可信地答对”

    拆解 TRACE 的轨迹效用、证据扎根、陷阱恢复与脚手架评测,并审视它从论文指标走向生产评测时必须补上的边界。

    文章22 min常青
  46. Anthropic Harness 建设

    从 Claude Code、Claude Agent SDK 与 Anthropic 官方工程实践出发,拆解 Agent Harness 的核心原理、产品架构、安全边界与建设路径。

    文章20 min常青
  47. 产品分析框架(一):先知道要做什么决定,再选择框架

    以 MeetFlow 为主线,把战略、需求、增长、商业和复盘放回一张决策地图。

    文章7 min生长中
  48. OpenAI 与 Anthropic 的产品实践:AI 时代产品经理的角色变迁

    在 Agent Harness 时代,产品经理如何把不确定的模型能力,转化为可验证、可控制、可持续演进的工作系统。

    文章18 min生长中