Appearance
我现在对 AI / Agent 开发的一个更合适比喻
最近一直在想,怎么用一个更贴切的比喻来理解 AI / Agent 开发。
一开始我自己的感觉是:
AI 很强,什么都能做,但没有方向。我们要把复杂事情拆成一步步,在每一步里不断告诉它该怎么做、不该怎么做,最后让它从起点走到终点。
这个理解大方向没错,但总觉得还差一点。
后来想明白了,更合适的比喻其实不是“小球进管道”,而是:
AI 像一个能力很强、反应很快,但缺少稳定业务判断的新员工。
这个比喻比“小球和管子”更贴近真实开发场景。
为什么“小球和管子”的比喻不够贴切
“小球和管子”的比喻强调的是:
- 给它轨道
- 给它约束
- 让它从起点走到终点
这个方向本身没问题,但它更像一个物理系统。
而 AI / Agent 真正麻烦的地方,不只是“它会乱跑”,而是:
- 它会自作聪明
- 它会脑补你没说清的部分
- 它会输出一堆看起来很合理,但其实不对的内容
- 它不会天然知道哪一步能自己拍板,哪一步必须停下来问人
所以,AI 更像是一个“会做事,但不够稳”的参与者,而不是一个被动小球。
更合适的比喻:AI 像一个很强但不够稳的新员工
这个新员工有什么特点?
1. 能力强,反应快
你给它一个任务,它很快就能给你一版东西。
比如:
- 写个摘要
- 拆个任务
- 列个验收标准
- 总结风险点
它大概率都能马上产出。
2. 但不天然懂真实业务边界
它不知道:
- 哪些东西你其实还没想清楚
- 哪些地方不能自己拍板
- 哪些隐含规则是团队默认的
- 哪些边界条件没写出来但必须考虑
3. 它容易“像对了”,不一定“真对了”
这点特别关键。
AI 最大的问题往往不是完全胡说,而是:
输出看起来很顺、很完整、很像那么回事,但其实关键地方偏了。
这比传统报错更难处理。
如果把 AI 看成一个新员工,那 AI / Agent 开发本质上在做什么?
如果真是带一个新员工做事,那我们要做的事情就一下子变得清楚了。
一、先把大任务拆成小任务
你不能上来就说:
你把这个复杂系统做完。
这太空了。
你更可能会这样安排:
- 先把需求总结清楚
- 再划定这次范围
- 再拆子任务
- 再列验收标准
- 再把不确定的地方单独列出来
- 最后再进入开发或评审
这一步,对应的就是:
Workflow / Orchestration
也就是:
不是让 AI 直接完成一切,而是把复杂任务拆成多个阶段。
二、把工作规范说清楚
带新员工干活,不能只说“做这个”。
你还要把要求讲清楚:
- 输出要按什么结构来
- 不确定的地方不能自己猜
- 哪些点必须重点关注
- 哪些边界不能越过
- 哪些结果必须能直接给研发使用
这一步,对应的就是:
Harness
也就是:
给 AI 加规则、格式、边界和约束,不让它自由发挥到失控。
三、关键节点必须 review
你不能指望新员工一口气做完所有内容再交付。
中间总有几个关键点要停一下看一眼。
比如:
- 你理解的目标是不是对的
- 本次范围是不是收住了
- 子任务有没有漏关键流程
- 验收标准是不是空话
- 哪些地方其实还要继续确认
这一步,对应的就是:
Human-in-the-loop
也就是:
人在关键位置不是可选项,而是工作流本身的一部分。
四、出错以后不能只说“这次不行”
带新员工最怕的,不是出错,而是出错以后只说一句:
这版不行,你再来一次。
这样没有积累。
更好的方式是复盘:
- 这次到底哪里错了
- 是理解偏了,还是规则没给够
- 是输出结构没约束住,还是流程里少了检查点
- 是不是这类问题以后可以提前拦住
这一步,对应的就是:
Eval + 失败归档 + 优化闭环
也就是:
不是只看结果有没有出来,而是要看结果质量,并把失败变成后续优化输入。
这个比喻下,几个核心概念分别是什么
如果继续沿用“新员工”这个比喻,那前面那些抽象概念就可以这样理解。
Prompt
像你在给新员工下达具体任务时说的话。
你交代任务的方式,会直接影响它做出来的结果。
Harness
像团队里的工作规范、模板、注意事项、检查规则。
它不是结果本身,但它会决定结果会不会跑偏。
Workflow
像项目推进流程。
先做什么,后做什么,哪一步停下来 review,都属于这里。
Human-in-the-loop
像关键节点的负责人 review。
有些地方新人可以自己做,有些地方必须让你拍板。
Eval
像你对交付结果的判断标准。
不是“看起来不错”就算过,而是要判断是不是能真正拿去用。
还有一个更偏工程化的比喻
如果不想用“新员工”这种更偏人的比喻,也可以换一个更偏技术系统的版本:
AI 像一台马力很大的发动机,但没有方向盘、刹车和仪表盘。
它有能力,很能跑。
但如果你不补上这些东西,它就很危险。
方向盘
对应的是:
- Workflow
- Orchestration
决定它往哪走。
刹车
对应的是:
- 人工确认点
- BLOCK
- RETRY_SUGGESTED
- 回滚机制
决定它什么时候必须停下。
仪表盘
对应的是:
- Eval
- 自动校验
- 失败案例归档
决定你能不能看见它到底跑得对不对。
限速器和护栏
对应的是:
- Harness
- 规则
- 输出结构
- 权限约束
决定它不能随便越界。
这个比喻更适合偏技术表达,但我自己还是更喜欢“新员工”的版本,因为它更容易把“自作聪明、像对了但不真对”这种感觉说清楚。
我现在更认可的一句话
如果让我把现在对 AI / Agent 开发的理解压成一句话,我会更愿意这样说:
AI / Agent 开发,不是让 AI 自己把事情做完,而是像带一个能力很强但不够稳的新员工:把任务拆清楚,把规则讲清楚,把关键检查点放清楚,出错后再复盘为什么错、下次怎么改。
这句话里其实已经包含了:
- Prompt
- Harness
- Workflow
- Human-in-the-loop
- Eval
- 优化闭环
也更接近我现在真正想学会的东西。
结尾
所以回头看,之前那个“小球进管道”的理解不能说错,但还是偏机械了一点。
更准确的理解应该是:
AI 不是一个等你控制的小球,而是一个能力很强、会主动输出、也会主动犯错的执行者。
而我们做 AI / Agent 开发,本质上就是:
- 给它任务分工
- 给它规则边界
- 给它检查点
- 给它失败后的处理方式
- 让它从“会干活”慢慢变成“能稳定干对活”
这才是我目前觉得更贴切、也更适合长期拿来指导自己学习和做项目的比喻。