← 返回列表

Agent 现在面临的三大工程问题

Agent 当前的瓶颈不在智能,而在工程:可靠性、成本和可控性,这三个问题决定了 Agent 的落地质量。


核心判断

根据 LangChain 2026 年的调查,57% 的受访者已经有 Agent 在生产环境运行,但 32% 仍然把"质量"列为进入生产的最大障碍。Agent 能做事,但 doing it reliably 还是硬题

57%
已有 Agent 在生产环境
32%
仍把"质量"列为最大障碍
3
核心工程问题

这三个问题正是推动 Harness Engineering 出现的根本原因——它们无法靠"换一个更强的模型"来解决。

问题 01
可靠性
长链条执行很容易在任何一步失败,而且失败之后缺乏好的恢复机制:
  • 第 1 步对,第 2 步错 → 整个任务失败
  • 工具调用返回意外格式 → 后续步骤崩溃
  • 网络超时 → 某个步骤卡住,整个链路挂起

问题的本质不是单步的模型能力,而是系统没有好的错误恢复机制。模型越强,单步成功率越高,但系统级的容错(网络超时、API 故障、权限错误)无法通过模型强度解决。
问题 02
成本
多步骤执行 = 多次模型调用 = 费用高,而且这个等式不会因为模型变强而改变:
  • 10 步任务 = 至少 10 次 LLM 调用
  • 用强模型(Claude Opus)→ 成本很高
  • 用便宜模型(Claude Haiku)→ 某些步骤失败率太高

真正的解法是智能路由:在整个任务链里,哪些步骤需要强模型?哪些步骤用便宜模型就够?这需要系统级的优化,不是单点的模型选择。
问题 03
可控性
Agent 自主决策,但自主不等于安全:
  • Agent 决定"转账 100 万元" → 需要人工审批,不能自动执行
  • Agent 决定"删除用户所有数据" → 不可逆操作,必须确认
  • Agent 的决策过程是黑箱 → 不知道为什么选择了行动 X

更强的模型反而可能更自主,更难控制。可控性问题是治理问题,永远无法通过模型能力解决。

三个问题都指向同一个方向

这三个问题有一个共同特征:它们都是系统级问题,而不是模型级问题。解决可靠性需要错误恢复机制和检查点;解决成本需要智能路由和模型选择策略;解决可控性需要人工介入节点和审批工作流。

这就是 Harness Engineering 被创造出来的原因:Agent 能力强 ≠ 系统质量高。即使是最强的 Agent,如果 Harness 设计差,生产环境依然不稳定。

Agent 产品评估框架:评估一个 Agent 产品,不要只看它能做什么,要看它的 Harness 设计——失败了怎么恢复?高风险操作有没有人工节点?成本有没有优化路径?这三个问题的答案,决定了产品是 demo 还是生产系统。