← 全部文章
AI Agent

让 Agent 真正干活的,是工程纪律

2026-07-07

2026 年一开年,有个概念在 AI 工程圈里几乎同时冒了出来:Harness Engineering。有意思的是,把它摆上台面的不是某一家,而是四家——OpenAI、Anthropic、LangChain,还有 Martin Fowler。四个来源各写各的定义,措辞都不一样,但落点收敛到同一个等式:

Agent = Model + Harness。

很多人第一反应是:Harness 是不是又一个 Agent 框架,像我们熟悉的那几个?不是。这正是它最容易被误读的地方。

框架管”怎么思考”,Harness 管”在哪里安全地思考”

框架解决的是 Agent 内部的推理链路——怎么拆任务、怎么组织推理、怎么调工具。Harness 解决的是另一层:这个会自己动手的家伙,该被放在一个什么样的环境里,才既能干活、又不会闯祸。

LangChain 有句话说得直白:模型里装的是智能,harness 是让这份智能真正变得可用的那套系统。换句话说,模型再聪明,也得有人给它搭好台子、划好边界、接好线,它才能在真实生产里稳定交付。

生产环境里,大部分代码不是 Agent 逻辑

这里有个反直觉的事实:在一个真正跑起来的产品里,围着 Agent 转的大部分代码,其实不是”智能”本身,而是托住智能的那一圈工程。四家来源侧重不同,却不约而同地圈出了同样五项能力。

第一是隔离。Agent 得在一个安全边界里动手,出了岔子不会污染到外面。第二是可观测。它每一步在想什么、调了哪个工具、花了多少,都得能回溯,而不是一个黑箱。第三是状态能续。长任务跨过一个又一个上下文窗口,不能走到一半把前面全忘了。第四是质量门禁——用检查工具、结构化测试、架构边界,把规则机械化地强制住。第五是留一条人类通道,Agent 搞不定的时候能停下来,把关键决定交回给人。

约束不是刹车,是加速器

五项里最反直觉的是第四项。我们通常觉得,规矩多了会拖慢速度。但这几家的共识恰恰相反:约束是加速器。

OpenAI 的说法是,严格的分层架构,才是那种”跑得快又不腐化”的前提。这种架构过去往往要等到上百人的团队才做,而现在这个阶段,得提前做。LangChain 则摆了个数字:同一个模型,只是换上一套更好的 harness,基准测试的通过率就从 52.8% 抬到了 66.5%。模型一点没变,变的只是它周围那套工程。

做过现场的人,会觉得这套逻辑眼熟

如果你在制造业车间待过,这个道理并不新鲜。标准化从来不是为了扼杀工人的发挥,而是让发挥落在一个可预期的边界里——有约束才可预期,可预期才有确定性和安全感。

Harness 干的,本质上就是把这套约束哲学,翻译成 AI Agent 时代的工程实现:用机械化的门禁,替代靠人来盯的监督;用全程可观测,替代”我相信它没问题”的信任假设;用一步步按需展开,替代把所有信息一股脑塞给它。

所以,在追下一个更强的模型、更火的框架之前,也许更值得先问自己一句:真正卡住你的,是模型不够聪明,还是你还没给它搭好那套托得住的纪律?