什么是 Harness Engineering?

📌 一句话理解:Harness Engineering 就是给 AI 搭一套它能自己干活的工作环境——不只是告诉它做什么,而是让它有工具、有规则、有反馈,能独立把活儿干完。


1. 背景:一条清晰的技术演进路线

理解 Harness Engineering,得先看 Agent 开发者走过的三个阶段:

阶段核心问题在干什么
2024 年:提示词工程怎么写好一段提示词?教模型"听懂话"
2025 年:上下文工程怎么让模型看到完整信息?给模型构建完整信息环境
2026 年:Harness Engineering怎么让 Agent 真正能干活?给 Agent 搭一整套可运行的工程环境

这条路线本质上是不断升级的:从优化"单次输入"→"输入环境"→"整套工作系统"。


2. 核心概念:Agent = Model + Harness

模型提供智能,Harness 让这个智能变得有用。

Viv(LangChain 工程师)给出了一个很技术的定义:

Agent = Model + Harness

Harness 这个词直译是"马具"——一匹马很强壮,但没有马鞍、缰绳、马镫,你骑不了它。AI 模型也一样,它很聪明,但没有一套装备,它无法真正干活。

换个说法:

  • 提示词工程 → 教模型听懂话
  • 上下文工程 → 让模型看到全貌
  • Harness Engineering → 给 Agent 搭一套能自己干活的工作环境

3. Harness 到底是什么?

Harness 不是某个具体工具,而是一套工程环境的总和,包含三个核心要素:

① 设计环境(Environment Design)

AI 需要在一个结构清晰的地方工作。

  • 代码仓库怎么组织
  • 文档放在哪
  • 规范和约定怎么让 AI 知道

核心问题:你的架构约束是写在文档里,还是只存在于口头约定中?

② 设定标准(Standards & Acceptance Criteria)

AI 需要知道什么算"做完"。

  • 清晰的验收标准
  • 任务完成的定义
  • 代码规范和架构规则

核心问题:你的测试能被自动运行,还是需要人手动触发?

③ 建立反馈(Feedback Loops)

AI 需要能看见自己的结果,并自我修正。

  • 生成内容后自动检查
  • 设定检查点,分阶段验收
  • 错了不是重新开始,而是告诉它"哪里不对、怎么改"

核心问题:你的设计决策有记录,还是散落在聊天记录里?


4. 标杆案例:OpenAI 100 万行代码实验

最能说明 Harness Engineering 威力的案例,来自 OpenAI 的一个持续五个月的内部实验:

3 名工程师 + 5 个月 + 0 行手写代码 = 100 万行代码的真实产品

关键细节:

  • 没有一行代码是人工编写的(应用逻辑、测试、CI 配置、文档、可观测性、内部工具,全是 Codex 写的)
  • 有内部日活用户,有外部 Alpha 测试者
  • 经历了完整的交付、部署、故障和修复流程
  • 整个过程只用了纯手写代码所需时间的 1/10

工程师做了什么?

他们没写代码,但做了三件事:

  1. 设计环境 → 空的 Git 仓库开始,定义代码组织方式
  2. 设定标准 → 严格的架构规则(如代码只能按 Types → Config → Repo → Service → Runtime → UI 方向依赖)
  3. 建立反馈 → 违反规则的代码会被自动拦截

OpenAI 自己的总结:

“我们当前最棘手的挑战集中在设计环境、反馈回路和控制系统方面。”


5. Anthropic 的实践:让 AI 学会自我检查

Anthropic 工程师 Prithvi 发现了另一个关键问题:AI 评估自己的工作完全不靠谱——不管做得好不好,AI 给自己的评价永远是"很好"。

他的解决方案是把生成和评估拆成两个 AI

  • 生成器:负责干活
  • 评估器:拿到工具,能实际操作生成结果(点按钮、填表单、截图),对照标准打分,给出详细反馈

这样来回 5-15 轮,最终交付质量完全不在一个档次。

对比数据:

单 AI 跑 20 分钟完整 Harness 跑 6 小时
成本$9$200
交付物看着行,实际用不了真正能用的游戏,有精灵动画、AI 集成、导出功能

6. 从哪开始?三步走

Mitchell Hashimoto(HashiCorp 联创)给的定义简洁有力:

每当你发现 Agent 犯了一个错误,你就花时间设计一个解决方案,使 Agent 永远不再犯同样的错误。

不要试图一次性搭完美的 Harness。选一个你每周都要重复做的任务,三周推进:

目标具体做什么
第一周整理环境整理文件结构和规范,让 AI 知道去哪找东西
第二周设定标准设定验收标准,让 AI 知道什么叫"做完"
第三周建立反馈建立反馈机制,让 AI 能自我检查和修正

核心理念:每次 AI 出错,不是责怪它,而是问——“我的环境里缺了什么?”


7. 总结:为什么 Harness Engineering 会持续火?

一句话回答:

当你想让 Agent 真正干活的时候,你会发现 Agent 的瓶颈已经不在模型了,而在你给模型搭的那套环境。

给你的代码、数据、文档、测试、反馈回路搭建好,让它们对 AI 可读、可执行、可迭代——这是 Harness Engineering 要解决的核心问题。

模型包含智能,Harness 让这个智能变得有用


参考来源

Logo

这里是“一人公司”的成长家园。我们提供从产品曝光、技术变现到法律财税的全栈内容,并连接云服务、办公空间等稀缺资源,助你专注创造,无忧运营。

更多推荐