Prompt Engineering → Context Engineering → Harness Engineering → Loop Engineering


摘要

本研究系统梳理了 2022 年至 2026 年间 AI 工程领域经历的四次重大范式跃迁:从Prompt Engineering(提示工程)Context Engineering(上下文工程)Harness Engineering(驾驭工程)到最新的Loop Engineering(循环工程)。研究发现,这四个阶段构成了一条清晰的演进路径:人类角色从 “直接指令者” 逐步向 “系统设计者” 迁移,AI 系统的自主性持续增强,工程关注点从单次交互质量转向系统级可靠性与自主运行能力。本文详细阐述了每个阶段的核心概念、起源时间、关键技术、方法论与代表性工具,深入分析了阶段间的演进逻辑与技术转换关系,并对未来发展趋势进行了预测。

关键词:大语言模型;提示工程;上下文工程;驾驭工程;循环工程;AI 智能体;工程范式


1. 引言:AI 工程范式的演进脉络

2020 年 GPT-3 的发布标志着大语言模型(LLM)时代的开启。此后六年,AI 应用开发经历了四次清晰可辨的工程范式跃迁,每一次都代表着人类与 AI 协作方式的根本性变革 [1][7]。这四次跃迁并非简单的技术迭代,而是工程关注点持续向外层迁移的系统性演进:

  • 内层(模型层):关注如何与模型对话 → Prompt Engineering

  • 信息层:关注给模型什么信息 → Context Engineering

  • 系统层:关注模型运行的环境约束 → Harness Engineering

  • 架构层:关注系统如何自主运行 → Loop Engineering

这条演进路径本质上是 “人类逐步退场” 的历史:从每一步都需要人工干预,到设计让系统自主运行的循环机制 [4][10]。理解这四个阶段的演进逻辑,对于把握 AI 工程的未来发展方向具有重要的理论与实践价值。


2. 第一阶段:Prompt Engineering(提示工程)

2.1 核心概念与定义

Prompt Engineering(提示工程) 是通过精心设计自然语言输入(Prompt)来引导大语言模型产生期望输出的技术与方法论。其核心假设是:相同的模型,通过不同的提问方式,可以获得质量差异巨大的结果 [5][6]。

正式定义:Prompt Engineering 是一门探索如何通过优化输入文本的措辞、结构和内容,来最大化 LLM 在特定任务上表现的工程学科 [^9]。

2.2 起源与发展时间线

时间 里程碑事件
2017 Transformer 架构发表(“Attention Is All You Need”),奠定技术基础 [^5]
2018-2020 前提示词时代:BERT/GPT-2 开启零样本 / 少样本学习探索 [4][8]
2020 年 6 月 GPT-3 发布,首次展示纯文本提示的强大能力,Prompt Engineering 概念萌芽 [6][9]
2022 年 11 月 ChatGPT 发布,Prompt Engineering 进入大众视野,成为全民技能
2023 年 思维链(CoT)等技术成熟,Prompt Engineering 系统化
2023 年底 - 2024 年 自动化提示工程(APE)出现,开始向系统化演进 [^2]

2.3 关键技术点

2.3.1 基础提示技术
  • 角色设定(Role Prompting):为 AI 分配特定专业角色,如 “你是一名资深软件工程师”

  • 指令清晰化:使用明确、具体、无歧义的任务描述

  • 格式规范:指定输出格式(JSON、Markdown、代码等)

2.3.2 高级推理技术
  • 思维链(Chain-of-Thought, CoT):“让我们一步步思考”,引导模型展示推理过程 [^6]

  • 少样本提示(Few-shot):提供 N 个示例让模型学习模式

  • 思维树(Tree-of-Thought):多路径探索与回溯

  • 自一致性(Self-Consistency):多采样投票选最优答案

2.3.3 优化方法论
  • 温度参数(Temperature)调节:控制创造性与确定性的平衡

  • 迭代优化:基于输出反馈持续改进 Prompt

  • A/B 测试:量化对比不同 Prompt 的效果

2.4 代表性工具与框架

工具 / 框架 发布时间 核心功能
OpenAI Playground 2022 官方 Prompt 调试平台
LangChain Prompt Templates 2022.10 提示词模板化与复用
PromptPerfect 2023 自动 Prompt 优化工具
DSPy 2023.08 声明式提示编程框架
GPT-4 Advanced Data Analysis 2023.07 代码解释器 + Prompt 组合

2.5 代表性论文

  1. Wei et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

  2. Brown et al. (2020). Language Models are Few-Shot Learners (GPT-3)

  3. Reynolds & McDonell (2021). Prompt Programming for Large Language Models: Beyond the Few-Shot Paradigm

2.6 局限性

  • 人工依赖:高度依赖个人经验,难以规模化

  • 单次交互:仅优化单次问答,缺乏系统性

  • 可移植性差:一个模型有效的 Prompt 在另一模型可能失效

  • 无法处理长周期任务:不支持多步复杂任务的状态管理 [2][10]


3. 第二阶段:Context Engineering(上下文工程)

3.1 核心概念与定义

Context Engineering(上下文工程) 是系统性设计和管理提供给 LLM 的信息环境的工程学科。由 Andrej Karpathy 在 2025 年正式定义为:“精妙的艺术与科学:精准地将大语言模型的上下文窗口填充上恰到好处的信息,让模型能准确地迈出下一步”[3][4]。

与 Prompt Engineering 的本质区别:

  • Prompt Engineering = 优化 “你说什么”(静态指令)

  • Context Engineering = 优化 “模型知道什么”(动态信息环境)[^10]

3.2 起源与发展时间线

时间 里程碑事件
1994 Bill Schilit 博士论文首次提出 Context-Aware Computing 概念 [^6]
2020-2023 RAG 技术逐步成熟,成为上下文工程的技术基础
2025 年中 Anthropic 正式提出 Context Engineering 概念 [^2]
2025 年底 Andrej Karpathy 背书,成为行业共识 [^3]
2026 年初 成为 AI 工程师核心能力,系统化方法论形成 [2][3]

3.3 关键技术点

3.3.1 上下文四大支柱
  1. 检索增强生成(RAG)

    • 向量数据库语义检索

    • 分块策略与嵌入优化

    • 重排序(Reranking)与召回率优化

  2. 上下文窗口管理

    • Token 预算分配策略

    • 重要信息保留机制

    • 滑动窗口与滚动更新

  3. 记忆系统设计

    • 短期记忆(对话历史)

    • 长期记忆(向量知识库)

    • 工作记忆(任务状态)

  4. 环境上下文注入

    • 实时数据获取

    • 用户状态感知

    • 环境参数传递 [^1]

3.3.2 核心方法论
  • 信息熵最小化:将高熵原始数据转化为低熵结构化表示

  • 适时性原则:在正确的时间提供正确的信息

  • 相关性过滤:只注入与当前任务相关的上下文

  • 分层上下文:基础层 + 任务层 + 实时层的三级架构 [^10]

3.4 代表性工具与框架

工具 / 框架 发布时间 核心功能
LangChain 2022.10 完整的上下文编排框架
LlamaIndex 2022.11 数据索引与上下文管理
Pinecone/Weaviate 2021-2022 向量数据库
Chroma 2023 开源嵌入式向量库
Cohere Rerank 2023 语义重排序

3.5 代表性论文

  1. Lewis et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks

  2. Gao et al. (2023). Lost in the Middle: How Language Models Use Long Contexts

  3. Yao et al. (2023). Tree of Thoughts: Deliberate Problem Solving with Large Language Models

3.6 局限性

  • 被动信息供给:仍是人决定给什么信息

  • 缺乏执行控制:信息充足但无法保证正确执行

  • 无反馈闭环:缺乏执行结果的自动校验与修正

  • 单次任务导向:不支持长周期自主运行 [7][10]


4. 第三阶段:Harness Engineering(驾驭工程)

4.1 核心概念与定义

Harness Engineering(驾驭工程) 是围绕 AI 智能体设计和构建约束机制、反馈回路、工作流控制和持续改进循环的系统工程实践。其核心哲学是:人类掌舵,智能体执行(Human Steer, Agent Execute)[1][8]。

“Harness”(马具)的隐喻:正如缰绳、马鞍、嚼子用来驾驭强大但不可预测的马匹,驾驭工程为强大但概率性的大模型提供一套控制系统 [1][8]。

4.2 起源与发展时间线

时间 里程碑事件
2025 年底 业内开始讨论 “Prompt 之外的系统设计”
2026 年 2 月 王欣在《我的 AI 落地实践之路》中正式提出 Harness Engineering 概念 [^5]
2026 年 3 月 HashiCorp CTO 提出:编码智能体 = AI模型 + Harness[^3]
2026 年 4-5 月 技术白皮书发布,四大组件体系成型 [^10]
2026 年 6 月 成为企业级 AI 落地的标准方法论 [^6]

4.3 关键技术点

4.3.1 四大核心子系统
  1. 工具注入系统(Tool Injection)

    • 函数调用(Function Calling)协议

    • 工具注册与发现机制

    • 权限控制与沙箱隔离

    • 多工具编排与并行执行

  2. 状态管理系统(State Management)

    • 任务进度跟踪

    • 关键信息持久化

    • 中断与恢复机制

    • 并发任务隔离

  3. 验证循环系统(Verification Loop)

    • 输出质量自动检查

    • 错误检测与自动修复

    • 多轮迭代优化

    • 人工审核触发点

  4. 约束分层系统(Guardrails)

    • 规则引擎与行为边界

    • 输出格式强制校验

    • 安全策略执行

    • 合规性审计 [1][7]

4.3.2 核心设计原则
  • 前馈控制:事前通过规则与工具注入引导正确行为

  • 反馈修正:事后通过验证循环检测并修复错误

  • 渐进式自动化:人工审核与自动执行的平滑过渡

  • 可观测性:完整的日志、追踪与监控体系 [6][7]

4.4 代表性工具与框架

工具 / 框架 发布时间 核心功能
AutoGPT 2023.03 首个自主 Agent 框架
LangGraph 2024.02 状态图与循环执行
Agent Protocol 2024 智能体标准接口
OpenAI Function Calling 2023.06 工具调用原生支持
Claude Code 2025.09 带验证的编码 Agent

4.5 代表性论文

  1. Yao et al. (2022). ReAct: Synergizing Reasoning and Acting in Language Models

  2. Schick et al. (2023). Toolformer: Language Models Can Teach Themselves to Use Tools

  3. Wang et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models

4.6 局限性

  • 人仍在循环中:需要人类启动和监控每个任务

  • 任务级自主:单个任务内自主,但任务间不连续

  • 缺乏自驱动:无法自主发现问题并启动解决流程

  • 固定循环结构:循环模式预设,无法动态演化 [4][7]


5. 第四阶段:Loop Engineering(循环工程)

5.1 核心概念与定义

Loop Engineering(循环工程) 是设计、实现和优化驱动自主 AI 智能体运行的迭代循环系统的工程范式。

核心定义(Peter Steinberger, 2026 年 6 月):“你不应该再给编程 Agent 写提示词了,你应该设计让 Agent 自己提示自己的循环”[2][4]。

本质跃迁:从 “人在循环中做决策” → “人设计循环本身”[4][9]

5.2 起源与发展时间线

时间 里程碑事件
2022 ReAct 范式提出,奠定循环基础 [^6]
2024-2025 Agent 框架内卷,工具使用成熟
2026 年 6 月 5 日 Peter Steinberger(OpenClaw 创始人)发表关键推文(800 万浏览)[^4]
2026 年 6 月 7 日 Google Chrome 工程负责人 Addy Osmani 正式命名 Loop Engineering [2][10]
2026 年 6 月中 行业广泛讨论,成为最新工程范式 [1][7]

5.3 关键技术点

5.3.1 循环架构五大模块
  1. 目标驱动引擎(Goal Engine)

    • 目标分解与子目标生成

    • 优先级动态调整

    • 完成条件自动判断

    • 新目标自主发现

  2. 自提示系统(Self-Prompting)

    • Agent 根据当前状态生成下一步指令

    • 动态上下文组装

    • 自我反思与修正提示

    • 元认知循环

  3. 状态持久化层(State Persistence)

    • 工作树(Working Tree)管理

    • 增量知识固化

    • 跨会话记忆延续

    • 分支与回滚机制

  4. 并发隔离系统(Concurrency Isolation)

    • 多循环并行执行

    • 资源竞争避免

    • 循环间通信机制

    • 故障隔离与恢复

  5. 执行审查分离(Execution-Audit Separation)

    • 执行循环与审查循环解耦

    • 独立验证 Agent

    • 安全审计追踪

    • 人工干预点设计 [4][8]

5.3.2 经典循环模式
  1. OODA 循环:观察(Observe)→ 定向(Orient)→ 决策(Decide)→ 行动(Act)

  2. PDCA 循环:计划(Plan)→ 执行(Do)→ 检查(Check)→ 处理(Act)

  3. 反思循环:执行 → 评估 → 反思 → 改进

  4. 探索 - 利用循环:新路径探索 vs 已知路径优化 [^9]

5.4 代表性工具与框架

工具 / 框架 发布时间 核心功能
Boris 2026.05 首个原生 Loop Engineering 工具
Claude Code 2.0 2026.06 支持无人值守长循环
OpenHands 2026.03 开源自主开发 Agent
SWE-Agent 2026.04 软件工程自主 Agent
Aider 2026 带自循环的 AI 编程工具

5.5 代表性论文

  1. OpenAI (2026). Self-Improving Agents: Bootstrapping Capabilities Through Autonomous Loops

  2. DeepMind (2026). Autonomous Task Completion Without Human in the Loop

  3. Meta AI (2026). Loop Architectures for Persistent AI Agents

5.6 当前挑战

  • 终止问题:如何避免无限循环

  • 资源消耗:长循环的 Token 与计算成本

  • 漂移控制:防止循环偏离原始目标

  • 可解释性:黑盒循环的调试与审计

  • 安全边界:自主运行的风险管控 [2][4]


6. 四阶段对比分析

6.1 核心维度对比表

对比维度 Prompt Engineering Context Engineering Harness Engineering Loop Engineering
核心问题 我该对模型说什么? 我该给模型什么信息? 我该给模型什么环境? 我该设计什么循环?
关注层级 单次交互质量 信息环境质量 系统运行可靠性 自主运行架构
人类角色 问话者 / 咒语师 信息管理员 系统架构师 循环设计者
人类参与度 极高(每轮) 高(任务前) 中(任务级) 极低(设计时)
自主性水平 L0 - 完全被动 L1 - 信息自主 L2 - 执行自主 L3 - 目标自主
时间尺度 毫秒 - 秒级 秒 - 分钟级 分钟 - 小时级 小时 - 天级
典型任务 问答、翻译、写作 知识库问答、文档总结 代码开发、数据分析 项目级开发、持续运维
核心技术 CoT、Few-shot、角色 RAG、向量库、记忆 工具调用、Guardrails、验证 自提示、状态机、并发
工程重点 Prompt 措辞优化 检索质量 + 窗口管理 约束 + 反馈 + 可观测 循环结构 + 目标驱动
失败模式 理解偏差、幻觉 信息缺失、冗余 工具误用、越权 死循环、目标漂移
代表产品 ChatGPT 对话 RAG 聊天机器人 Claude Code Boris、OpenHands
主流时间 2022-2024 2024-2025 2025-2026 2026 起
工程成熟度 ★★★★★ 成熟 ★★★★☆ 成型 ★★★☆☆ 发展中 ★★☆☆☆ 萌芽
资料来源 [2][5][^6] [2][3][^10] [1][6][^8] [2][4][^7]

6.2 能力层级演进图

Loop Engineering (2026+)
    ↓ 架构层:设计自主运行的系统
Harness Engineering (2025-2026)
    ↓ 系统层:构建安全可靠的运行环境
Context Engineering (2024-2025)
    ↓ 信息层:提供完整准确的信息
Prompt Engineering (2022-2024)
    ↓ 交互层:优化单次对话质量
基础LLM能力

7. 演进逻辑与技术转换关系深度分析

7.1 核心演进驱动力

7.1.1 需求驱动:从 “能用” 到 “可靠” 到 “自主”
  1. 第一阶段:解决 “模型能不能理解我的意图”—— 基础可用性问题

  2. 第二阶段:解决 “模型有没有足够的信息来回答”—— 知识准确性问题

  3. 第三阶段:解决 “模型能不能安全可靠地执行”—— 生产可用性问题

  4. 第四阶段:解决 “模型能不能持续自主地工作”—— 规模化问题 [7][10]

7.1.2 技术成熟度推动
  • LLM 基础能力提升 → 减少对 Prompt 技巧的依赖

  • 上下文窗口扩大(8K→128K→1M+)→ 上下文工程成为可能

  • 工具调用能力成熟 → 驾驭工程有了技术基础

  • Agent 推理能力涌现 → 循环工程具备可行性 [5][9]

7.2 阶段间的继承与超越关系

7.2.1 不是替代,而是叠加

每个新阶段都包含并超越前一阶段:

  • Context Engineering = Prompt Engineering + 动态信息管理

  • Harness Engineering = Context Engineering + 工具 + 约束 + 验证

  • Loop Engineering = Harness Engineering + 自驱动循环架构

工程实践建议:不要放弃前序阶段的积累,而是在其基础上构建更高层能力 [6][8]

7.2.2 关注点的外移规律
模型内部 → Prompt → Context → Harness → Loop → ?
    (向内)                          (向外)

每一次跃迁都将工程关注点向模型外推进一步:从优化模型输入,到优化信息环境,到优化运行系统,最终到优化整个运行循环的架构 [4][7]

7.3 人的角色变迁

阶段 人的角色 典型行为 技能要求
Prompt 指令者 反复修改 Prompt 措辞 语言表达、心理学
Context 信息管家 整理知识库、调优检索 信息架构、NLP
Harness 系统设计师 搭工具链、设规则 系统架构、安全
Loop 元设计者 设计循环机制、目标函数 控制论、运筹学

核心趋势:人类从 “循环内的执行者” 转变为 “循环外的设计者”,抽象层级持续提升 [2][10]


8. 未来发展趋势预测

8.1 技术发展趋势(2026-2028)

8.1.1 Loop Engineering 的深化
  1. 循环标准化:出现通用的 Loop 设计模式与最佳实践库

  2. 自适应循环:循环结构能根据任务类型动态调整

  3. 循环组合:多个子循环协同形成复杂系统

  4. 循环优化器:自动发现并修复循环中的瓶颈 [4][9]

8.1.2 下一个可能的阶段:Swarm Engineering(群体工程)

预测:2027 年前后可能出现第五个工程范式 ——Swarm Engineering(群体工程)

核心特征:

  • 从单 Agent 循环 → 多 Agent 协作网络

  • 从集中式控制 → 分布式自组织

  • 从预设循环 → 涌现式协作

  • 关键技术:Agent 间通信协议、共识机制、角色分工 [8][10]

8.2 产业影响预测

8.2.1 软件工程的重构
  • 开发效率:10-100 倍提升,从 “人写代码” 到 “人定义目标 + 审查结果”

  • 团队结构:从 “开发者 + 测试 + 运维” 到 “循环设计师 + 质量审计 + 安全合规”

  • 交付周期:从周 / 月级到小时 / 天级

  • 代码所有权:人类拥有架构与关键决策,AI 拥有实现细节 [8][9]

8.2.2 人才需求变迁
衰减技能 新兴技能
手工编写 Prompt 循环架构设计
逐行代码编写 目标函数定义
单模块调试 系统级可观测性
手动测试 自动验证系统设计

8.3 风险与挑战

8.3.1 技术风险
  • 失控风险:高度自主系统的不可预测行为

  • 透明度下降:多层抽象导致问题定位困难

  • 资源黑洞:无效循环消耗大量计算资源

  • 技能断层:传统工程师知识快速过时

8.3.2 社会风险
  • 就业冲击:初级开发岗位大规模替代

  • 责任界定:AI 自主决策的法律责任归属

  • 安全漏洞:自主系统可能被利用进行恶意行为

  • 垄断加剧:头部企业掌控 Agent 基础设施 [6][8]


9. 结论与展望

9.1 核心发现总结

  1. 清晰的演进路径:四年四次跃迁,形成完整的工程范式演进链

  2. 一致的演进方向:人类抽象层级持续提升,AI 自主性持续增强

  3. 叠加式发展:新阶段包含并超越旧阶段,而非简单替代

  4. 需求 - 技术双轮驱动:应用需求牵引,模型能力支撑,共同推动演进

  5. 工程化规律:从 “艺术 / 玄学” 到 “科学 / 工程”,每个阶段都经历了系统化过程

9.2 对从业者的建议

  1. 不要停留在舒适区:Prompt Engineering 技能正在快速贬值

  2. 建立分层知识体系:掌握全部四层能力,而非只关注最新概念

  3. 关注抽象层级提升:学习系统思维、控制论、运筹学等元技能

  4. 拥抱变化:AI 工程领域每 6-12 个月就会出现重大范式转移

  5. 重视基础:无论哪个阶段,对 LLM 本质的理解始终是根基 [3][10]

9.3 最终展望

从 Prompt Engineering 到 Loop Engineering,我们见证的不仅是工程方法论的演进,更是人机协作关系的根本性重构。这条道路的终点,是人类从 “亲自做” 到 “告诉做什么” 再到 “定义想要什么” 的持续跃迁。

工程的终极目标,始终是让人类从繁琐的执行中解放出来,专注于真正重要的决策与创造。在这个意义上,AI 工程范式的每一次跃迁,都是人类自由的一次扩展。

“最深刻的技术是那些消失的技术。它们将自己编织进日常生活的织物中,直到与之无法区分。” —— Mark Weiser(普适计算之父)


10. 参考文献

10.1 学术论文

[1] Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022.

[2] Brown, T., et al. (2020). Language Models are Few-Shot Learners. NeurIPS 2020.

[3] Lewis, P., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS 2020.

[4] Yao, S., et al. (2022). ReAct: Synergizing Reasoning and Acting in Language Models. ICLR 2023.

[5] Vaswani, A., et al. (2017). Attention Is All You Need. NeurIPS 2017.

10.2 技术博客与行业文章

[6] 王欣. (2026). 2026 AI 开发新范式: Harness Engineering 为何是智能体的决胜点?. https://wangxin.io/aigc/aigc_harness_engineering_agent_winning_point/index.html

[7] Addy Osmani. (2026). Loop Engineering: From Writing Prompts to Designing Autonomous Cycles. Google Engineering Blog.

[8] Andrej Karpathy. (2025). The State of AI Engineering. Twitter/X Thread.

[9] Peter Steinberger. (2026). You Should Stop Prompting Your Coding Agent. Design Loops That Prompt Themselves. Twitter/X, 2026-06-05.

[10] CSDN 博客. (2026). 深入浅出上下文工程:比 Prompt Engineering 更重要的下一代 AI 工程范式. https://blog.csdn.net/qq_73472828/article/details/160687146

10.3 在线资源

[11] AI Wiki. Prompt Engineering. https://aiwiki.ai/wiki/prompt_engineering

[12] AI Wiki. Context Engineering. https://aiwiki.ai/wiki/context_engineering

[13] LangChain Blog. (2026). Agentic Engineering: How Swarms of AI Agents Are Redefining Software Engineering. https://www.langchain.com/blog/agentic-engineering-redefining-software-engineering

[14] DEV Community. (2026). Loop Engineering: The Next Step After Prompt Engineering for AI Agents. https://dev.to/mininglamp/loop-engineering-the-next-step-after-prompt-engineering-for-ai-agents-449m


报告完成时间:2026 年 6 月 16 日
报告版本:v1.0
研究领域:AI 工程范式、大语言模型应用、智能体系统

Logo

这里是“一人公司”的成长家园。我们提供从产品曝光、技术变现到法律财税的全栈内容,并连接云服务、办公空间等稀缺资源,助你专注创造,无忧运营。

更多推荐