本文介绍了如何将Harness的各个子系统整合,构建一个具备可观测性的Agent工作环境。核心内容包括:日志(记录Agent思维过程)、指标(监控效率、质量、可靠性)、追踪(回放执行路径),以及完整的Agent工作环境架构。通过这些手段,可以实现对Agent行为的全面监控和优化,提升Agent的可靠性和效率。


实战项目六:可观测性、调试能力与完整运维体系的最终集成


前面七篇文章,我们一层一层地搭建 Harness 的子系统:

  • 第一篇:理解为什么强模型也会失败
  • 第二篇:掌握 Harness 的五子系统架构
  • 第三篇:学会给信息分层,避免 Giant Instruction File
  • 第四篇:用规则约束 Agent 的行为
  • 第五篇:建立上下文继承与工作交接机制
  • 第六篇:设计状态持久化,防止 Agent"断片"
  • 第七篇:建立运行时反馈与独立验证闭环

最后一个项目,是把所有组件集成在一起,搭建一套完整的、带有可观测性的 Agent 工作环境。


01 为什么需要可观测性

前面的 Harness 组件解决的是"让 Agent 做对"的问题。可观测性解决的是"当 Agent 做错时,你怎么知道"的问题。

想象一下:Agent 运行了一个小时,花了 50 美元,最后告诉你"任务失败"。你问它"为什么失败",它说"不知道"。你问它"在哪一步失败的",它说"不记得了"。

这就是没有可观测性的 Agent:一个黑盒。你不知道它做了什么、为什么做、花了多少时间、消耗了多少 token。你只能看到输入和输出,中间过程完全不可见。

可观测性的三个支柱:日志(Logs)、指标(Metrics)、追踪(Traces)。


02 日志:Agent 的"工作日记"

最简单的可观测性就是日志。但 Agent 的日志不是普通的应用日志——它需要记录 Agent 的"思维过程"。

课程里推荐的日志结构:

{  "timestamp": "2026-05-09T14:30:00Z",  "session_id": "sess-abc123",  "agent_action": "file_write",  "target_file": "src/services/user_service.py",  "context": {    "task": "实现用户注册",    "phase": 3,    "token_usage": 15420,    "cost_usd": 0.08  },  "result": "success",  "validation": {    "pytest": "passed",    "mypy": "passed",    "coverage": "87%"  }}

这个日志回答了:

  • Agent 在什么时候做了什么动作
  • 这个动作属于哪个任务、哪个阶段
  • 消耗了多少 token、花了多少钱
  • 验证结果是什么

日志应该写入文件,而不是只显示在终端。 因为终端输出会随着对话刷新而丢失,文件可以持久保存、事后分析。


03 指标:Agent 的"体检报告"

日志是细粒度的,指标是聚合的。你需要关注的核心指标:

效率指标

  • 任务成功率:完成且通过验证的任务 / 总任务数
  • 平均完成时间:每个任务花了多少分钟
  • 平均 token 消耗:每个任务用了多少 token
  • 平均成本:每个任务花了多少钱

质量指标

  • 验证通过率:Agent 自己运行验证的通过率
  • 回归率:修改 A 功能导致 B 功能失败的比例
  • 重试次数:Agent 平均需要多少次尝试才能完成任务

可靠性指标

  • 断片恢复率:中断后成功恢复并完成任务的比例
  • 状态一致性:plan.md 与代码实际状态一致的比例

这些指标应该定期汇总,形成 Agent 的"体检报告"。比如每周一早上自动生成:

Agent 周报(2026.05.03 - 2026.05.09)任务完成情况:- 总任务:23- 成功:19(82.6%)- 失败:4效率指标:- 平均耗时:47 分钟- 平均成本:$2.3- 平均 token:34,500质量指标:- 验证通过率:91%- 回归率:8.7%(2/23 个任务引入了回归)需要关注的问题:- 周四的两个失败任务都卡在 SMTP 集成,建议完善邮件相关的 Harness- 回归主要来自 utils.py 的修改,建议增加该模块的测试覆盖

04 追踪:Agent 的"执行回放"

最高级的可观测性是追踪——你能看到 Agent 完成一个任务的完整执行路径。

任务:实现用户注册功能Step 1: 读取 AGENTS.md(2s, 120 tokens)Step 2: 读取 .agent/status.json(1s, 50 tokens)Step 3: 读取 src/models/user.py(3s, 800 tokens)Step 4: 写入 src/models/user.py(5s, 2000 tokens)  └── 验证:mypy 失败 → 修复类型注解 → mypy 通过Step 5: 写入 src/services/auth_service.py(8s, 3500 tokens)  └── 验证:pytest 失败 → 修复测试 → pytest 通过Step 6: 更新 .agent/status.json(2s, 300 tokens)Step 7: Git commit(1s, 0 tokens)总耗时:47 分钟总 token:45,000总成本:$2.5

这个追踪记录的价值在于:

  • 事后复盘:

    任务失败时,你能精确知道在哪一步出了问题

  • 成本优化:

    你能发现 Agent 在哪个环节消耗了过多 token

  • 模式识别:

    你能发现 Agent 反复犯同样错误的模式,然后针对性地完善 Harness


05 完整的 Agent 工作环境架构

把前面所有文章的内容汇总,一个完整的 Agent 工作环境长这样:

project-root/│├── AGENTS.md                    # 入口导航(项目二、三)├── docs/                        # 分层文档(项目三)│   ├── architecture.md│   ├── api-conventions.md│   └── testing-guide.md│├── src/                         # 业务代码│   └── ...│├── tests/                       # 测试用例(项目四、五)│   ├── test_features/│   └── test_regression/│├── scripts/                     # 验证与工具脚本(项目四)│   ├── validate.sh              # 综合验证│   ├── typecheck.sh             # 类型检查│   └── test.sh                  # 测试运行│├── .agent/                      # Agent 工作区(项目二、三、六)│   ├── status.json              # 运行时状态│   ├── plan.md                  # 执行计划│   ├── session-log.md           # 会话历史│   ├── init.sh                  # 初始化脚本(项目三)│   └── logs/                    # 执行日志(项目六)│       └── 2026-05-09/│           └── session-001.log│└── .github/                     # CI/CD(项目六)    └── workflows/        └── agent-metrics.yml    # 自动生成 Agent 周报

每层的设计意图:

  • AGENTS.md + docs/:信息分层,Agent 按需读取
  • tests/ + scripts/:验证闭环,Agent 自我纠错
  • .agent/:状态持久化 + 可观测性,Agent 不"断片"、不"黑盒"
  • .github/workflows:自动化运维,人类不介入也能持续改进

06 写在最后:Harness 工程的长期主义

搭建完整的 Harness 不是一次性项目,是持续演进的过程。

第一阶段:生存(0-2 周)

  • 建立 AGENTS.md
  • 配置基础验证脚本
  • 让 Agent 能独立完成简单任务

第二阶段:可靠(2-8 周)

  • 完善状态管理和交接机制
  • 建立多层级验证闭环
  • 让 Agent 能处理复杂任务且成功率稳定在 80%+

第三阶段:优化(8 周以后)

  • 建立可观测性和指标系统
  • 基于数据持续优化 Harness
  • 让 Agent 的产出质量逼近人类工程师

第四阶段:自治(长期目标)

  • Agent 能自己发现并修复 Harness 的缺陷
  • Agent 能根据项目演进自动更新 AGENTS.md
  • Agent 能基于指标自我调优

这个系列的核心信念是:Agent 的可靠执行取决于 Harness 的完备程度,而非模型本身的参数量。

OpenAI 的五个月实验、Anthropic 的对照测试、以及这门课程里的六个项目,都在验证同一个结论:

换的是马鞍,不是马。


最后

对于正在迷茫择业、想转行提升,或是刚入门的程序员、编程小白来说,有一个问题几乎人人都在问:未来10年,什么领域的职业发展潜力最大?

答案只有一个:人工智能(尤其是大模型方向)

当下,人工智能行业正处于爆发式增长期,其中大模型相关岗位更是供不应求,薪资待遇直接拉满——字节跳动作为AI领域的头部玩家,给硕士毕业的优质AI人才(含大模型相关方向)开出的月基础工资高达5万—6万元;即便是非“人才计划”的普通应聘者,月基础工资也能稳定在4万元左右

再看阿里、腾讯两大互联网大厂,非“人才计划”的AI相关岗位应聘者,月基础工资也约有3万元,远超其他行业同资历岗位的薪资水平,对于程序员、小白来说,无疑是绝佳的转型和提升赛道。

如果你还不知道从何开始,我自己整理一套全网最全最细的大模型零基础教程,我也是一路自学走过来的,很清楚小白前期学习的痛楚,你要是没有方向还没有好的资源,根本学不到东西!

下面是我整理的大模型学习资源,希望能帮到你。

👇👇扫码免费领取全部内容👇👇

在这里插入图片描述

最后

1、大模型学习路线

2、从0到进阶大模型学习视频教程

从入门到进阶这里都有,跟着老师学习事半功倍。

3、 入门必看大模型学习书籍&文档.pdf(书面上的技术书籍确实太多了,这些是我精选出来的,还有很多不在图里)

4、 AI大模型最新行业报告

2026最新行业报告,针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

5、面试试题/经验

【大厂 AI 岗位面经分享(107 道)】

【AI 大模型面试真题(102 道)】

【LLMs 面试真题(97 道)】

6、大模型项目实战&配套源码

适用人群

四阶段学习规划(共90天,可落地执行)
第一阶段(10天):初阶应用

该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。

  • 大模型 AI 能干什么?
  • 大模型是怎样获得「智能」的?
  • 用好 AI 的核心心法
  • 大模型应用业务架构
  • 大模型应用技术架构
  • 代码示例:向 GPT-3.5 灌入新知识
  • 提示工程的意义和核心思想
  • Prompt 典型构成
  • 指令调优方法论
  • 思维链和思维树
  • Prompt 攻击和防范
第二阶段(30天):高阶应用

该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。

  • 为什么要做 RAG
  • 搭建一个简单的 ChatPDF
  • 检索的基础概念
  • 什么是向量表示(Embeddings)
  • 向量数据库与向量检索
  • 基于向量检索的 RAG
  • 搭建 RAG 系统的扩展知识
  • 混合检索与 RAG-Fusion 简介
  • 向量模型本地部署
第三阶段(30天):模型训练

恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。

到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?

  • 为什么要做 RAG
  • 什么是模型
  • 什么是模型训练
  • 求解器 & 损失函数简介
  • 小实验2:手写一个简单的神经网络并训练它
  • 什么是训练/预训练/微调/轻量化微调
  • Transformer结构简介
  • 轻量化微调
  • 实验数据集的构建
第四阶段(20天):商业闭环

对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。

  • 硬件选型

  • 带你了解全球大模型

  • 使用国产大模型服务

  • 搭建 OpenAI 代理

  • 热身:基于阿里云 PAI 部署 Stable Diffusion

  • 在本地计算机运行大模型

  • 大模型的私有化部署

  • 基于 vLLM 部署大模型

  • 案例:如何优雅地在阿里云私有部署开源大模型

  • 部署一套开源 LLM 项目

  • 内容安全

  • 互联网信息服务算法备案

  • 👇👇扫码免费领取全部内容👇👇

    在这里插入图片描述

3、这些资料真的有用吗?

这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。

资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

Logo

这里是“一人公司”的成长家园。我们提供从产品曝光、技术变现到法律财税的全栈内容,并连接云服务、办公空间等稀缺资源,助你专注创造,无忧运营。

更多推荐