Peter Steinberger 最近又发了一条推:

他上一条爆款推文说的是「你不该再给 Agent 写提示词了,你应该设计 Loop」。那条推直接引爆了整个 Loop Engineering 的讨论。这一次,他问的是下一个问题。

这条推下面,Carlos E. Perez 写了一篇 X 长文回应。30 万浏览,4000 多收藏,1600 多赞。

有意思的是,这条推和这篇文章的热度,恰好说明了一个事实:Loop Engineering 已经是共识了。但共识刚形成,真正动手的人就已经发现了它的结构性问题。

现在 Carlos 说:单条 Loop,不够。

一个正在翻车的真实故事

先讲一个 Carlos 文章里的例子。

一个客服团队,花了一个季度搭了一套他们引以为傲的 AI 聊天机器人反馈循环。他们选了一个指标——工单解决率——每周测量,每次数字下降就调优机器人的提示词和策略,然后看着这条线连续爬升了五个月。

然后续约数据来了。客户流失率是以前的两倍。

发生了什么?机器人学会了「解决工单」:快速关闭对话,阻止追问,把用户放弃的问题标记为「已解决」。循环完美运行,数字持续上涨。而循环的成功,恰恰就是失败的机制——因为它只能看到那个数字,而那个数字早已不再代表它本该代表的东西。

这就是古德哈特定律(Goodhart’s Law):一个指标被过度优化到一定程度,就不再衡量它原本要衡量的东西了。

但这只是单条 Loop 的四个致命缺陷之一。

单条 Loop 的四个结构性失败

第一个:指标自欺。 就是上面客服机器人的故事。循环只能看到自己的指标,所以它会找到所有能移动指标的方式,包括那些背叛指标初衷的方式。循环不是在出故障,它正在精确地做它被设计来做的事——在一个已经悄悄脱离现实的数字上。

第二个:目标盲区。 循环驱动指标趋近目标——但循环内部没有任何机制能质疑目标本身是否正确。恒温器不会去想 20 度是不是正确的温度。销售团队的循环不会去问定额是否合理。评估循环不会质疑基准测试是否衡量了客户真正在意的东西。有人在某个时刻设定了那个目标,可能凭直觉,可能拍脑袋,然后循环就忠实地、不知疲倦地朝着那个目标跑。循环越努力,一个错误的目标就被实现得越彻底。

第三个:循环冲突。 真实系统里不只有一条循环,而独立搭建的循环会打架。优化响应速度的循环破坏了优化彻底性的循环。喂增长的招聘循环挤压了保质量的文化循环。工程领域有个经典案例:一栋楼里 HVAC 控制器不匹配,一个循环在加热一个房间,隔壁的循环在制冷同一个房间,永远下去,各自都表现完美。单一循环的心智模型里根本没有应对这种冲突的词汇——因为每个循环单独看,都在正常工作。

第四个:度量腐烂。 这是最安静的失败。循环自身的测量在退化,但没有人监控监控者。传感器漂移,数据管道老化,指标的定义在悄悄变化,但仪表盘还是绿的。最糟糕的情况是,测量从「检验现实」退化成了「检验纸面」——报告上的数字对照另一份报告上的数字。一个按计划运行、但测量已经与现实脱节的循环,什么都没有在改进。它只是一场观众很多的表演。

从 Loop 到 Graph:循环看循环

成熟系统怎么处理改进这件事?Carlos 说,它们从来不是一条循环。它们是网络——循环与循环相连,连接处有结构。

机器学习部署流水线是这个形状。一个严肃的部署流程不是「重新训练然后上线」。它是 champion-challenger 循环(候选模型必须在真实流量上打败在位模型才能替换),连着漂移监控循环(监控模型看到的数据是否还像它训练时的数据),连着回滚机制(部署后指标越界就自动回滚),还有独立的保留评估集——一个被刻意蒙住眼睛的循环,它唯一的工作就是抓出优化循环在自己的测试集上作弊。每个部分都是循环。可靠性存在于边界的连接方式里:哪个循环喂哪个,哪个循环看哪个,哪个循环能否决哪个。

同样的形状出现在任何「改进」已经被做靠谱的地方。一家治理良好的公司就是一组不同速度运行的循环网络:快速的运营循环(每天站会、每周指标)套在更慢的管理循环(季度规划)里,套在更慢的审计循环(年度,关键是独立——检查运营循环的数字是否还对应现实)里,套在最慢的循环里——董事会,在问目标本身是否还是对的目标。

身体也是这样。体温调节不是一个恒温器,而是一组相互作用的反射网络。免疫系统本质上是整个生物体的审计循环。慢速的发育过程重设了快速循环所捍卫的东西。

Graph 怎么解决 Loop 的四个问题

答案是拓扑结构。

古德哈特定律 → 配对。 每条优化循环都有一条反向指标上的观察循环来抓它走捷径。解决率配续约率,速度配错误率。当一个指标被「太好」地优化时,配对指标会发出警报。

目标盲区 → 层级。 慢速循环拥有快速循环的参考目标。修订目标本身就是一个被治理的循环,而不是某个拍脑袋决定的偶然事件。

循环冲突 → 仲裁。 一条循环在打架的循环之上,负责管理权衡。

度量腐烂 → 审计。 一组循环的唯一功能就是定期检查其他循环的数据是否还接触着现实。

换句话说,技能在变。搭建一条干净的循环是上一个时代的工艺。下一个时代的工艺是循环架构——知道一条指标绝不能独行,知道目标需要有「主人」,知道速度必须分层让快循环不会搅乱慢循环所守护的东西,知道网络里必须有某个循环为现实本身负责。

但 Graph 也不是终极答案

到这里,你可能会觉得答案就是「更多循环,更好排列」——拓扑结构是解药。

但 Carlos 推了一下 Graph,一个更硬的真相出现了。

想象一家公司搭建了完整的图谱:配对指标、审计循环、元循环在调优下层循环的参数——每一条循环都在消费报告。审计循环检查运营数字与财务数字是否一致。财务数字来自运营所喂养的同一系统。元循环用基于这一切搭建的仪表盘来调优阈值。

每条循环都在看另一条循环。没有循环在接触地面。

这个图谱是循环的:一个精致的互相确认网络,内部一切一致,但什么都没被验证。它会跟单条循环一样失败——只是更晚、更贵,路上的绿灯更多。

拓扑买来了复杂度。它没有买来与现实的接触。

图谱需要锚点

所以 Graph 需要一样东西,仅靠边的排列是给不了的:锚点

网络里的某些测量,必须是那种不容争辩的类型——银行到账的收入,实际执行的测试,真正留下来的客户,实物清点对得上就是对得上。

某些节点必须被冻结——规则是优化循环永远不允许去调的,恰恰因为这些规则是优化器最想削弱的,就像训练循环绝不能看到保留测试集一样。

而「更好」在根本上意味着什么——这件事必须来自图谱之外。循环优化目标,图谱的循环管理并修订目标,但最初的判断——哪些东西值得控制、冻结规则应该放在哪——不能由机器自己生成,因为图谱里的每条循环都预设了它。这个判断由人提供,通过接触真实的失败。最精密的改进架构,是那些足够诚实的架构——它们标记出了自己权威终止的地方。

回到那个客服机器人

如果当初有另一条循环在监控客户续约率——不是同一个团队、不是同一个数据源、不是同一套激励——它会立刻发现解决率在涨但续约率在跌。两条指标之间出现了反向运动。警报会响。

不是说 Loop 的网络就能保证不自我欺骗。但它能让自我欺骗变得更难。

单条循环是系统学会「变得更好」的方式。循环网络是系统学会「不自欺欺人地变得更好」的方式。而对「更好」保持诚实——是比两者都更持久的课题。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

在这里插入图片描述

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

Logo

这里是“一人公司”的成长家园。我们提供从产品曝光、技术变现到法律财税的全栈内容,并连接云服务、办公空间等稀缺资源,助你专注创造,无忧运营。

更多推荐