论文原地址:[2607.21557] OpenForgeRL: Train Harness-native Agents in Any Environment

背景知识

在深入OpenForge RL这篇文章之前,有必要了解几个核心概念。

什么是推理工具链(Harness)? 推理工具链是部署 AI 智能体时使用的完整运行时框架。它不仅仅是一个 API 调用接口,而是一个有状态的、多进程的系统,负责管理多轮对话、工具调用与返回、上下文记忆、子智能体协调以及与外部环境(文件系统、浏览器、数据库等)的交互。典型的推理工具链包括 Claude Code、OpenClaw、Codex 等。它们共同的特点是:将大语言模型的能力包装成可执行的动作序列,让模型能够像人类一样逐步完成复杂任务。

为什么需要在真实工具链中训练智能体? 传统做法是在简化版工具链中训练,再部署到真实工具链中使用。但这种「训练-部署错位」会带来严重问题——模型在训练时学到的行为模式,可能完全无法适应部署时的复杂环境。就像在模拟器中学会开车,不等于能在真实道路上安全驾驶。

现有 RL 框架的局限在哪里? 主流的开源强化学习框架(如 veRL、Slime)假设的是简单、单轮或少轮的工具调用场景。它们无法处理真实推理工具链中的嵌套调用、子智能体切换和长程上下文管理。这让端到端的强化学习训练长期成为一个「看得见却摸不着」的目标。

理解了这些背景,就能更好地把握 OpenForge RL 的突破意义——它首次让研究者能够在任何推理工具链、任何环境里,对 AI 智能体进行真正的端到端 RL 训练。

一、背景:AI智能体的“最后一公里”难题

当前AI智能体的发展正处在一个尴尬的节点:推理工具链日益复杂,但开源训练框架却无法跟上。这种“部署端日新月异、训练端原地踏步”的错位,使得绝大多数开源研究只能通过简化版工具链进行训练,然后在部署时面对完全不同的行为模式。OpenForge RL首次提出了一个通用解决方案——用轻量级代理解耦训练与推理,用Kubernetes编排实现弹性扩展。这不是渐进式改进,而是一种范式级的突破:让训练环境真正等于部署环境。

2026年,AI智能体已经从实验室走向了真实世界。Claude Code在软件工程领域展现出惊人的自主编码能力,OpenClaw让AI能够操控日常工具和应用,各类GUI智能体开始在真实的浏览器和操作系统中完成复杂任务。这些智能体不再是简单的“聊天机器人”,而是被包裹在精心设计的推理工具链中——一套管理多轮交互、工具调用、上下文维护以及与外部系统连接的复杂框架。

然而,一个尖锐的矛盾正在浮现:这些强大的推理工具链在部署端日新月异,但在训练端却几乎无法被端到端优化。当一名研究者想要用强化学习来改进一个基于OpenClaw的智能体时,她面临的现实是——现有的开源RL框架(如veRL、Slime)假设的是简单、单轮的生成或多轮轻量级工具调用;而真实的推理工具链是有状态的、多进程的,包含嵌套工具调用、子智能体和长程上下文管理。这种“训练-部署错位”让研究者们不得不为每个新场景重新实现一个简化的训练版工具链,或者干脆放弃端到端训练。

哥伦比亚大学、达特茅斯学院和微软研究院的研究团队正是在这一背景下,提出了OpenForge RL——一个开源的、可扩展的训练框架,首次让研究者能够在任何推理工具链、任何环境中,对基于大语言模型和多模态模型的智能体进行端到端的强化学习训练。这篇论文不仅展示了一个优雅的技术方案,更用扎实的实验数据证明了其在多种复杂场景下的有效性。

二、核心创新:轻量级代理与云原生编排的双引擎设计

OpenForge RL的技术精髓可以概括为两个核心组件,它们巧妙地解决了训练工具链智能体的两大痛点。

代理层:打破训练框架与推理工具链的紧耦合

传统RL框架假设训练器能够直接控制模型的生成过程——每一步的prompt由训练器构造,每一步的生成由训练器调用。但真实的推理工具链(如Codex)将这一切封装在了内部:工具链自己管理历史上下文、自己决定何时调用子智能体、自己处理工具返回结果。训练器就像一个被蒙在鼓里的旁观者。

OpenForge RL的解决方案极其优雅——一个轻量级代理,它像“中间人”一样截获推理工具链发出的每一次模型调用请求,将这些请求路由到RL框架的推理引擎,同时记录下所有的输入-输出对。当一次完整的环境交互结束时,代理自动将这些记录重构为标准RL训练样本:

这里的关键洞察是:代理完全不需要理解推理工具链的内部逻辑,只需要看到它在“说什么”。这种解耦使得OpenForge RL可以支持任何推理工具链——从简单的ReACT循环到复杂的Codex,无需修改任何一行工具链代码。

Kubernetes编排器:让训练在云端弹性伸缩

第二个痛点是资源隔离。推理工具链的每一次完整交互(称为一次“展开”/rollout)需要一个独立的容器化环境——包括文件系统、网络、专用的CPU和内存。在传统的RL框架中,这些展开与训练任务共处在同一节点上,不仅资源竞争严重,而且无法弹性扩展。

OpenForge RL构建在Orchard框架基础之上,实现了一个Kubernetes编排器,能够在微软Azure等云平台上动态创建、管理和销毁展开容器。每个展开任务都在自己的Kubernetes Pod中运行,拥有独立的CPU和内存配额。训练节点则专注于策略更新,两者完全解耦。

这种设计带来的不仅是资源隔离,更是弹性伸缩能力——研究者可以根据需要,在云端拉起数十甚至数百个并发展开任务,大幅加速数据收集过程。论文中报告,在浏览器智能体训练中,他们同时运行了48个并发展开任务,总训练时间仅需32小时。

三、实验验证:从文本工具到多模态GUI的全面突破

OpenForge RL的真正价值在于其广泛的适用性。研究团队在两类截然不同的智能体场景中进行了验证——基于文本的工具使用智能体(Claw)多模态GUI智能体(包括浏览器和计算机操作)。

Claw智能体:用几百个任务超越同类规模模型

在Claw场景中,智能体需要完成日常工具使用任务,如阅读邮件、搜索知识库、更新工单等。研究团队使用Qwen3-30B-A3B-Thinking作为基础模型(这是一种MoE架构,激活参数约30亿),通过OpenForge RL框架在三种流行工具链(ZeroClaw、OpenClaw、Codex)上训练。

数据合成是这里的亮点。由于公开可用的训练数据稀缺,团队构建了一个全自动的数据合成流水线。这个流水线模拟人类专家的任务设计流程:先由智能体根据参考资源池提议候选任务,然后筛选高质量任务,接着构建可执行的环境和验证器脚本,最后通过独立的开源模型测试任务并反复修复缺陷,直到所有检查通过。

这种“测试-修复”循环确保了训练任务的质量和鲁棒性。每个强化学习任务的平均合成成本为16.1分钟和4.36美元——对于构建高质量的RL训练集来说,这是一个完全可接受的成本。

在三个基准测试上的结果令人印象深刻:

  • ClawEval:OpenForge-Claw(SFT+RL)达到31.7(pass³)和55.9(pass@3),显著超越了Qwen3-30B-A3B-Thinking的14.3和39.8。

  • QwenClawBench:达到33.7的pass@1,远超基础模型的21.8。

  • MCPAtlas:在89个真实MCP服务器的任务上达到28.1的pass@1,而基础模型仅为12.4。

值得注意的是,OpenForge-Claw甚至在某些指标上超越了参数量大得多的商业模型,如Kimi K2.5(36.6 on ClawEval pass³)。

GUI智能体:视觉感知与低层级控制的端到端学习

如果说Claw智能体证明了OpenForge RL在文本领域的有效性,那么GUI智能体则展示了其在多模态、高难度场景中的通用性。

计算机使用智能体需要在虚拟显示中操作真实的Ubuntu桌面,通过鼠标点击和键盘输入完成复杂任务。这要求模型同时具备视觉感知能力、细粒度空间定位能力和长序列决策能力。浏览器使用智能体则需要在真实网站上完成购物、预订、信息查询等任务,面临动态网页内容和CAPTCHA等挑战。

研究团队使用Qwen3-VL-8B-Thinking作为基础模型,通过OpenForge RL框架在改进版Kimi-Agent(计算机使用)和Molmo-Web(浏览器使用)工具链上训练。

在三个GUI基准上的表现同样亮眼:

  • OSWorld-Verified(计算机使用):OpenForge-GUI达到37.7的pass@1,超过了Qwen3-VL-8B-Thinking的6.0和UI-TARS-7B-DPO的25.5。

  • Online-Mind2Web(浏览器使用):达到63.0的pass@1,不仅远超同规模的OpenCUA-7B(28.2),甚至超过了参数量大得多的Fara-7B(53.5)。

  • WebVoyager(浏览器使用):达到72.3的pass@1,与MolmoWeb(72.7)相当,但MolmoWeb使用了超过200k的训练任务,而OpenForge-GUI仅用了2.5k任务。

这些结果揭示了一个重要趋势:高质量的任务设计 + 正确的训练范式,可以在数据效率上实现数量级的提升。尤其值得注意的是,GUI智能体在强化学习阶段的改进幅度(从SFT的60.0到SFT+RL的63.0,提升3个百分点)虽然看似不大,但考虑到基准的难度(真实网站上的多步交互),这一提升已经具有统计显著性。

四、学术洞见:工具链选择如何影响学习,RL究竟教会了智能体什么?

OpenForge RL真正的价值不仅在于训练出更强的智能体,更在于它为研究者提供了一个研究平台——可以在真实的部署工具链中观察和量化训练过程。论文的讨论部分对此进行了深入剖析,三个发现尤其值得关注。

发现一:不是所有工具链都同等可学

研究团队在ClawEval上评估了训练好的模型在四种不同工具链上的表现。结果清楚地显示,那些直接支持自定义工具注册的工具链(ReACT和ZeroClaw)学习效果最好。而OpenClaw虽然功能强大,但由于其复杂的上下文管理和更长的prompt,强化学习的增益相对有限。

这引出了一个关键见解:工具链的设计者应当追求“可学习性”而不仅是“功能完整性”。一个过于复杂、内部状态过多的工具链,即使功能强大,也可能成为模型学习的障碍。相反,简洁、结构化、与模型能力相匹配的工具链,能让RL的效能最大化。

发现二:多工具链训练带来泛化能力

一个令人振奋的结果是:在单一工具链(ZeroClaw)上训练的模型,也能泛化到训练中未见过的工具链(OpenClaw和Codex)上。更进一步的实验表明,同时在三种工具链上训练的模型,在所有工具链上的表现都更好——即使在ZeroClaw上,多工具链训练(48.5)也优于单工具链训练(46.0)。

这种现象可以用“任务变体的多样性”来解释。当模型看到同一个任务被多种工具链解决时,它学习到的是任务本质的解决模式,而不仅仅是对特定工具链的过拟合。这验证了一个经典机器学习原则:训练分布的多样性是泛化能力的关键

发现三:RL教给智能体的不仅仅是“得分更高”

论文中最有趣的分析之一,是通过行为层面的对比揭示了RL在SFT基础上带来的质的变化

  1. 工具使用策略的优化:在ZeroClaw工具链上,RL将通用shell调用的比例从22.6%降低到13.9%,把调用转移到了专用服务工具上。这说明RL教会了模型“用对工具”而不是“用通用工具凑合”。

  2. 自我验证能力的提升:在Codex工具链上,RL显著提高了模型“写入后读取验证”的行为——在修改状态后,会主动查询确认操作生效。这是智能体可靠性的关键标志。

  3. 错误恢复仍然困难:尽管RL在多个维度上提升了智能体能力,但“从失败中恢复”仍然是最大的短板。即使在强化学习后,错误恢复的成功率仍然很低。论文推测,这种能力可能需要专门设计的训练数据或方法才能有效习得。

这些发现对未来的研究具有重要指导意义:RL不是万能药,某些高阶认知能力(如诊断和恢复)可能需要更精细的课程设计或元学习策略。

五、核心思想总结

OpenForge RL的核心思想可以用一句话概括:不要在简化版本中训练智能体,让它们在真实部署的复杂性中学习。这种“环境保真度”的理念让人想起机器学习中一个经典教训——在模拟环境中学到的策略,往往在现实世界中失效。AI智能体同样如此:在简化版工具链中学到的行为模式,可能无法迁移到复杂的部署版工具链中。

通过巧妙地解耦训练和推理,OpenForge RL让研究者能够直面智能体训练的“最后一公里”问题。它不仅是一个强大的工程框架,更开启了一扇研究之窗——让我们首次能够在真实部署条件下,系统性地观察和分析AI智能体的学习过程。

在这个AI智能体日益走向自主操作的时代,OpenForge RL代表了一种重要的理念转向:训练平台应该适应智能体的部署环境,而不是要求智能体适应训练平台的简化假设。这种“以部署为中心”的训练范式,或许正是通往更强大、更可靠AI智能体的关键路径。

六、可借鉴点与开源意义

OpenForge RL的贡献远不止于论文本身。研究团队承诺开源代码、数据和模型,这将在三个层面上推动领域发展:

降低准入门槛:研究者不再需要为每个新场景从零搭建训练框架,可以直接使用OpenForge RL对接任意工具链和环境。

促进可复现性:统一的训练框架使得不同研究之间的比较更加公平和有意义。

鼓励工具链优化:有了端到端可训练的框架,工具链设计者可以量化其设计对训练效率的影响,从而做出数据驱动的设计决策。

这篇工作不是空中楼阁式的架构设计,而是在六个主流基准上完成了系统验证:

  • Claw智能体:覆盖ZeroClaw、OpenClaw、Codex三种流行工具链,在ClawEval、QwenClawBench、MCPAtlas上均大幅超越同规模基线。

  • GUI智能体:横跨计算机使用(OSWorld-Verified)和浏览器使用(Online-Mind2Web、WebVoyager)两大场景,仅用2.5k任务就达到了MolmoWeb用200k任务相近的效果。

这种跨场景的广泛验证,证明OpenForge RL不是针对某一特定任务的专用方案,而是真正通用的训练基础设施

此外,OpenForge RL的训练框架特性使得研究者得以首次在真实部署环境中系统性地比较不同工具链的可学习性。论文中提炼的三个发现具有普遍指导意义:

  1. 工具链的功能丰富度并不等同于可学习性——OpenClaw功能强大但RL增益有限,而ZeroClaw简洁高效反而更容易学。这一洞见对整个工具链设计社区具有指导价值。

  2. 多工具链联合训练能产生正向迁移——在三种工具链上训练的模型,即便在单一工具链上的表现也优于单工具链训练的模型,说明多样性本身就是一种训练信号。

  3. RL教给智能体的是可靠性而非仅仅是成功率——自我验证、工具调用策略优化等质的改变,比单纯的分数提升更有意义。


一句话总结:OpenForge RL解决了AI智能体训练中最根本的“部署-训练错位”难题,以优雅的架构设计和扎实的实验验证,为该领域打开了一扇通向真实世界训练的大门。无论你是工具链开发者、RL研究者还是智能体应用构建者,这篇工作都值得深入研读。

Logo

这里是“一人公司”的成长家园。我们提供从产品曝光、技术变现到法律财税的全栈内容,并连接云服务、办公空间等稀缺资源,助你专注创造,无忧运营。

更多推荐