【ICML 2026 (Oral)】JitRL 论文解读:无梯度更新的 LLM Agent 持续强化学习,98 美元替代 3500 美元 GPU 训练
摘要
本文解读 ICML 2026(Oral)论文《Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates》。该论文提出 JitRL 训练时零梯度强化学习框架,通过融合动态非参数记忆与检索式优势估计,以闭式公式直接调制 LLM 输出 logits——被严格证明为 KL 约束策略优化目标的精确闭式解,其特别之处在于全程无需任何梯度更新即可实现 LLM Agent 的持续强化学习。实验表明 JitRL 在 WebArena 上达到 46.98% 平均成功率、Jericho Zork1 得分 69,全面超越训练时零梯度基线并首次超越在线 RL 微调方法 WebRL,成本仅 98 美元 vs 3500+ 美元(30 倍降低),为 LLM Agent 的低成本持续学习提供了重要借鉴。
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates |
| 标题(中文) | JitRL:无梯度更新的 LLM Agent 持续强化学习 |
| 作者 | Yibo Li, Zijie Lin, Ailin Deng, Xuan Zhang, Yufei He, Shuo Ji†, Tri Cao, Bryan Hooi |
| 机构 | National University of Singapore (NUS), School of Computing |
| 会议 | ICML 2026 (Oral) |
| arXiv | https://arxiv.org/abs/2601.18510 |
| 项目网站 | 暂无公开项目网站(以 arXiv 为准) |
背景与动机:LLM Agent 为什么需要持续强化学习?
LLM Agent 在部署后权重通常被冻结,无法从与环境的交互经验中持续改进——这是 Agent 系统落地的核心痛点。现有两条技术路线各有硬伤:
- 基于梯度的 RL(Gradient-based RL):PPO、GRPO 等在线梯度更新方法(WebRL、ToRL)性能强,但训练成本极高——WebRL 需微调 Llama-3.1-70B,单次训练成本 3500+ 美元,且训练后模型静态,无法随部署环境持续演化。
- 免训练方法(Training-Free):Reflexion(文本反思)、AWM(工作流记忆)、EvoTest(进化 prompt 优化)成本低,但局限于 prompt 上下文拼接,缺乏数学保证,性能天花板明显。
JitRL 的核心洞察:把记忆视为非参数策略分布,将策略优化问题重新表述为 logit 空间中的闭式更新,从而在训练时零梯度的前提下获得可证明的 RL 保证。
研究主线:从"RL 必须梯度更新"到"免梯度持续 RL"

图 4:JitRL 研究主线——从“RL 必须梯度更新”到“免梯度持续 RL”(Mermaid 流程图)
JitRL 方法总览:与标准 RL 的本质区别
JitRL 与标准 RL 的对比一目了然:标准 RL 在训练期通过历史轨迹做策略梯度更新(需要 GPU 与梯度回传);JitRL 在测试时检索与当前状态相关的历史轨迹,估计优势函数 $\widehat{A}(s,a)$,再通过 KL 正则策略优化目标直接调制输出 logits——全程无梯度、无权重更新。

图 1:JitRL vs 标准 RL——训练期梯度更新 vs 测试时检索 + logit 调制
JitRL 核心设计:记忆构建 → 价值估计 → 闭式更新

图 5:JitRL 核心设计——记忆构建 → 价值估计 → 闭式更新三阶段循环(Mermaid)
JitRL 方法细节:从轨迹记忆到闭式 logit 调制
JitRL 由三阶段循环构成,每一阶段都无需梯度:
- Memory Construction(记忆构建):LLM Evaluator 评估完整轨迹 τ,生成每步标量 reward $r_t$,解决稀疏奖励下的信用分配问题;随后计算 discounted returns $G_t = \sum_{u=t}^{T} \gamma^{u-t} r_u$,将 $(s_t, a_t, G_t)$ 存入动态记忆 $\mathcal{M}$。
- Test-Time Value Estimation(测试时价值估计):对当前状态 s 做 Jaccard 相似度检索,取 top-k 邻居 $\mathcal{N}(s)$;已知动作用邻居的平均 returns 估计 $\widehat{Q}(s,a)$,未知动作加乐观 bonus $\alpha/|\mathcal{N}(s)|$ 鼓励探索。
- Closed-Form Logit Update(闭式 logit 更新):$z'(s,a) = z(s,a) + \beta \cdot \widehat{A}(s,a)$——Theorem 4.1 证明这是 $\arg\max_{\pi'} \mathbb{E}[\widehat{A}] - \frac{1}{\beta}D_{KL}(\pi'||\pi_\theta)$ 的精确闭式解;Theorem 4.2/4.3 分别保证估计一致性与策略收敛,构成完整的理论链。

图 2:JitRL 框架——Inference(检索 → 优势估计 → logit 调制)与 Memory Update(评估 → 回报 → 存储)双循环
值得注意的工程细节:logit 的获取有两种变体——Token-level(模型输出候选索引时直接取 log-probability)与 Verbalized(黑箱模型不暴露 log-prob 时,让 LLM 输出 confidence 0–100 再转为 logit),后者使 JitRL 可适配任意闭源 API 模型。
实验设计与结果:WebArena 与 Jericho 双 SOTA
评测协议:WebArena 5 个网站域(Admin, GitLab, Map, Reddit, Shopping),每 task 执行 $L=5$ episodes,指标为 Avg SR / Final SR;Jericho 3 个文字游戏(Library, Zork1, Zork3),每游戏 50 episodes,指标为 Avg Score / Final Score。多轮序贯测试允许 agent 在 episode 之间从记忆持续学习。
基线:训练时零梯度基线(Static · Memory · Reflexion · AWM · EvoTest,Gemini-2.5-flash backbone)与权重更新基线(SFT、WebRL 微调 Llama-3.1-70B;GRPO 训练 Qwen3-32B)。
WebArena 主表(Avg SR / Final SR %):
| Method | Shopping Avg | Shopping Final | Map Avg | Map Final | Average Avg | Average Final |
|---|---|---|---|---|---|---|
| Static | 24.06 | 25.00 | 30.62 | 31.25 | 35.63 | 36.30 |
| Memory | 30.16 | 33.16 | 30.47 | 32.81 | 41.36 | 43.00 |
| Reflexion | 30.83 | 31.25 | 29.38 | 27.34 | 41.08 | 42.12 |
| AWM | 23.12 | 22.40 | 34.38 | 32.81 | 39.37 | 40.32 |
| EvoTest | 26.67 | 29.17 | 33.59 | 41.41 | 39.24 | 42.49 |
| JitRL | 41.67 | 45.83 | 37.66 | 42.19 | 46.98 | 51.35 |
JitRL 全面超越所有训练时零梯度方法:Avg SR 46.98%(+11.35pp vs Static),Shopping 域 +73.2%、Map 域 +34.7%,且 Final−Avg 差距最大(4.37pp),说明其随 episode 的学习效率最高。
Jericho 结果(Avg / Final Score):
| Method | Library Avg | Library Final | Zork1 Avg | Zork1 Final | Zork3 Final |
|---|---|---|---|---|---|
| Static | 10.0 | 10 | 8.5 | 10 | 0 |
| EvoTest | 21.5 | 26 | 46.8 | 54 | 4 |
| GRPO | 13.6 | 11 | 16.2 | 10 | 2 |
| JitRL | 25.9 | 30 | 53.0 | 69 | 5 |
Zork1 Final 69 vs GRPO 10(+590%)、Library 30 vs GRPO 11——JitRL 的检索式记忆在长 horizon 稀疏奖励游戏中远超梯度 RL。

图 3:Jericho 学习曲线——JitRL 快速收敛且差距持续拉大,GRPO 高方差
结果对比:JitRL 为什么值得关注

图 6:JitRL 结果对比——双 SOTA、成本 30 倍降低、跨模型泛化(Mermaid)
关键发现:98 美元成本下的免梯度 RL 结论
- 30 倍成本降低:JitRL 总成本 98 美元 vs WebRL 3500+ 美元(GPU 训练 Llama-3.1-70B),成本对齐训练时零梯度方法,性能对齐权重更新方法。
- 首次超越在线 RL 微调:WebArena-Lite 上 JitRL Final 60.0% vs WebRL 46.06%,训练时零梯度方法首次在性能上超越在线 RL。
- 跨任务泛化:约 50% 的检索记忆来自不同任务(cross-task),Shopping 跨任务检索率高达 62.19%——说明学到的是抽象流程知识而非死记硬背。
- Logit 更新优于 Prompt 更新:相同记忆检索内容下,logit 调制比 prompt concat 高 3.8pp(Admin 域)——长 context 中 LLM 注意力稀释,logit 直接调制更可靠。
- 跨模型一致提升:GPT-5-mini、DeepSeek-V3.2、Gemini-2.5-flash 均验证有效,logit 机制与 backbone 解耦、模型无关。
- $k=10$ 检索最优:邻居数 8–14 范围内鲁棒;$k=4$ 证据不足、$k=20$ 噪声污染,均导致退化。
局限性:JitRL 的三点限制与作者展望
- 依赖 frozen base model 的候选动作空间:JitRL 只能在 base model 提出的候选集中重加权,无法发现 base model 不会生成的动作。
- LLM Evaluator 信用分配误差:step-wise rewards 由 LLM 生成,若 Evaluator 误判某步贡献,优势估计偏误将导致策略退化。
- 文本化状态检索的局限性:依赖文本相似度(Jaccard),对空间推理(棋类)、时序预测等难以文本化表示的任务效果有限。
作者展望:改进 Evaluator 鲁棒性、探索非文本域的状态表示(如图/结构化嵌入)、扩展至更多 Agent 任务。
常见问题(FAQ)
JitRL 为什么不需要梯度就能做强化学习?
JitRL 把策略优化问题 $\arg\max \mathbb{E}[\widehat{A}] - \frac{1}{\beta}D_{KL}(\pi'||\pi_\theta)$ 在 logit 空间求出精确闭式解 $z' = z + \beta\widehat{A}$:logit 是 softmax 之前的"线性空间",在 logit 上加优势项等效于 Policy Gradient 中 $\nabla\log\pi$ 的效果,但完全免梯度。
什么是"闭式 logit 更新"?
闭式(closed-form)指解是解析表达式:知道优势估计 $\widehat{A}$ 的瞬间就能一步写出最优策略的 logit 调整量,不需要梯度下降迭代。直觉上就是"用经验修正直觉"——$z$ 是初始直觉,$\beta\widehat{A}$ 是经验修正,$\beta$ 控制信任经验的程度。
JitRL 与 Reflexion、AWM 这类免训练方法有何区别?
Reflexion/AWM 把记忆文本拼进 prompt(文本 concat),缺乏数学保证;JitRL 将记忆视为非参数策略分布,用 logit 直接调制 + 三个定理(闭式解最优性、估计一致性、策略收敛)提供严格的理论保证。
JitRL 的成本优势有多大?
总成本约 98 美元(纯 API 调用),而 WebRL 需要 GPU 微调 Llama-3.1-70B,成本 3500+ 美元——30 倍降低,且首次在 WebArena-Lite 上性能反超 WebRL(60.0% vs 46.06%)。
JitRL 能用于哪些模型?
任意提供 log-prob 的模型(Token-level logit),或黑箱模型(Verbalized confidence 转 logit)。论文在 GPT-5-mini、DeepSeek-V3.2、Gemini-2.5-flash 上均验证一致提升,机制模型无关。
参考链接
- arXiv 论文页:https://arxiv.org/abs/2601.18510
- WebArena(评测环境):https://arxiv.org/abs/2307.13854
- WebRL(最强基线):https://arxiv.org/abs/2411.02337
- Reflexion(免训练基线):https://arxiv.org/abs/2303.11366
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)
更多推荐



所有评论(0)