摘要

本文解读 ICML 2026(Oral)论文《Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates》。该论文提出 JitRL 训练时零梯度强化学习框架,通过融合动态非参数记忆检索式优势估计,以闭式公式直接调制 LLM 输出 logits——被严格证明为 KL 约束策略优化目标的精确闭式解,其特别之处在于全程无需任何梯度更新即可实现 LLM Agent 的持续强化学习。实验表明 JitRL 在 WebArena 上达到 46.98% 平均成功率、Jericho Zork1 得分 69,全面超越训练时零梯度基线并首次超越在线 RL 微调方法 WebRL,成本仅 98 美元 vs 3500+ 美元(30 倍降低),为 LLM Agent 的低成本持续学习提供了重要借鉴。

论文基本信息

项目内容
标题(英文)Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates
标题(中文)JitRL:无梯度更新的 LLM Agent 持续强化学习
作者Yibo Li, Zijie Lin, Ailin Deng, Xuan Zhang, Yufei He, Shuo Ji†, Tri Cao, Bryan Hooi
机构National University of Singapore (NUS), School of Computing
会议ICML 2026 (Oral)
arXivhttps://arxiv.org/abs/2601.18510
项目网站暂无公开项目网站(以 arXiv 为准)

背景与动机:LLM Agent 为什么需要持续强化学习?

LLM Agent 在部署后权重通常被冻结,无法从与环境的交互经验中持续改进——这是 Agent 系统落地的核心痛点。现有两条技术路线各有硬伤:

  • 基于梯度的 RL(Gradient-based RL):PPO、GRPO 等在线梯度更新方法(WebRL、ToRL)性能强,但训练成本极高——WebRL 需微调 Llama-3.1-70B,单次训练成本 3500+ 美元,且训练后模型静态,无法随部署环境持续演化。
  • 免训练方法(Training-Free):Reflexion(文本反思)、AWM(工作流记忆)、EvoTest(进化 prompt 优化)成本低,但局限于 prompt 上下文拼接,缺乏数学保证,性能天花板明显。

JitRL 的核心洞察:把记忆视为非参数策略分布,将策略优化问题重新表述为 logit 空间中的闭式更新,从而在训练时零梯度的前提下获得可证明的 RL 保证。

研究主线:从"RL 必须梯度更新"到"免梯度持续 RL"

JitRL 研究主线 Mermaid 流程图:从 RL 必须梯度更新的问题、98 美元成本动机、非参数记忆设计、闭式 logit 更新方法到 WebArena 46.98% 双 SOTA 结论

图 4:JitRL 研究主线——从“RL 必须梯度更新”到“免梯度持续 RL”(Mermaid 流程图)

JitRL 方法总览:与标准 RL 的本质区别

JitRL 与标准 RL 的对比一目了然:标准 RL 在训练期通过历史轨迹做策略梯度更新(需要 GPU 与梯度回传);JitRL 在测试时检索与当前状态相关的历史轨迹,估计优势函数 $\widehat{A}(s,a)$,再通过 KL 正则策略优化目标直接调制输出 logits——全程无梯度、无权重更新。

JitRL 与标准 RL 的对比:标准 RL 在训练期做策略梯度更新,JitRL 在测试时检索当前状态相关轨迹估计优势 A,通过 KL 正则目标调制输出 logits

图 1:JitRL vs 标准 RL——训练期梯度更新 vs 测试时检索 + logit 调制

JitRL 核心设计:记忆构建 → 价值估计 → 闭式更新

JitRL 方法核心设计 Mermaid 流程图:记忆构建、discounted returns 存储、Jaccard 检索价值估计、优势估计到闭式 logit 策略更新

图 5:JitRL 核心设计——记忆构建 → 价值估计 → 闭式更新三阶段循环(Mermaid)

JitRL 方法细节:从轨迹记忆到闭式 logit 调制

JitRL 由三阶段循环构成,每一阶段都无需梯度:

  • Memory Construction(记忆构建):LLM Evaluator 评估完整轨迹 τ,生成每步标量 reward $r_t$,解决稀疏奖励下的信用分配问题;随后计算 discounted returns $G_t = \sum_{u=t}^{T} \gamma^{u-t} r_u$,将 $(s_t, a_t, G_t)$ 存入动态记忆 $\mathcal{M}$。
  • Test-Time Value Estimation(测试时价值估计):对当前状态 s 做 Jaccard 相似度检索,取 top-k 邻居 $\mathcal{N}(s)$;已知动作用邻居的平均 returns 估计 $\widehat{Q}(s,a)$,未知动作加乐观 bonus $\alpha/|\mathcal{N}(s)|$ 鼓励探索。
  • Closed-Form Logit Update(闭式 logit 更新):$z'(s,a) = z(s,a) + \beta \cdot \widehat{A}(s,a)$——Theorem 4.1 证明这是 $\arg\max_{\pi'} \mathbb{E}[\widehat{A}] - \frac{1}{\beta}D_{KL}(\pi'||\pi_\theta)$ 的精确闭式解;Theorem 4.2/4.3 分别保证估计一致性与策略收敛,构成完整的理论链。

JitRL 框架总览:上部 Inference 从记忆检索邻居、估计优势、闭式更新 logits;下部 Memory Update 经 Evaluator 评估轨迹并写回记忆

图 2:JitRL 框架——Inference(检索 → 优势估计 → logit 调制)与 Memory Update(评估 → 回报 → 存储)双循环

值得注意的工程细节:logit 的获取有两种变体——Token-level(模型输出候选索引时直接取 log-probability)与 Verbalized(黑箱模型不暴露 log-prob 时,让 LLM 输出 confidence 0–100 再转为 logit),后者使 JitRL 可适配任意闭源 API 模型。

实验设计与结果:WebArena 与 Jericho 双 SOTA

评测协议:WebArena 5 个网站域(Admin, GitLab, Map, Reddit, Shopping),每 task 执行 $L=5$ episodes,指标为 Avg SR / Final SR;Jericho 3 个文字游戏(Library, Zork1, Zork3),每游戏 50 episodes,指标为 Avg Score / Final Score。多轮序贯测试允许 agent 在 episode 之间从记忆持续学习。

基线:训练时零梯度基线(Static · Memory · Reflexion · AWM · EvoTest,Gemini-2.5-flash backbone)与权重更新基线(SFT、WebRL 微调 Llama-3.1-70B;GRPO 训练 Qwen3-32B)。

WebArena 主表(Avg SR / Final SR %)

MethodShopping AvgShopping FinalMap AvgMap FinalAverage AvgAverage Final
Static24.0625.0030.6231.2535.6336.30
Memory30.1633.1630.4732.8141.3643.00
Reflexion30.8331.2529.3827.3441.0842.12
AWM23.1222.4034.3832.8139.3740.32
EvoTest26.6729.1733.5941.4139.2442.49
JitRL41.6745.8337.6642.1946.9851.35

JitRL 全面超越所有训练时零梯度方法:Avg SR 46.98%(+11.35pp vs Static),Shopping 域 +73.2%、Map 域 +34.7%,且 Final−Avg 差距最大(4.37pp),说明其随 episode 的学习效率最高。

Jericho 结果(Avg / Final Score)

MethodLibrary AvgLibrary FinalZork1 AvgZork1 FinalZork3 Final
Static10.0108.5100
EvoTest21.52646.8544
GRPO13.61116.2102
JitRL25.93053.0695

Zork1 Final 69 vs GRPO 10(+590%)、Library 30 vs GRPO 11——JitRL 的检索式记忆在长 horizon 稀疏奖励游戏中远超梯度 RL。

Jericho 学习曲线:JitRL 快速起步(10-15 episodes 即达竞争性能),随 episode 增加与基线差距持续拉大;GRPO 全程高方差,Memory/AWM 过早平台

图 3:Jericho 学习曲线——JitRL 快速收敛且差距持续拉大,GRPO 高方差

结果对比:JitRL 为什么值得关注

JitRL 结果对比 Mermaid 流程图:WebArena 46.98% 平均成功率、Zork1 Final 69、WebArena-Lite 60.0% 超越 WebRL、98 美元成本 30 倍降低

图 6:JitRL 结果对比——双 SOTA、成本 30 倍降低、跨模型泛化(Mermaid)

关键发现:98 美元成本下的免梯度 RL 结论

  • 30 倍成本降低:JitRL 总成本 98 美元 vs WebRL 3500+ 美元(GPU 训练 Llama-3.1-70B),成本对齐训练时零梯度方法,性能对齐权重更新方法。
  • 首次超越在线 RL 微调:WebArena-Lite 上 JitRL Final 60.0% vs WebRL 46.06%,训练时零梯度方法首次在性能上超越在线 RL。
  • 跨任务泛化:约 50% 的检索记忆来自不同任务(cross-task),Shopping 跨任务检索率高达 62.19%——说明学到的是抽象流程知识而非死记硬背。
  • Logit 更新优于 Prompt 更新:相同记忆检索内容下,logit 调制比 prompt concat 高 3.8pp(Admin 域)——长 context 中 LLM 注意力稀释,logit 直接调制更可靠。
  • 跨模型一致提升:GPT-5-mini、DeepSeek-V3.2、Gemini-2.5-flash 均验证有效,logit 机制与 backbone 解耦、模型无关。
  • $k=10$ 检索最优:邻居数 8–14 范围内鲁棒;$k=4$ 证据不足、$k=20$ 噪声污染,均导致退化。

局限性:JitRL 的三点限制与作者展望

  • 依赖 frozen base model 的候选动作空间:JitRL 只能在 base model 提出的候选集中重加权,无法发现 base model 不会生成的动作。
  • LLM Evaluator 信用分配误差:step-wise rewards 由 LLM 生成,若 Evaluator 误判某步贡献,优势估计偏误将导致策略退化。
  • 文本化状态检索的局限性:依赖文本相似度(Jaccard),对空间推理(棋类)、时序预测等难以文本化表示的任务效果有限。

作者展望:改进 Evaluator 鲁棒性、探索非文本域的状态表示(如图/结构化嵌入)、扩展至更多 Agent 任务。

常见问题(FAQ)

JitRL 为什么不需要梯度就能做强化学习?

JitRL 把策略优化问题 $\arg\max \mathbb{E}[\widehat{A}] - \frac{1}{\beta}D_{KL}(\pi'||\pi_\theta)$ 在 logit 空间求出精确闭式解 $z' = z + \beta\widehat{A}$:logit 是 softmax 之前的"线性空间",在 logit 上加优势项等效于 Policy Gradient 中 $\nabla\log\pi$ 的效果,但完全免梯度。

什么是"闭式 logit 更新"?

闭式(closed-form)指解是解析表达式:知道优势估计 $\widehat{A}$ 的瞬间就能一步写出最优策略的 logit 调整量,不需要梯度下降迭代。直觉上就是"用经验修正直觉"——$z$ 是初始直觉,$\beta\widehat{A}$ 是经验修正,$\beta$ 控制信任经验的程度。

JitRL 与 Reflexion、AWM 这类免训练方法有何区别?

Reflexion/AWM 把记忆文本拼进 prompt(文本 concat),缺乏数学保证;JitRL 将记忆视为非参数策略分布,用 logit 直接调制 + 三个定理(闭式解最优性、估计一致性、策略收敛)提供严格的理论保证。

JitRL 的成本优势有多大?

总成本约 98 美元(纯 API 调用),而 WebRL 需要 GPU 微调 Llama-3.1-70B,成本 3500+ 美元——30 倍降低,且首次在 WebArena-Lite 上性能反超 WebRL(60.0% vs 46.06%)。

JitRL 能用于哪些模型?

任意提供 log-prob 的模型(Token-level logit),或黑箱模型(Verbalized confidence 转 logit)。论文在 GPT-5-mini、DeepSeek-V3.2、Gemini-2.5-flash 上均验证一致提升,机制模型无关。

参考链接

  • arXiv 论文页:https://arxiv.org/abs/2601.18510
  • WebArena(评测环境):https://arxiv.org/abs/2307.13854
  • WebRL(最强基线):https://arxiv.org/abs/2411.02337
  • Reflexion(免训练基线):https://arxiv.org/abs/2303.11366

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

Logo

这里是“一人公司”的成长家园。我们提供从产品曝光、技术变现到法律财税的全栈内容,并连接云服务、办公空间等稀缺资源,助你专注创造,无忧运营。

更多推荐