WebRL 拆解:ICLR 2025 论文怎么把自进化课程讲成闭环

从结构解剖视角读一篇 web agent 强化学习论文

Posted by Kevin on September 3, 2026

拆解对象:WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning,ICLR 2025。作者来自清华大学与智谱 AI,开源代码在 THUDM/WebRL。与上一篇拆 Search-R1 一样,这里只分析结构为什么好,数字全部出自论文 arXiv 最新版,可对照原表复核。

一、问题定义:三重困境的一次性陈述

开源模型当 web agent,Introduction 一次点名三个困境:

  1. 任务稀缺:WebArena-Lite 这类环境训练任务有限,静态数据很快学完
  2. 反馈稀疏:只有任务终局成败信号,没有逐步奖励
  3. 分布漂移:在线学习与课程推进会让策略失稳,学到的新能力覆盖旧能力

方法节随后按这三件事逐一给出组件,挑战与组件一一映射。这是这篇论文结构上最值得学的骨架。

二、结构上的反常规:Related Works 放在第 4 节

NLP 会议论文的常见排布是 Related Works 紧跟 Introduction;WebRL 把它放到实验之后、结论之前。好处直接可见:Introduction 末尾紧接方法总览图(Figure 2),读者从「痛点」到「方案」零距离,第一遍阅读不需要先穿越十篇引用。ML 系会议对这种排布接受度高,投稿时可以主动利用这个惯例差异。

三、三挑战与三组件的映射

挑战 组件 结构位置 专属验证
任务稀缺 自进化课程:失败任务生成器 + critic 难度过滤 2.1 3.9 案例分析
反馈稀疏 ORM(outcome-supervised reward model) 2 正文 3.8 ORM 单独评估
分布漂移 KL 约束 + 经验回放 + 困惑度过滤 2.2 3.7 消融

每个组件在实验节都有专属小节单独检验,方法与实验完全对称。组件可独立拆装的结构,让审稿人能逐项确认贡献,也方便后续工作单独引用其中一件。

三个组件的关键设计:

  1. 自进化课程:以上一阶段失败的指令为种子做 in-breadth 扩展生成新任务;critic 结合初始状态打分,只保留 0.05 到 0.75 区间的指令,保证任务可行且难度匹配当前能力;再用 GPT-4o 自动排除环境中根本不可完成的任务
  2. ORM:一个 LLM 奖励模型,比较输出 YES 与 NO 的概率给出二元判定,输入为指令、历史动作与最终状态 HTML。测试集精度 80.8%,高于 GPT-4 的 71.9% 与 GPT-4V 的 71.2%
  3. 策略更新:带 KL 约束与熵正则的最大熵 RL 目标,off-policy 损失 L = E[(β log(πθ/πref) − A*)²];经验回放只存成功轨迹,并用上一阶段 actor 的困惑度过滤,区间 [1/0.95, 1/0.5] 的动作最优(该区间平均成功率 31.5%,两侧区间分别只有 29.1% 与 23.0%)
Actor(阶段 t) 在当前课程任务上 执行 web 轨迹 ORM 奖励模型 P(YES)/P(NO) 二元判定 精度 80.8% > GPT-4 71.9% 课程进化器 失败指令做种子 in-breadth 扩展 critic 难度过滤 [0.05, 0.75] GPT-4o 排除不可完成任务 策略更新 KL 约束 + 熵正则 经验回放只存成功轨迹 困惑度过滤 [1/0.95, 1/0.5] 轨迹 + 终态 HTML 失败任务 新课程(阶段 t+1) 更新后的 actor 成功轨迹入回放 自进化闭环 Figure 2 仿绘:任务从失败里长出来,难度随能力外推;三挑战(任务稀缺 / 反馈稀疏 / 分布漂移)各有专属组件与专属验证小节
自进化课程闭环仿绘:失败任务生成新课程,ORM 提供稠密判定,KL 约束与回放防漂移

四、实验节的分析链:从主结果到单组件验证

实验节 9 个小节是一条三层递进的链:

层次 小节 作用
整体有效 3.1 环境与基线、3.2 主结果、3.3 规模效应 WebArena-Lite 165 个测试用例,三个基座全面超越基线
机制解释 3.4 错误类型分布、3.5 步骤数分层、3.6 复杂度分层 解释「为什么有效」:大幅减少中途卡死的循环错误,长步骤与高复杂度任务优势最大
组件检验 3.7 消融、3.8 ORM 评估、3.9 案例 把每个组件拆出来单独验证

消融的四个变体设计得干净:去掉 replay buffer、去掉 KL 约束、两者都去掉、去掉课程学习,每次只动一个部件。结论各自成立:无 buffer 性能随时间恶化,KL 约束一致优于 REINFORCE 式更新,去掉课程则上限更低。

五、开场图直接立论

Figure 1 放在 Introduction:专有模型与开源模型的成功率对比,WebRL 训练后的 GLM-4 与 Llama 站在最右,GPT-4-Turbo 的 17.6% 被压在下方。摘要里的关键数字全部浓缩在这张图里:

模型 WebArena-Lite 成功率
Llama-3.1-8B(训练前 → 后) 4.8% → 42.4%
GLM-4-9B(训练前 → 后) 6.1% → 43.0%
Llama-3.1-70B(训练前 → 后) 12.7% → 49.1%
同基座 8B 用 SFT 20.6%
GPT-4-Turbo / GPT-4o 17.6% / 13.9%
此前开源最优 AutoWebGLM 18.2%

相比 GPT-4-Turbo 相对提升超过 160%。读论文的人扫一眼图就知道主张是什么,这种「开场即结论」的图值得优先设计。

010203040 GPT-4o GPT-4-Turbo AutoWebGLM 此前开源最优 同基座 8B · SFT Llama-3.1-8B GLM-4-9B Llama-3.1-70B 13.9% 17.6% 18.2% 20.6% 4.8% 42.4% 6.1% 43.0% 12.7% 49.1% WebRL 训练前 WebRL 训练后 Figure 1 仿绘 · WebArena-Lite 165 测试用例成功率(%)· 8B 相对 GPT-4-Turbo 提升超 160%
Figure 1 仿绘:训练前后同基座对比让「开源反超专有」的主张一眼可读,灰色小条是训练前的起点

六、能学走的三个技巧

  1. 挑战、组件、验证三点映射:方法节每个小节在实验节都有对偶小节,审稿人核对贡献时不用自己拼图
  2. 消融设计成独立可拆的变体:每个变体只去掉一个部件,任何一条结论都能被单独引用
  3. 附录三段式论证方法合法性:附录 A 依次给推导(A.1)、理论证明(A.2)、与 DPO/PPO/AWR 的特性对比表(A.3 Table 4),把「这个更新规则凭什么成立」的完整论证后置,正文保持轻装

尾注:对我自己工作的映射

自进化课程的实质是从失败里长出训练任务:失败指令做种子,critic 卡难度区间,任务难度随能力外推。做 QQ 飞车赛后教练的 Phase 0 数据可行性验证时,这个思路有直接参考价值:冷启动数据不足的场景,任务的「生成与过滤」流水线本身可以成为数据建设的一部分,让训练集随模型能力一起生长。

参考

  • 论文:arXiv:2411.02337,发表于 ICLR 2025(Poster)
  • 代码:github.com/THUDM/WebRL
  • OpenReview:forum?id=oVKEAFjEqv