拆解对象:WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning,ICLR 2025。作者来自清华大学与智谱 AI,开源代码在 THUDM/WebRL。与上一篇拆 Search-R1 一样,这里只分析结构为什么好,数字全部出自论文 arXiv 最新版,可对照原表复核。
一、问题定义:三重困境的一次性陈述
开源模型当 web agent,Introduction 一次点名三个困境:
- 任务稀缺:WebArena-Lite 这类环境训练任务有限,静态数据很快学完
- 反馈稀疏:只有任务终局成败信号,没有逐步奖励
- 分布漂移:在线学习与课程推进会让策略失稳,学到的新能力覆盖旧能力
方法节随后按这三件事逐一给出组件,挑战与组件一一映射。这是这篇论文结构上最值得学的骨架。
二、结构上的反常规:Related Works 放在第 4 节
NLP 会议论文的常见排布是 Related Works 紧跟 Introduction;WebRL 把它放到实验之后、结论之前。好处直接可见:Introduction 末尾紧接方法总览图(Figure 2),读者从「痛点」到「方案」零距离,第一遍阅读不需要先穿越十篇引用。ML 系会议对这种排布接受度高,投稿时可以主动利用这个惯例差异。
三、三挑战与三组件的映射
| 挑战 | 组件 | 结构位置 | 专属验证 |
|---|---|---|---|
| 任务稀缺 | 自进化课程:失败任务生成器 + critic 难度过滤 | 2.1 | 3.9 案例分析 |
| 反馈稀疏 | ORM(outcome-supervised reward model) | 2 正文 | 3.8 ORM 单独评估 |
| 分布漂移 | KL 约束 + 经验回放 + 困惑度过滤 | 2.2 | 3.7 消融 |
每个组件在实验节都有专属小节单独检验,方法与实验完全对称。组件可独立拆装的结构,让审稿人能逐项确认贡献,也方便后续工作单独引用其中一件。
三个组件的关键设计:
- 自进化课程:以上一阶段失败的指令为种子做 in-breadth 扩展生成新任务;critic 结合初始状态打分,只保留 0.05 到 0.75 区间的指令,保证任务可行且难度匹配当前能力;再用 GPT-4o 自动排除环境中根本不可完成的任务
- ORM:一个 LLM 奖励模型,比较输出 YES 与 NO 的概率给出二元判定,输入为指令、历史动作与最终状态 HTML。测试集精度 80.8%,高于 GPT-4 的 71.9% 与 GPT-4V 的 71.2%
- 策略更新:带 KL 约束与熵正则的最大熵 RL 目标,off-policy 损失 L = E[(β log(πθ/πref) − A*)²];经验回放只存成功轨迹,并用上一阶段 actor 的困惑度过滤,区间 [1/0.95, 1/0.5] 的动作最优(该区间平均成功率 31.5%,两侧区间分别只有 29.1% 与 23.0%)
四、实验节的分析链:从主结果到单组件验证
实验节 9 个小节是一条三层递进的链:
| 层次 | 小节 | 作用 |
|---|---|---|
| 整体有效 | 3.1 环境与基线、3.2 主结果、3.3 规模效应 | WebArena-Lite 165 个测试用例,三个基座全面超越基线 |
| 机制解释 | 3.4 错误类型分布、3.5 步骤数分层、3.6 复杂度分层 | 解释「为什么有效」:大幅减少中途卡死的循环错误,长步骤与高复杂度任务优势最大 |
| 组件检验 | 3.7 消融、3.8 ORM 评估、3.9 案例 | 把每个组件拆出来单独验证 |
消融的四个变体设计得干净:去掉 replay buffer、去掉 KL 约束、两者都去掉、去掉课程学习,每次只动一个部件。结论各自成立:无 buffer 性能随时间恶化,KL 约束一致优于 REINFORCE 式更新,去掉课程则上限更低。
五、开场图直接立论
Figure 1 放在 Introduction:专有模型与开源模型的成功率对比,WebRL 训练后的 GLM-4 与 Llama 站在最右,GPT-4-Turbo 的 17.6% 被压在下方。摘要里的关键数字全部浓缩在这张图里:
| 模型 | WebArena-Lite 成功率 |
|---|---|
| Llama-3.1-8B(训练前 → 后) | 4.8% → 42.4% |
| GLM-4-9B(训练前 → 后) | 6.1% → 43.0% |
| Llama-3.1-70B(训练前 → 后) | 12.7% → 49.1% |
| 同基座 8B 用 SFT | 20.6% |
| GPT-4-Turbo / GPT-4o | 17.6% / 13.9% |
| 此前开源最优 AutoWebGLM | 18.2% |
相比 GPT-4-Turbo 相对提升超过 160%。读论文的人扫一眼图就知道主张是什么,这种「开场即结论」的图值得优先设计。
六、能学走的三个技巧
- 挑战、组件、验证三点映射:方法节每个小节在实验节都有对偶小节,审稿人核对贡献时不用自己拼图
- 消融设计成独立可拆的变体:每个变体只去掉一个部件,任何一条结论都能被单独引用
- 附录三段式论证方法合法性:附录 A 依次给推导(A.1)、理论证明(A.2)、与 DPO/PPO/AWR 的特性对比表(A.3 Table 4),把「这个更新规则凭什么成立」的完整论证后置,正文保持轻装
尾注:对我自己工作的映射
自进化课程的实质是从失败里长出训练任务:失败指令做种子,critic 卡难度区间,任务难度随能力外推。做 QQ 飞车赛后教练的 Phase 0 数据可行性验证时,这个思路有直接参考价值:冷启动数据不足的场景,任务的「生成与过滤」流水线本身可以成为数据建设的一部分,让训练集随模型能力一起生长。
参考
- 论文:arXiv:2411.02337,发表于 ICLR 2025(Poster)
- 代码:github.com/THUDM/WebRL
- OpenReview:forum?id=oVKEAFjEqv