观点总结如下:
Figure 7 的核心观点 :在 DeepSeek Harness 的 Minimal mode 下,随着 RL training 规模增加,即 cumulative RL steps 增加,模型在多个 code agent benchmarks 上的性能持续提升
长 context 对 long-horizon Agent 任务有额外收益 :进一步把 maximal context length 扩展到 1M tokens,可以继续提升极长 horizon 任务的表现,典型代表是 Terminal-Bench v3.0
Figure 8 左图的核心观点 :联合训练多个 Claude Code 版本时,性能随 cumulative RL steps 增加而提升;浅色曲线表示单个 Claude Code 版本的评估结果,主曲线体现联合训练的整体收益
Figure 8 右图的核心观点 :联合训练异构 scaffolds 同样有效,包括 OpenCode、Pi、DeepSeek Harness 的 Standard 和 PTC modes;性能评估基准为 DeepSWE v1.1,浅色曲线表示单个 scaffold 的结果
RL scaling 有两个关键维度 :一是 training compute,即 cumulative RL steps;二是 scaffold 数量与多样性。两个维度都能带来持续性能提升
三种 RL scaling 场景均有效 :单一 scaffold 内 scaling、同一 scaffold 的多个版本联合训练、异构 scaffolds 联合训练,都能随着 RL steps 增加而改善性能
跨 scaffold 泛化能力强 :模型不依赖单一 harness 或特定 tool schema,在不同 scaffold、不同 system prompt、不同 interaction protocol 下都能保持稳健表现
断开曲线段不是异常 :Figure 7 和 Figure 8 中不连续的曲线段表示 successive RL runs after model reinitialization,即模型重新初始化后的下一轮 RL run
model merging 是聚合 parallel RL compute 的实用手段 :通过合并来自不同 scaffolds 或不同 configurations 的 checkpoints,组合不同 optimization paths 的改进,再用于后续 RL 初始化
model merging 带来双重收益 :既能进一步提升 task performance,也能提升 token efficiency,使 RL scaling 可以跨 successive runs 继续扩展,而不局限于单个训练 run
长 context 与 RL scaling 相互配合 :RL training 规模提升整体能力,1M token context 扩展进一步释放 long-horizon Agent 任务潜力,例如 Terminal-Bench v3.0
异构 scaffold RL 训练基础设施稳定高效 :rollout execution 解耦为 agent sandbox 与 worker container,运行在 DSec 上,位于 preemptible GPU training pool 之外;trainer preemption 时可挂起、卸载并保留完整状态,从而支持跨异构 scaffolds 的稳定 RL 训练