注:本文包含 AI 辅助创作
整体总结
- 核心贡献
- Zero RL 能在万亿参数规模上稳定扩展 :
- 通过少量极简优化训练 Ring-2.5-1T-Zero
- Cliped IS(CISPO)
- Training-Inference Ratio Correction
- 混合精度控制
- 注:极简设计足以解决系统瓶颈,从零开发高质量推理
- 在七个数学基准上取得了有竞争力的结果
- 论文回答了这个根本性问题:Zero RL 在万亿参数级别上能够扩展
- 通过少量极简优化训练 Ring-2.5-1T-Zero
- 提出三维 CoT 质量评估框架 :构建了独立于最终答案正确性之外的评估体系,从三个维度衡量推理轨迹的内在质量
- 可理解性(Comprehensibility)
- 可复现性(Reproducibility)
- 效率(Efficiency)
- 实证验证了“苦涩的教训”在超大模型上的有效性 :
- 证明了万亿参数模型不仅能解锁更高的样本效率和性能上限,还能自主涌现复杂的认知策略(无需人工挖掘格式或 Pattern)
- Zero RL 能在万亿参数规模上稳定扩展 :
- 核心 Insight:
- 扩展定律决定能力天花板 :
- 将参数规模从 104B 提升至 1T 显著提高了 Zero RL 的样本效率和最终性能上限
- 证明参数容量是利用 Zero RL 探索推理边界的根本前提
- RL 的训练动态遵循明确的“发现-锐化”两阶段顺序 :
- 训练初期 RL 通过唤醒预训练中休眠的潜在路径来扩展推理边界(发现)
- 后期在此边界内精炼策略以提高输出稳定性(锐化),两者并非对立而是前后相继的关系
- 高级认知策略无需人工设计即可在超大规模下自主涌现 :
- 在 1T 模型上,拟人化表达、结构化格式、并行推理、自我验证和上下文焦虑等复杂行为完全由纯 RL 自驱动产生,完全绕过了人工标注的格式奖励或验证模板
- 训练与推理引擎间的微小数值差异是大规模 RL 崩溃的元凶 :
- 低概率 Token 的梯度放大效应会使 Megatron 和 SGLang 间的浮点不一致性急剧累积
- 将重要性比率分子替换为实际训练引擎 Logits 可直接消除此偏差,比复杂的阈值裁剪更有效
- 论文认为:Token-level 损失必然导致盲目的“长度惯性”而非自适应推理 (存在疑问)
- 模型会无差别地填满可用上下文窗口以获取累积奖励,即使在简单问题上也膨胀 Token 数,因此必须通过自蒸馏压缩轨迹并切换为 Sample-level Loss 聚合 来强行打破这种惰性
- 理解:关于 Token-level Loss 聚合 和 Sample-level Loss 聚合 对长度鼓励与否的分析
- 注意:本文的观点和之前的感觉不同,Token-level Loss 聚合 似乎并没有鼓励模型输出长度变长,除非正确答案的长度比错误答案更长
- 原因:因为错误的负样本也会被打压的更惨
- 本文观察到 Token-level Loss 聚合 在鼓励模型长度更长的原因可能是因为在当前模型下,“对于相同的 Prompt,Response 输出越长,其正确的概率确实越大!”
- 理解:Sample-level Loss 本质是在鼓励正确的短样本,并偏好与错误的长样本
- 这个理解是看每个 Token 收到的鼓励和惩罚来看的,因为 Token 才是模型的实际输出粒度!
- 不论那种方式,只要满足在当前 Step 下(数据和模型确定下) “对于相同的 Prompt,Response 输出越长,其正确的概率越大” ,则一定会导致轨迹越来越长,除非奖励里面对长度有惩罚
- 注意:本文的观点和之前的感觉不同,Token-level Loss 聚合 似乎并没有鼓励模型输出长度变长,除非正确答案的长度比错误答案更长
- 自然数据的长尾难度分布对 RL 训练并非最优 :
- 真实世界中绝大多数问题过于简单(67.6% 可在 4k Token 内解决),在训练中保留这种分布会浪费计算资源,唯有动态课程式地主动过滤简单样本并持续提升难度,才能有效扩展模型的推理边界
- Reasoning Format 优化 :
- 比较了
<think>...</think>和<think>...</think><answer>...</answer>两种格式标签,并最终证明<think>...</think><answer>...</answer>效果更好,所有 RL 训练流程全程使用这种格式
- 比较了
- 扩展定律决定能力天花板 :
- 本文的一些问题总结:
- 问题:图 4b 中,GSPO 的起始 Reward 居然比别的方法高,上报有问题
- 问题:图 5c 和 图 5b 的第 0 个 Step 指标应该是一样的,但看着不同,上报有问题
- 问题:本文对于 Token-level Loss 聚合的理解有问题,似乎错误的认为 Token-level Loss 聚合在任何场景下都在鼓励长 Response,实际上并没有鼓励,也没有打压
- 本文与 DeepSeek-R1 等先前工作的四个主要区别:
- 1)关注推理过程的内在质量 :先前工作主要评估最终答案准确率,论文批判性评估中间 CoT 轨迹,提出三维评估框架
- PS:其实之前的其他部分工作也会关注 CoT 的长度和质量的
- 2)扩展为多阶段自迭代过程 :
- 设计渐进式流程持续改进推理能力
- 引入多种推理模式使单模型动态适应问题复杂度
- 遵循极简设计原则,仅实现严格必要的优化
- 3)**”苦涩的教训”的强实证验证** :
- 大规模计算和模型规模超越人类工程启发式(比如不需要人工提前定义 System Prompt 给定格式等)
- 1T 参数规模解锁更高性能上限和更优训练效率
- 4)高级认知策略的自发涌现 :
- 先前 RL 模型展示的是基本的自我反思
- Ring-2.5-1T-Zero 则进花到更复杂的思维机制,使复杂的人工推理流程不再必要(无需人工挖掘格式或 Pattern)
- 注:这一点和前一点相似
- 1)关注推理过程的内在质量 :先前工作主要评估最终答案准确率,论文批判性评估中间 CoT 轨迹,提出三维评估框架
背景 & 动机
- “Zero RL” 范式(如 DeepSeek-R1 所示)完全摒弃了监督微调阶段,直接从预训练基座模型出发进行强化学习,通过试错机制自主激发问题解决策略
- Zero RL 在小规模模型上取得了成功,但 当 Zero RL 应用于万亿参数级别的模型时,训练动态和涌现能力将如何演化? 是未知的
- 本文的核心目标是从基座模型中激发高质量的推理行为
CoT质量评估框架
- 论文预先定义了理想 CoT 轨迹应具备的特征,并构建了三维评估框架:
Comprehensibility
- 定义 :人类读者能在无需外部上下文、不承受高认知负荷的情况下跟进推理步骤的程度
- 评估方法 :采用 LLM-as-a-Judge 的成对比较框架
- 评判 LLM 基于三个子标准进行评估:
- 1)逻辑连贯性(Logical Coherence) :每一步是否自然地从前一步推导而来
- 2)因果明确性(Causal Explicitness) :因果依赖关系是否被显式陈述
- 3)无幻觉(Absence of Hallucinations) :内容是否无幻觉事实、错误中间结果或未经支持的断言
- 评判模型输出格式为:
1
2
3
4{
"analysis": "<2-4句比较分析>",
"verdict": "<A | Tie | B>"
}
Reproducibility
- 定义 :缺乏先验知识的智能体(如新手人类或较弱的学生模型)能否有效且高效地学习底层推理过程并获得可比较的任务解决能力
- 评估方法 :通过 Knowledge Distillation 来衡量
- 将生成的 CoT 轨迹用于微调较弱的学生模型,以学生模型的下游性能增益作为代理指标
- 增益越大,表明教师轨迹携带了更丰富、更可迁移的推理技能
Efficiency
- 定义 :模型简洁地解决问题、避免不必要冗长、冗余推导或循环逻辑的能力
- 评估方法 :计算正确 CoT 轨迹的平均 Token 数量
- 在有效解中,Token 越少表示效率越高
方法论
核心设计原则:Minimalism,极简主义
- 论文的核心设计原则是极简主义
- 基于 “过复杂的算法设计往往不必要” 这一发现,仅在严格需要引导模型迭代学习时才引入优化元素
多阶段训练流程总览
- 训练流程包含四个不同阶段 ,图 1(a) 展示了完整概览:
- 1)第一阶段 RL :从基座模型激发推理能力
- 2)自蒸馏阶段(Self-Distillation) :压缩 CoT 轨迹并重置训练-推理引擎差距
- 3)第二阶段 RL :采用 Sample-level Loss 聚合 进行持续优化
- 4)第三阶段 RL :引入分级训练,赋予模型自适应推理深度
第一阶段 RL:推理激发,Reasoning Elicitation
第一阶段 RL 设计思路
- 在 Zero-RL 中,训练直接从缺乏初始推理能力的预训练基座模型开始
- 基座策略下推理 Token 的概率极低(很少生成逐步推导)
- 因此,初始 RL 阶段必须 激进地放大低概率推理 Token
Clipped Importance-Sampling Policy Gradient
- 采用 CISPO(MiniMax, 2025)算法,其核心创新在于:与标准 PPO-clip 完全将裁剪范围外的 Token 梯度置零不同,该方法仅对裁剪比率应用 stop-gradient,同时允许所有 Token 的梯度流通
- 这确保了每个生成的 Token 都对学习过程有贡献
- CISPO 目标函数 :
$$
\mathcal{I}(\theta) = \mathbb{E}_{q \sim \mathcal{D}, \{o_i\}_{i=1}^G \sim \pi_{\text{S} } } \left[ \sum_{i=1}^{G} \sum_{t=1}^{|o_i|} \text{sg}(\hat{\rho}_{i,t}) \cdot \hat{A}_{i,t} \cdot \log \pi_{\text{M} }^{\theta}(o_{i,t} \mid q, o_{i,< t}) \right]
$$- \( q \):从数据集 \(\mathcal{D}\) 采样的输入问题
- \( \{o_i\}_{i=1}^G \):从推理引擎 \(\pi_{\text{S} }\) 采样的 \( G \) 个 Rollout 响应
- \( o_{i,t} \):第 \( i \) 个响应的第 \( t \) 个 Token
- \( \hat{A}_{i,t} \):使用 GRPO 风格组归一化奖励计算的 Advantage 估计
- \( \text{sg}(\cdot) \):Stop-gradient 算子
- \( \hat{\rho}_{i,t} \):裁剪后的重要性比率
- \(\pi_{\text{M} }^{\theta}\) 训练引擎(Megatron)对应的策略
- \(\pi_{\text{S} }^{\theta}\) 推理引擎(Sglang)对应的策略
Training-Inference Ratio Correction
- 关键 Insight :
- 放大低概率 Token 会放大一个关键的系统级漏洞:训练引擎(Megatron)与推理引擎(SGLang)之间的数值差异
- 浮点精度和内核实现的差异产生略微不同的 Logits,这些微小差异可能累积成宏观的训练崩溃
- 解决方案 :将重要性采样比率的分子替换为实际的训练引擎 Logits :
$$
\begin{align}
\rho_{i,t} = \frac{\pi_{\text{M} }^{\theta}(o_{i,t} \mid q, o_{i,< t})}{\pi_{\text{S} }^{\theta_{\text{old} } }(o_{i,t} \mid q, o_{i,< t})} \\
\hat{\rho}_{i,t} = \text{clip}(\rho_{i,t}, \epsilon_{\text{low} }, \epsilon_{\text{high} })
\end{align}
$$- \( \pi_{\text{M} }^{\theta} \):训练引擎中参数为 \( \theta \) 的当前策略
- \( \pi_{\text{S} }^{\theta_{\text{old} } } \):推理引擎中使用旧参数 \( \theta_{\text{old} } \) 的 Rollout 策略
- \( \epsilon_{\text{low} } \):下界(论文不设置下界)
- \( \epsilon_{\text{high} } \):上界(设为 5.0),防止过大的更新
KL 散度惩罚
- 为进一步稳定训练,对冻结的参考模型施加 KL 散度惩罚 ,防止策略偏离参考模型过远:
$$
\mathcal{L}_{\text{KL} }(\theta) = \sum_{i=1}^{G} \sum_{t=1}^{|o_i|} \mathcal{D}_{\text{KL} } \left( \pi_{\text{M} }^{\theta}(\cdot \mid q, o_{i,< t}) \parallel \pi_{\text{ref} }(\cdot \mid q, o_{i,< t}) \right)
$$- \( \pi_{\text{ref} } \) 是冻结的参考策略模型
第一阶段 RL 总损失
- 第一阶段 RL 总损失为:
$$
\mathcal{L}_{\text{Ring-2.5-1T-Zero-1} }(\theta) = -\mathcal{I}(\theta) + \beta \cdot \mathcal{L}_{\text{KL} }(\theta)
$$- \( \beta \) 是 KL 惩罚系数(设为 \( 10^{-4} \)),平衡探索与稳定性
Self-Distillation:压缩与稳定化
Self-Distillation 设计动机
- 第一阶段的 Token-level Loss 聚合 虽然成功激发了推理能力,但引入两个关键缺陷:
- 1)过度冗长 :生成的 CoT 轨迹过长,包含冗余步骤、循环逻辑和不必要的赘述
- 2)训练不稳定 :极端长度严重破坏 RL 稳定性,训练与推理引擎的数值差异累积,急剧扩大训练-推理差距,导致优化崩溃
两步骤长度精炼过程
- 步骤 1 :使用第一阶段专家策略 \( \pi_{\text{expert} } \) 为每个查询采样多个 Rollout,从中选择最短的正确推理轨迹
- 步骤 2 :Prompt 模型对选中的轨迹进行自我评估 ,过滤掉任何被识别为冗余的段落
- 这有效地修剪了循环逻辑,压缩了冗长推导,同时不牺牲正确性
Self-Distillation 损失
- 将精炼后的高质量语料库用于通过标准监督学习微调原始基座模型:
$$
\mathcal{L}_{\text{self-distillation} }(\theta) = -\mathbb{E}_{q \sim \mathcal{D}, o \sim \pi_{\text{expert} } } \left[ \sum_{t=1}^{|o|} \log \pi_{\theta}(o_t \mid q, o_{< t}) \right]
$$- \( o \) 表示长度精炼后的响应
- \( \pi_{\theta} \) 是基座预训练模型
- Self-Distillation 效果 :
- 通过用缩短的响应进行蒸馏,模型获得专家的推理能力,同时产生更简洁的轨迹,并有效消除了引擎间累积的数值错误,为后续 RL 阶段提供了高度有能力、简洁且稳定的基础
第二阶段 RL:Sustained Optimization
背景 & 分析
- 自蒸馏后,模型展现出更小的训练-推理 Gap,为下一阶段 RL 提供了稳定起点
- 第二阶段 RL 相对第一阶段 RL 的关键变化在于 损失计算策略
Sample-level Loss 聚合
- 第一阶段使用 Token-level Loss 聚合 以鼓励更长响应,但模型现在自然产生长 CoT
- Token-level Loss 聚合 的含义是 Token 等权,长 Response 的权重会更大,对模型的影响也越大
- 继续使用 Token-level Loss 聚合 会导致输出长度无界增长,破坏自蒸馏获得的简洁性
- 解决方案 :转为 Sample-level Loss 聚合 ,使梯度幅度与输出长度无关:
$$
\mathcal{L}_{\text{Ring-2.5-1T-Zero-2} }(\theta) = -\mathbb{E}_{q \sim \mathcal{D} } \left[ \sum_{\{o_i\}_{i=1}^G \sim \pi} \frac{1}{|o_i|} \sum_{t=1}^{|o_i|} \text{sg}(\hat{\rho}_{i,t}) \cdot \hat{A}_{i,t} \cdot \log \pi_{\theta}(o_{i,t} \mid q, o_{i,< t}) \right]
$$ - 理解:这里说是 Sample-level Loss 聚合,实际上仅仅考虑了损失的聚合方式,这里 Sample-level Loss 聚合 的含义是样本等权
- 注:Token-level Loss 聚合 的含义则是 Token 等权
- 注:我们平时使用最多的也是 Sequence-mean-Token-mean,属于是本文所谓的 Sample-level Loss 聚合
其他配置
- 保持与第一阶段相同的裁剪重要性采样策略梯度和比率校正
- 移除 KL 惩罚(不再需要)
- 更新参考模型的频率:每 400 步用最新检查点更新
第三阶段 RL:Tier-Based Training,分级自适应训练
背景
- 不同问题固有地需要不同层次的推理深度
- 但标准训练流程通常产生受固定响应预算约束的单模式模型
- 为解决此问题,引入分级训练
- 将问题按难度分为三个等级:
- 低(Low,4k Token)
- 中(Medium,16k Token)
- 高(High,64k Token)
- 每个等级接收特定的 System Prompt,教会模型根据可用推理预算自适应其推理深度
推理模式
- 训练完成后,模型支持三种不同的推理模式:
- High 模式(64k 预算)
- Medium 模式(16k 预算)
- Low 模式(4k 预算)
- 这实现了从刚性的”一刀切”到动态的、查询依赖的计算分配的转变
Reward Design
- 整个训练过程中,奖励由准确性组件 和格式组件 组成:
$$
r_i = r_{\text{acc},i} + r_{\text{format},i}
$$- \( r_{\text{format},i} \in \{0, 1\} \):检查响应是否遵循所需结构(
<think>...</think>和<answer>...</answer>标签) - \( r_{\text{acc},i} \in \{0, 1\} \):衡量最终答案的正确性
- \( r_{\text{format},i} \in \{0, 1\} \):检查响应是否遵循所需结构(
- 早期训练阶段 :使用易于验证 的问题,正确性通过确定性规则匹配判断
- 后期阶段 :问题难度显著增加,答案可能采用多种有效形式或需要语义理解
- 规则验证变得不可靠,因此将 \( r_{\text{acc},i} \) 替换为 LLM-as-a-Judge 评估器(Qwen3-Next-80B-A3B-Instruct),接收模型响应和参考答案,输出二值正确性判断
- 问题:问题难度增加,不一定代表验证难度增加吧
- 论文比较了两种格式规范:
- 格式 A :仅要求单一开标签
<think>...</think>→ 模型利用松散格式,在答案后附加无尽乱码,序列长度快速增长而奖励停滞 - 格式 B :要求双闭合标签
<think>...</think><answer>...</answer>,响应必须以 EOS Token 结束 → 防止由尾部垃圾驱动的退化长度增长 - 最终通过实验验证并选择了格式 B
- 格式 A :仅要求单一开标签
Infra 优化
Infra 总体架构
- 训练引擎 :Megatron
- 推理/Rollout 引擎 :SGLang
- RL 流程编排 :Areal 框架(2025)
- 硬件 :320 × H200 GPU
Context Parallelism Optimization
- 长上下文窗口训练需要上下文并行(CP)将单条长序列分区到多个设备
- 标准 Ring Attention 的瓶颈 :KV Chunk 按顺序在环中传递,每个设备必须等待与所有其他设备的完整通信轮次才能完成注意力计算,造成严重延迟瓶颈
- Ring Attention 让每张卡只需要维护自己那部分 Sequence chunk 的 MHA
- 本文的优化策略 :针对模型的混合架构(MLA + Lightning Attention 层):
- 1)MLA 层(DeepSeek-AI, 2024):采用 All-to-All CP 策略
- 沿 Head 维度使用单次集合通信重排数据,每个设备可独立计算整个序列中部分 Head 的完整注意力
- 由于 MLA 将 Key 和 Value 压缩到低秩潜在空间,All-to-All 通信量相比发送完整 KV 张量大幅减少
- 2)Lightning Attention 层(2024):计算依赖于小尺寸、固定大小的 KV 状态矩阵
- 使用单次 AllGather 操作 一次性将所有本地状态广播到所有设备,立即可完成计算
- 这些优化在数学上等价于标准 Ring 注意力,产生相同的梯度
- 1)MLA 层(DeepSeek-AI, 2024):采用 All-to-All CP 策略
混合精度控制
- 论文还实现了混合精度控制以确保稳定高效训练
实验
实验设置
- 基座模型
- 从两个预训练的 Ling-2.5 基座模型开始,未经任何监督微调 :
- 1)Ling-2.5-1T-Base :1T-A63B
- 2)Ling-2.5-flash-Base :104B-A7.4B
- 从两个预训练的 Ling-2.5 基座模型开始,未经任何监督微调 :
- 超参数
- 一些超参数汇总表格
参数 第一阶段 RL 后续阶段 Batch Size 512 256 Minibatch Size 32 32 优化器 Adam Adam \(\beta_1, \beta_2\) 0.9, 0.999 0.9, 0.999 学习率 \(2 \times 10^{-6}\)(常数) \(2 \times 10^{-6}\)(常数) Weight Decay 0.01 0.01 Rollout 数量 \(G\) 16 16 采样温度 1.0 1.0 \(\epsilon_{\text{high} }\) 5.0 5.0 \(\epsilon_{\text{low} }\) 无下界 无下界 - 其他超参数设置
- KL 惩罚 :第一阶段使用 \(\beta = 10^{-4}\),后续阶段移除
- 课程学习(Curriculum Learning) :响应窗口从 4k 逐步扩展到 64k Token,每 800 步翻倍
- 参考模型更新 :每 400 步用最新检查点更新参考模型,确保 KL 锚点与策略改进保持相关
- 自蒸馏微调 :3 Epochs,序列长度 64k,学习率 \(7 \times 10^{-5}\)
- 一些超参数汇总表格
- 评估基准:七个具有挑战性的数学推理基准
- AIME 2024, AIME 2025, AIME 2026
- HMMT February 2025, HMMT November 2025, HMMT February 2026
- IMOAnswerBench
- 评估参数 :温度 0.6,Top-k 0.95,Pass@1 准确率(64 次运行平均)
主要结果
- 整体结果表(当前模型与 SOTA 模型的对比):

- 结果1:Zero RL 从零实现有竞争力的推理
- Ring-2.5-1T-Zero(第一阶段 RL)在 AIME 2026 上达到 84.2% 的准确率,证明第一阶段 RL 能有效从预训练基座模型激发高级数学推理
- 课程式响应窗口扩展(4k→64k)结合重要性比率校正,稳定有效地激励模型发展涌现的 CoT 行为
- 结果2:每个后续阶段都带来可测量的性能提升,验证了多阶段方法的整体有效性
模型阶段 AIME 2024 AIME 2025 AIME 2026 第一阶段 RL 89.1 83.3 84.2 自蒸馏 92.3 87.3 88.1 第二阶段 RL 93.5 91.6 92.5 第二阶段 RL (Yarn=2) 94.1 92.3 93.2 - 结果3:自适应推理模式提供灵活的性能-效率权衡
模式 训练截断 推理 Token AIME 2024 Low 4k 2,353 82.3 Medium 16k 8,085 90.9 High 128k (Yarn=2) 20,817 93.2 - 注:第三阶段 RL 的性能略低于第二阶段峰值,主要归因于:
- 1)缺乏高质量超长推理数据限制了 High 模式的上界
- 2)三个不同长度联合训练引入负迁移(Negative Transfer)
- 注:第三阶段 RL 的性能略低于第二阶段峰值,主要归因于:
- 结果4:模型规模放大了 Zero RL 收益(问题:其实应该是跟原来的 Base 比才合适,不然模型参数多了,效果肯定是提升的,不能说明 Zero-RL 本身如何)
- Ring-2.5-flash-Zero(104B):AIME 2024 71.2%,AIME 2025 63.5%
- Ring-2.5-1T-Zero(1T):AIME 2024 89.1%,AIME 2025 83.3%
- 在更难基准上性能差距更为显著,证明在 Zero RL 设置中,激进的参数扩展至关重要
- 更多参数提供必要的表示能力和更宽的内部知识库,以自主导航巨大的搜索空间
补充:第一阶段的训练动态
- 图 2 展示了 Ring-2.5-1T-Base 模型在第一阶段 RL 中的训练过程
- (a)(b) 前 2800 步:使用初始相对简单的数据,Reward 和 Sequence Length 平稳上升,表明模型正从零开始自举推理能力
- (c)(d) 切换到更难的新数据后:模型继续提升,奖励持续增长,同时序列长度也保持增长,说明难度递增的课程学习有效推动了推理边界
CoT 质量评估结果
- 整体评估结果:
可理解性结果
- 论文观察到 1T 模型自发发展出结构分段的推理
- 即使没有显式格式约束,也会使用
Step 1:、Step 2:等标记自然地划分推理阶段 - 理解:应该是跟模型预训练和 Mid-traing 阶段看过类似数据有关
- 即使没有显式格式约束,也会使用
- 量化评估 :使用 LLM-as-a-Judge 对全部 90 个 AIME 问题(2024-2026)进行成对比较,将论文模型与四个强基线(GLM-5.1、Kimi-k2.6、MiniMax-M2.7、Qwen3.5-397B)对比
- 论文模型在所有对比中均取得主导性胜率(图 3a),确认涌现的结构化推理反映了真正优越的逻辑组织
可复现性结果
- 蒸馏设置 :
- 将论文模型的推理轨迹蒸馏到 Qwen2.5-32B 和 Llama3.3-70B-Instruct,使用仅 100K 数据样本(DeepSeek-R1 使用 800K)
学生模型 从 Ring-Zero 蒸馏 从 DeepSeek-R1 蒸馏 增益 Qwen-32B 78.4 72.6 +5.8 Llama-70B 74.5 70.0 +4.5
- 将论文模型的推理轨迹蒸馏到 Qwen2.5-32B 和 Llama3.3-70B-Instruct,使用仅 100K 数据样本(DeepSeek-R1 使用 800K)
- 从 Ring-Zero 轨迹蒸馏模型需要的数据量显著更少,且优于 DeepSeek-R1 对应版本
- 证明本文的分步分段推理轨迹提供了更丰富、更可迁移的学习信号
- 理解:不一定,有可能仅仅是模型效果本身带来的,而且可能和教师 VS 学生模型的分布有关
效率结果
- 在所有五个模型都正确回答的 AIME 问题子集上比较平均 Token 数:
- Ring-Zero :6,368 Tokens
- 其他 4 个 SOTA 模型:超过 12,000 Tokens
- 理解:Ring-Zero 的 Token 效率至少是其他模型的 2 倍以上
- 但这个比较可能不是很公平,因为 Ring-Zero 的效果并不如其他模型,如果一味的压低模型的 Token 数,且仅看大家都正确的 Query,确实可能会得到很高的 Token 效率
补充:详细分析
不同 RL 算法对比
- 在 Flash Model 上比较四种 RL 算法:GRPO、DAPO、CISPO、GSPO

- 关键 Insight :
- CISPO 和 DAPO 通过放大低概率 Token 的梯度信号,比 GRPO 更快减少全失败组比率,实现更快的奖励增长和序列长度增长
- 但这种加速以稳定性为代价
- 理解:
- CISPO 本身将梯度截断变成了 Soft 的 Advantage,允许模型更新更多本该截断的 Token,所以更新更快
- DAPO 的动态过滤等方式相当于隐形提升了学习率,相同步数下训练更快是符合预期的
- 注:DAPO 本身提升 Clip 上界本该引起熵增加,但是可能因为一些别的策略混合导致图 4c 中观察不到这个点
- GRPO 中,没有过滤各种全对全错样本,可能存在学习率低的问题,所以前期学不动(几乎全错)
- 稳定性比较:
- CISPO 最易发生熵崩溃和训练不稳定
- 理解:因为 CISPO 允许了一些异常的 Token 也更新了,虽然快,但是容易出现问题
- DAPO 次之
- 理解:因为 DAPO 的动态过滤相当于提升了学习率了,所以学得快, 但是学习率大,波动也大
- GRPO 最稳定
- 理解:学的慢当然稳定,前期学习率极低
- CISPO 最易发生熵崩溃和训练不稳定
- 奖励改进速度和不稳定程度遵循完全相同的顺序 :CISPO > DAPO > GRPO
- GSPO 使用是 真正 Sample-level 的损失,能显式维持高熵,防止熵崩溃,但几乎不提供探索更长序列长度的激励 ,不适合引导早期推理能力
- 理解:
- 可以看到,GSPO 比较特别,模型的熵几乎没有降低,序列长度也是最短
- 奇怪的问题:GSPO 的起始 Reward 居然比别人高,这个是否是曲线上报有错?
- 看起来 GSPO 相对其他算法也没有特别明显的优势,可能是因为 GSPO 针对整个 Sample 进行 Clip 容易造成样本效率低下
- 理解:
- CISPO 和 DAPO 通过放大低概率 Token 的梯度信号,比 GRPO 更快减少全失败组比率,实现更快的奖励增长和序列长度增长
- 基本结论:放大低概率 Token 对从零激发推理高度有效,但需要仔细的稳定化处理
- 理解:在原始模型未经过 SFT ,没有任何推理能力时,模型产生 CoT 需要部分原本低概率 Token 概率变大
- 一些其他观察和理解:
- GRPO 长度先增加再降低,可能是前期探索更长的 CoT,后期大家都正确以后逐步寻找短的 CoT
- 注:原始 GRPO 是 Sample-level Loss 聚合
- 其实这些方法对超参数都是比较敏感的,特别是学习速度跟超参数相关性特别高,加上跟模型和数据也有较大关系,所以这些曲线只能作为参考观察,不代表任何场景都一样
- Reward 值大于 1,应该是奖励不仅仅是正确性,还有格式等导致
- GRPO 长度先增加再降低,可能是前期探索更长的 CoT,后期大家都正确以后逐步寻找短的 CoT
RL 稳定化策略
KL 惩罚的效果
- 比较有无 KL 散度惩罚的训练运行(图5):
- 无 KL :训练与 Rollout 引擎的 Log-概率差异无界增长 → 熵崩溃 → Reward 崩溃
- 有 KL :所有训练指标保持健康,数值差距受控,熵保持健康水平,Reward 稳步提升

- 理解:KL 惩罚作为关键正则化器,约束整体策略漂移,防止过早熵崩溃,维持模型探索能力
- 理解:文章没有明确说明,但这个实验应该是针对第一阶段 RL 的
- 问题:图 5c 和 图 5b 的第 0 个 Step 指标应该是一样的,但看着不同,上报必然有问题
Ratio 校正策略对比
- 比较三种配置(图6):
- 1)Baseline :仅使用 SGLang Logits 的标准比率 → 约 800 步内崩溃
- 2)**+ IcePop** :Baseline 加上裁剪重要性比率阈值 → 延迟崩溃,但约 2700 步最终失败
- 3)**+ Ours** :使用 Megatron 作为分子,SGLang 作为分母 → 成功维持稳定 RL 训练 ,Log-概率差异接近零,熵被保留,Reward 一致提升

- 而且:本文方法避免了阈值调优,节省计算时间
不同格式奖励差异巨大
- 比较两种格式规范(图7):
- 格式 A(仅需单一开标签):模型利用松散格式,在答案后附加无尽乱码 → 序列长度快速增长,奖励完全停滞
- 格式 B(双闭合标签 + EOS 强制终止):只有正确终止的 Rollout 获得信用 → 防止由尾部垃圾驱动的退化长度增长

- 论文在所有训练阶段采用格式 B
Length Inertia,长度惯性
现象描述
- 论文揭示了标准 RL 训练中的根本缺陷,即 长度惯性(Length Inertia) :
- 早期阶段使用 Token-level Loss 聚合 ,隐式地给更长序列分配更高信用
- 模型发现”懒惰捷径”:仅仅生成更多 Token 是获得高累积奖励的数学上更安全的方式
- 原文认为:即使针对已经能答对的简单题,只要把回答写长,积累的正向梯度总和就更大,因此模型会无脑地堆砌冗余内容
- 我的理解:使用 Sample-level 会鼓励短的正样本,可以缓解这个问题,但这个问题本身并不是 Token-level 导致的,理论上 Token-level 并不鼓励任何长度倾向,仅仅把长度倾向交给隐式的奖励模型了(“对于相同的 Prompt,Response 输出越长,其正确的概率越大” (等价于 “对于相同的 Prompt,正确 Response 的平均长度比错误 Response 长” ) 则说明奖励倾向于将整体长度变长)
- 使用累计正向梯度总和更大这个点来解释不太准确,应该看 RL 算法更新时对单个 Token 的鼓励和打压程度来区分生成的概率
- 比如:
- 假设某个位置的候选 Token 为 TokenA 和 TokenB,原本输出两者的概率都是 0.49,TokenA 之后会输出很长的答案,TokenB 是结束字符
- 此时如果 RL 算法对 TokenB 的鼓励高于 TokenA,则无论 TokenA 之后的 Token 如何被鼓励,生成结束字符(短队列)的概率都会增加!!!
- 假设 TokenB 和 TokenA 之后得到的 Response 都是正确的,那么 GRPO 算法下:
- Token-level Loss 聚合 下,两者的 Advantage 相等,更新后两者的概率仍然相等
- Sample-level Loss 聚合 下,TokenA 的 Advantage 更低(被其他 Token 平均了),更新后 TokenB 的概率会高于 TokenA 的概率
- 结论:Token-level Loss 聚合 并不鼓励长文本,如果 “对于相同的 Prompt,正确 Response 的平均长度比错误 Response 短” ,则输出长度会逐步缩短
- 比如:
- 使用累计正向梯度总和更大这个点来解释不太准确,应该看 RL 算法更新时对单个 Token 的鼓励和打压程度来区分生成的概率
- 越来越长的理解:“对于相同的 Prompt,Response 输出越长,其正确的概率越大”
实验结果分析
- 实验结果1 :追踪模型首次 Rollout 就完美回答的简单问题的序列长度(图10c):
- 模型不维持简洁答案 ,序列长度随训练无条件扩展
- 证明标准 RL 训练使模型变懒,因强前向惯性而膨胀 Token 使用

- 实验结果2 :比较 16k 和 32k 响应窗口的训练运行(图8):
- 模型不将额外 32k 容量留给真正困难的问题
- 而是在所有问题上统一提高冗长度
- 32k 设置产生近乎两倍长的平均响应,但奖励增益微乎其微
超参数分析
- 超参数实验结果(图9)

- 学习率(\(1\times10^{-6}, 2\times10^{-6}, 3\times10^{-6}\))
- 三者收敛到高度相似的奖励水平和序列长度,训练对学习率变化具有鲁棒性
- Rollout 数量(\(G \in \{8,16,32\}\))
- \(G=32\) 每步收敛最快
- \(G=8\) 实际墙钟时间最快(计算开销低)
- \(G=16\) 作为平衡默认值
- 损失归约(Token-level vs. Sample-level)
- Token-level 显著促进 CoT 长度增长
- Sample-level 保持响应长度完全平坦
- 确认设计选择:Token-level 损失对初始激励长推理链至关重要
- 更多理解:
- 相同 Step 下,Rollout 增大时,确实会获得更高的 Reward,但是并不明显,特别是 32 和 16 之间对比不明显,而且继续训练下去,可能会收敛到同一个奖励上限
- 相同 Step 下,学习率越大,确实 Reward 越大,但是长远训练下去推测也会收敛到同一个 Reward 上
- Token-level Loss 聚合方式的 Reward 更高些,但是长度其实涨的非常多(Token-level Loss 聚合 不像 Sample-level Loss 聚合一样鼓励短的正样本)
- Token-level Loss 聚合是否是一个合适的选择有待考量
补充讨论
模型规模对训练的影响
- 比较 104B(flash)和 1T 模型在相同配置下 1T 模型的优势:
- 性能上限 更高: AIME 2024: 89.06% vs 71.72%;AIME 2025: 83.28% vs 63.54%
- 样本效率 更高:整个训练过程中保持持续更快的推理改进速率(更少的数据就能拿到相同的效果)
- 结论 :海量参数容量是有效 Zero RL 的基本先决条件
RL 是否真正扩展推理边界?
- 这是一个长期争论的问题:RLVR 是真正扩展模型的推理边界(Discovery),还是仅锐化其现有分布(Sharpening)?
- 本文的答案 :Zero RL 是明确的两阶段现象(图10b):
- 1)发现阶段(Discovery Phase) :
- Pass@1024 在训练早期增加
- RL 通过发现预训练期间休眠的新推理模式来主动扩展推理边界
- 训练数据有效解锁模型先前未展现的潜在能力
- 2)锐化阶段(Sharpening Phase) :
- Pass@1024 最终趋于平稳
- Pass@1 准确率持续稳步攀升
- RL 锐化输出分布、精炼策略,教会模型在已建立的推理边界内持续产生正确解
- 1)发现阶段(Discovery Phase) :
- 关键 Insight :一旦潜在能力被完全解锁,”发现”阶段结束,RL 平滑过渡到”锐化”阶段
- 理解:实际上,取决于我们如何认知 Pass@K
- 如果从比较小的 K 看 Pass@K(极端情况是 Pass@1),则可以认为模型一直在 Discovery
- 如果从比较大的 K 看 Pass@K(极端情况是 Pass@\(\infty\)),则可以认为模型一直在 Sharpening
如何在保持效率的同时改进推理能力?
- 原文认为: Token-level Loss 聚合 天然鼓励更长响应(梯度幅度与序列长度成比例)
- Token-level Loss 聚合 对引导早期 CoT 高度有效,但与推理效率产生严重冲突
- 理解:这句话不对,Token-level 鼓励更长响应的前提是 “对于相同的 Prompt,正确 Response 的平均长度比错误 Response 长”
- 理解:应该重新审视这个问题,是 Sample-level Loss 聚合本身鼓励短的正样本,而不是 Token-level Loss 聚合 鼓励更长的响应(Token-level Loss 聚合 不鼓励也不打压)
- 论文的两阶段解决方案 :
- 1)自蒸馏阶段 :主动修剪推理轨迹
- 移除重复验证步骤
- 压缩冗长子推导
- 消除循环推理
- 2)第二阶段 RL :切换为Sample-level Loss 归一化
- 原文认为:这是因为消除对更长响应的数学偏好,允许模型优化准确率而无不受控制的长度增长
- 实际理解:在正确轨迹中,Sample-level Loss 更偏好短的 Response
- 1)自蒸馏阶段 :主动修剪推理轨迹
- 原文提到这种方法本身也有局限性 :Sample-level Loss 仍是启发式变通方案,理想方法应在单一统一 RL 目标中联合优化推理质量和 Token 效率
- 理解:本质上可以添加长度惩罚实现这个,实际场景中也常常是添加了长度惩罚的
如何平衡训练效率与稳定性?
- 核心挑战 :低概率 Token 具有巨大价值(代表新颖策略、创造性技术和方案)
- 放大它们可能显著加速学习,但放大数值不一致性会导致不稳定
- 理解:在原始模型未经过 SFT ,没有任何推理能力时,模型产生 CoT 需要部分原本低概率 Token 概率变大
- 论文的双重机制 :
- 1)KL 散度惩罚 :约束整体分布漂移,防止策略崩溃到狭窄、退化的 Token 序列集合
- 2)训练-推理 Ratio 校正 :从根本上消除浮点差异,防止放大过程放大数值错误
- 实验结果:这个 Setting 下训练极快收敛,同时在数千步上保持完美稳定训练
原生 RL 的 CoT 与蒸馏方法对比
- 原生 Zero RL
- 无外部教师,可独立推动前沿模型的推理边界
- 海量预训练模型蕴含巨大未开发潜力,持续探索还能解锁深层推理能力
- 蒸馏:
- 高度样本高效
- 仅转移已有知识,静态蒸馏永远无法实现
- 实验观察 :将训练好的第一阶段 RL 专家的轨迹蒸馏到 Ling-2.5-flash-Base,性能匹配或超过 flash 模型上的长时间 Zero RL 训练
- 但蒸馏 无法突破已建立的知识边界
RL 可扩展 CoT 的基本限制是什么?
训练数据分布
- 关键 Insight :自然真实世界数据与最优 RL 训练数据之间存在根本性不匹配
- 真实世界呈现长尾难度分布 ,严重偏向简单问题(图10d:67.6% 的问题可在 4k Token 内解决)
- 但有效模型训练不需要保留此长尾
- 理解:模仿自然频率对 RL 模型无益 ,RL 需要的是有正负信号的 Query
- 过度训练长尾简单问题浪费计算资源,停滞学习过程
- 模型严格需要动态课程 ,问题难度随能力增长持续扩展

- Mid-training 阶段的其他类似观察 :
- 通用世界知识也存在长尾低效性,大多数自然文本包含基础和重复事实,必须在 Mid-training 阶段人为最大化复杂 Agent 数据的密度
模型容量
- 模型规模决定性能上限和学习速度
- 更大模型拥有更丰富的内部表示,更可能产生令人惊讶的涌现行为并达到更强最终结果
上下文窗口
- 更长推理链解锁复杂的多步推导
- 受硬件资源限制,本文训练限制在 64k 上下文窗口,作者坚信进一步扩展将直接解锁新的数学能力水平
预训练先验
- Zero RL 只能从预训练中已嵌入的知识引导推理
- 如果特定数学概念或证明技术不在预训练数据中,RL 无法凭空创造
- 预训练模型的世界知识和模式库形成刚性上界 ,RL 可在此边界内锐化和优化,但无法根本超越
- 理解:这里论文的理解和前面的 Pass@K 评估 RL 是否提升模型 Discovery 能力还是锐化的理解一致
A Bitter Lesson
- 本文对 “苦涩的教训” 理论进行了验证:简单、可扩展的计算优于复杂人类规则
- 论文的核心发现:当扩展到 1T 参数时,human-engineered heuristics 变得完全冗余
- 在纯 Zero RL 下,1T 模型从零自发发现 五种高级认知策略,无任何显式监督或辅助奖励
Anthropomorphic Reasoning Traces,拟人化推理轨迹
- 模型在复杂问题解决中频繁表现拟人化特征,分为三类心理行为:
- (1) 模拟挫折与发泄(Simulated Frustration and Venting)
“Wait, but I might have a brain fart here…”
- (2) 模拟懈怠与猜测(Simulated Slacking and Guesswork)
“Therefore, I’ll wing it and go with \(\boxed{2}\).”
- (3) 自我赞美与戏谑(Self-Praise and Playful Banter)
“Genius Idea. I think I’ve heard of this problem before…”
- (1) 模拟挫折与发泄(Simulated Frustration and Venting)
Structured Format
- 没有任何格式指令(仅”reason step by step”),模型自然地将思想组织为高度结构化、教学清晰的轨迹:
- 显式步骤编号
- 清晰的阶段转换
- 不同的中间总结
- 深层含义 :结构清晰不仅是需要通过人类标注教授的风格偏好,而是模型组织自身长上下文注意力的自然最优策略
- 从算法角度看,这表明 LLM 推理可形成更高层次的动作空间 ,超越标准 Token 级动作或 Agent 风格任务步骤,为未来 RL 优化开辟新路径
- 理解:本质还是模型内部藏着这个模式且这个模式更容易生成更高的奖励
Parallel Reasoning,并行推理
- 模型自发分支到替代策略,而非困于单一狭窄 CoT:
- 在单个线性 Rollout 内有效执行 自包含的 “Tree-of-Thought” 搜索
- 评估竞争方法
- 比较其输出
- 仅当多条独立证据线收敛时才提交最终答案
- 意义 :并行探索是 RL 发现的自然最优算法 ,而非需要特殊优化的工程技巧
Context Anxiety, 上下文焦虑
- 当模型接近其感知的最大 Token 限制时,经历策略性恐慌 :
- 主动中止复杂推理链以强制启发式猜测
- 有意识地优先考虑结构完整性而非数学严谨性
- 展现出对游戏规则的深层学习意识 :格式错误得零分,但猜测至少提供非零成功概率
- 示例 :”Given the time I’ve invested and the ambiguity, I will proceed to make an educated guess…”
- 理解:这个是因为训练时给了模型 “被强制截断不如自己尽快结束” 的偏好
Self-Verification
- 模型自发学习验证中间推导:
- 主动重新检查初始假设
- 对照已知公式进行交叉检查
- 将结果代回原始约束以确保逻辑一致性
- Insight :这些严谨的合理性检查完全出于获得最终正确性奖励的学习必要性 ,完全绕过人类设计的验证模板
附录:论文中的其他补充说明
RLVR 方向改进
- RLVR 关键里程碑:
- DeepSeekMath(2024):引入 GRPO,消除 Critic 模型依赖
- DeepSeek-R1(2025):纯 RL 直接应用于基座模型可自发激励涌现 CoT
- SimpleRL-Zoo(2025b)、Open-Reasoner-Zero(2025):系统识别关键超参数选择
- AceReason-Nemotron(2025a):原生 RL 在模型有足够容量时可超越静态蒸馏
- 算法改进:
- DAPO(2025):非对称裁剪和动态采样
- VAPO(2025b):基于价值的增强 PPO 显式支持长链推理
- 本文贡献:聚焦于扩展 Zero RL 的数值和结构瓶颈,采用裁剪重要性比率策略优化,引入训练-推理比率校正,构建多阶段流程
大规模模型训练改进
- 关键基础设施:
- Megatron-LM(2019; 2021):张量和流水线并行
- ZeRO(2020):分区优化器状态
- MegaScale(2024):数万 GPU 的生产级解决方案
- veRL(2025)、OpenRLHF(2024):RL 特定工作负载的分布式编排
- 本文贡献:成功将 Zero RL 扩展到 1T 参数模型,利用优化上下文并行高效支持稳定长上下文训练
附录 A:Comparison of Our CoT with Other Models
- 这一节给出了 Ring-Zero 与其他前沿模型(Claude Opus 4.7、GPT-5.5、Gemini 3.1 Pro、DeepSeek-V4-Pro、GLM 5.1、Kimi K2.6、Qwen 3.5、MiniMax 2.7、Doubao 2.0)在同一数学问题上的 CoT 轨迹对比,证明 Ring-Zero 的 Token 效率(3301 tokens vs 其他模型 522-39192 tokens)和结构化清晰度
- 详情见原始论文
附录 B:LLM-as-a-Judge Evaluation Prompts
完整评估 Prompt 包含三个核心标准及其详细说明,以及评分量规和输出格式要求
Comprehensibility Evaluation Prompt
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21You are an expert evaluator assessing the comprehensibility of mathematical reasoning traces (Chain-of-Thought). You will be given a math problem and two reasoning traces generated by different models (Model A and Model B). Your task is to judge which trace is more comprehensible to a human reader.
Evaluation Criteria. Comprehensibility measures the degree to which a human reader can follow and fully understand the reasoning steps without requiring external context or repeated reading.
Evaluate along three dimensions:
1. Logical Coherence: Does each reasoning step follow naturally from the preceding one? Is there a clear, smooth progression from the problem statement toward the conclusion? Are there any abrupt jumps, non-sequiturs, or unexplained transitions?
2. Causal Explicitness: Are the causal dependencies between steps explicitly stated? Can the reader understand not only what the model concludes at each step, but also why each intermediate result is derived? Are key logical connections made explicit rather than left implicit?
3. Absence of Hallucinations: Is the content free from hallucinated facts, incorrect intermediate results, or unsupported assertions? Are all mathematical claims justified or derivable from prior steps?
Scoring Rubric.
• A: Model A’s trace is more comprehensible—it is clearer, better structured, or more reliable than Model B’s.
• Tie: Both traces are roughly comparable in comprehensibility—neither has a meaningful advantage.
• B: Model B’s trace is more comprehensible—it is clearer, better structured, or more reliable than Model A’s.
Important Notes.
• Focus only on comprehensibility of the reasoning process, not on whether the final answer is correct.
• A shorter trace is not inherently better or worse—judge by clarity, not length.
• Consider the perspective of a mathematically literate reader.
• If both traces contain errors, judge which one is still easier to follow and less misleading overall.
Input: [Problem], [Model A’s Reasoning Trace], [Model B’s Reasoning Trace].
Output Format:
{
"analysis": "<2-4 sentence comparative analysis>",
"verdict": "<A | Tie | B>"
}- 汉语版本:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29你是一名专业评估员,负责评判数学推理过程(思维链)的易懂程度。你将拿到一道数学题,以及由两个不同模型生成的两段推理过程(模型A、模型B)。你的任务是判断哪一段推理更便于人类阅读者理解。
## 评估标准
易懂程度:衡量人类读者无需额外背景信息、无需反复阅读,就能跟上并完全读懂推理步骤的程度。
从三个维度开展评估:
1. 逻辑连贯性:每一步推理是否能顺承上一步自然推导?从题目条件到最终结论,推导流程是否清晰流畅?是否存在逻辑断层、前后无关的推论、无解释的跳转?
2. 因果明确性:步骤间的因果关联是否清晰写明?读者不仅能看懂模型每一步得出了什么结论,还能明白该中间结果的推导依据;关键逻辑联系是否直白呈现,而非含糊省略?
3. 无虚构错误:内容不存在凭空捏造的知识点、错误中间结果、无依据的论断;所有数学结论都能由前文步骤推导得出、有理可依。
## 评分判定规则
• A:模型A的推理过程更易懂——相比模型B,条理更清晰、结构更完善、推导更严谨可靠。
• 持平:两段推理易懂程度大致相当,不存在明显优劣之分。
• B:模型B的推理过程更易懂——相比模型A,条理更清晰、结构更完善、推导更严谨可靠。
## 重要注意事项
• 仅评判推理过程的易懂性,不考量最终答案是否正确。
• 推理篇幅长短不代表优劣,评判依据是条理清晰度,而非文字长度。
• 站在具备基础数学素养的读者视角进行评判。
• 若两段推理均存在错误,综合判断哪一段整体更易于梳理逻辑、误导性更低。
## 输入内容
[数学题目]、[模型A推理过程]、[模型B推理过程]
## 输出格式
{
"analysis": "<2至4句对比分析文字>",
"verdict": "<A | Tie | B>"
}
- 汉语版本:
附录 C:Showcase of Our Reasoning Traces
- 原文在本节展示了 Ring-2.5-1T-Zero 在三个不同基准(AIME 2026、HMMT Feb 2026、IMO AnswerBench)上的完整推理轨迹
- 观察到的结论:模型自发产生的高度结构化、可读性强的推导过程