Hexo

凡事预则立,不预则废


  • Home

  • Tags

  • Archives

  • Navigation

  • Search

NLP——技术报告解读-Kimi-K3

注:本文包含 AI 辅助创作

  • 参考链接:
    • 原始博客:Kimi K3: Open Frontier Intelligence, Moonshot AI (Kimi), 20260717
    • 原始技术报告:Kimi K3: Open Frontier Intelligence, Kimi, 20260727

Paper Summary

  • Kimi K3 整体总结:
    • 2.8T-A104B 激活参数的 MoE 模型
    • 具备原生视觉能力
    • 1M token 的上下文窗口
    • 架构方面:
      • 基于 KDA (2025) 和 Attention Residuals (2026) 构建
        • 主要考量是改善信息在序列长度和模型深度上的流动
      • 使用了 Stable LatentMoE(有效激活每 token 896 个路由专家中的 16 个)+ 优化后的训练和数据方案
        • 使得整体扩展效率相较 Kimi K2 (2025) 提升了约 \(2.5\times\)
        • 注:Stable LatentMoE 是 Kimi K3 在 LatentMoE 上创新以后得到的,详情见第二节
    • Post-training 阶段重点包括在通用、Agentic 和编码领域以及多推理强度(reasoning-effort)级别上进行 RL
      • 实现了组合泛化和鲁棒的长期执行能力
    • 基础设施总结:
      • 面向 KDA 的算法-系统协同设计
      • 完美负载均衡的专家并行训练与高效内存管理
      • 支持百万 token 的 Agentic RL(具备持久化 Rollout 和沙箱状态)以及部署创新
  • 评估结论:仅次于 Claude Fable 5 (2026) 和 GPT-5.6 Sol (2026),内部评估中一致优于其他开源和专有模型
  • 其他值得注意的关键核心点提炼
    • 后训练流程是 SFT -> RL -> MOPD
      • SFT :强调高质量数据集
        • 使用扩展的 Agentic 轨迹(含多阶段验证与人工标注),轨迹由先前 Kimi 系列专用模型合成
        • 使用基于 XML 的聊天模板(XTML)统一序列化数据
        • 注:SFT 全程应用 MXFP4 权重 + MXFP8 激活的量化感知训练(QAT)
      • RL :在三大领域(通用、Agentic、编码)分别训练不同推理强度(低/高/最大)的专家模型,共 9 个
        • Partial Rollout :避免长尾延迟,在 \(\lambda\) 比例轨迹完成后即暂停并异步恢复,支持跨 策略 的长期轨迹
        • Reasoning Effort RL :基于初始预算 \( b_0(x) \) 和乘子 \( \tau \) 动态控制思考或工具调用 token 数,超阈值则奖励置为 -1,并采用分阶段课程退火
        • Agentic GRM :用于不可验证任务,要求评判器遵循固定协议(阅读 -> 生成 Rubric -> 打分)
          • 注:这里加入冗长度惩罚防止 Reward Hacking (输出长度超过 \(\sigma \cdot \ell_0\) 的候选者自动在 Pair-wise 比较中失败)
        • 算法稳定性 :通过每 token 正则化容忍极度 Off-Policy 数据和数据陈旧性,保障训练稳定
      • MOPD :将 9 个领域/强度专家的能力蒸馏整合为单一统一模型
        • 对给定领域 \( d \) 和强度 \( e \),使用对应教师模型 \( \pi_{\text{teacher} }^{(d,e)} \) 指导
        • 定义每 token 的 OPD 奖励(带裁剪 \( R_{\max} \) 的优势信号),无缝融入 RL 框架
        • 支持基础设施级优化(如部分 Rollout)
        • Insight:未从更细粒度 top-\(k\) 蒸馏中获益
    • 其他 Insight
      • 量化感知训练(QAT) :MoE 专家权重为 MXFP4,激活为 MXFP8,非专家部分保持高精度,且 RL 全程训练与推理量化一致
      • Draft 模型微调 :将预训练 MTP 层微调为 EAGLE-3 风格 Draft 模型,融合多层 AttnRes 特征,并直接优化 LK 损失(接受率负对数)以提升推测解码效率
      • 统一白盒 RL 环境 :Agent 工具包模块化可配置,动态组合不同工具架,防止过拟合单一协议
      • 知识图谱引导任务合成 :自演进分层知识图谱,Agent 递归扩展,采样节点生成关键词并检索真实材料,合成多类型训练任务
      • 可验证 Agentic 环境 :包括下面几个方向:
        • 多步复杂信息搜索任务
        • 内核优化任务(GPU 编程套件 + 正确性与性能奖励 + 防 Hacking 检测)
        • 个人助理任务(模拟应用 + 长期多事件流)
        • 自主执行任务(AET,验证在环 + 隐藏/公开验证器)
        • Web 开发任务(容器沙箱 + 确定性检查 + 模型评判)
      • 所有环境均支持长 Rollout(可达数千工具调用、百万上下文 token)和跨场景泛化

Introduction

  • 核心强调效果:仅次于 Claude Fable 5 和 GPT-5.6 Sol

Model Architecture

  • 沿序列长度、网络深度和模型宽度三个维度扩展信息流

Hybrid Attention

  • 每个 Block 包含 3 层 KDA 和 1 层 Gated MLA(比例为 3:1),并在 Backbone 末端额外增加一层 Gated MLA
Kimi Delta Attention (KDA)
  • 扩展了 delta-rule 递归,引入 channel-wise 遗忘门
  • 对于位置 \(t\),Query \(\mathbf{q}_t\)、Key \(\mathbf{k}_t\)、Value \(\mathbf{v}_t\),递归状态 \(\mathbf{S}_t \in \mathbb{R}^{d_k \times d_v}\) 更新为:
    $$
    \mathbf{S}_t = (\mathbf{I} - \beta_t \mathbf{k}_t \mathbf{k}_t^\top) \text{Diag}(\alpha_t)\mathbf{S}_{t-1} + \beta_t \mathbf{k}_t \mathbf{v}_t^\top,\quad \tilde{\mathbf{o} }_t = \mathbf{S}_t^\top \mathbf{q}_t
    $$
    • 其中 \(\alpha_t \in (0,1)^{d_k}\) 是 channel-wise retention 因子,\(\beta_t \in (0,1)\) 控制 delta-rule 写入强度
  • 关键改进包括 :
    • Lower-bounded decay :将 log-decay 映射从负 Softplus 改为 scaled sigmoid,公式为:
      $$
      \mathbf{g}_t^h = g_{\min} \text{Sigmoid}(e^{A_h} \mathbf{z}_t^h),\quad g_{\min}=-5
      $$
      • 这保证 retention 因子 \(\alpha > e^{-5}\),避免数值溢出,使得所有 tile(包括对角线)均可使用 Tensor Core 矩阵乘法,消除了逐位置计算瓶颈
    • Full-rank gate :将输出门从低秩改为输入依赖的全秩投影(公式 (6)),提升表达能力
Gated MLA
  • Kimi K3 采用 Multi-head Latent Attention (MLA) 压缩 KV 为低维 latent vector
  • Kimi K3 对 MLA 层使用 No Position Encoding (NoPE) ,位置信息由 KDA 层提供(KDA 的递归衰减机制可以提供位置信息),无需修改位置编码即可扩展上下文
    • 理解:这里是一个很好的设计,若使用 RoPE,这里长度扩展时比较麻烦,但这种设计下,可以保证 KDA 隐式包含位置信息,又不用针对 MLA 扩展上下文,两全其美
    • 理解:实际上,传统的 Casual LM 天然就包含位置编码的,因为是任意两个 Token 位置交换结果都是不一样的,只是说仅但看某个 待输出的目标 Token 时,可能看起来交换位置前后的结果一样,所以显示加上位置编码会好些
  • 训练时保持 Attention 输出为 FP32 以纠正 Flash Attention 的舍入误差

Attention Residuals (AttnRes)

  • 标准残差连接将所有前层信息压缩为单一状态,形成深度方向的瓶颈
  • AttnRes 让每一层通过可学习的伪 Query \(\mathbf{q}_l = \mathbf{w}_l\) 和来自所有前层的 Key/Value(公式 (8))计算注意力权重(公式 (9)),实现层间选择性信息检索
  • 为降低开销,采用 Block AttnRes :
    • 将层划分为 \(N\) 个 Block(Kimi K3 中 \(N=8\),每 Block 12 层),在 Block 级别进行 Attention,内部用部分和(partial sum)合并,将内存和通信开销从 \(O(Ld)\) 降至 \(O(Nd)\)

Stable LatentMoE

  • LatentMoE 将 routed experts 置于低维空间(维度 \(\ell\))
    • 这使 Kimi K3 能扩展到 896 个 routed experts,每 token 激活 16 个(稀疏度 56)
    • 但极端稀疏引发激活爆炸和负载不均问题
  • 本文提出三项改进:
    • Normalized LatentMoE :在 routed 分支聚合后插入 RMSNorm(公式 (11)),稳定训练并提升下游性能
    • Sigmoid Tanh Unit GLU (SiTU-GLU) :替代 SwiGLU,使用 scaled tanh 对门控分支和上分支进行软裁剪(soft cap),公式为:
      $$
      \text{SiTU-GLU}(\mathbf{x}) = \left[\beta_1 \tanh\left(\frac{\mathbf{W}_g \mathbf{x} }{\beta_1}\right) \odot \text{Sigmoid}(\mathbf{W}_g \mathbf{x})\right] \odot \left[\beta_2 \tanh\left(\frac{\mathbf{W}_u \mathbf{x} }{\beta_2}\right)\right]
      $$
      • 其中 \(\beta_1=4, \beta_2=25\),保证输出有界(\(\le 100\)),同时保留 SwiGLU 在原点附近的线性响应
    • Quantile Balancing (QB) :替代固定步长 bias 更新
      • 设 batch 有 \(m\) 个 tokens,\(n\) 个 experts,每个 token 选 \(k\) 个专家,目标负载 \(q = mk/n\)
      • QB 通过使每个 expert 的 margin(\(s_{i,j} - \alpha_i^{(t)}\),其中 \(\alpha_i^{(t)}\) 是 token \(i\) 的 Top-\((k+1)\) 截断值)的 \((1-k/n)\)-分位数等于 bias 调整量,达到精确负载均衡
      • 更新公式为:
        $$
        \hat{b}_j^{(t+1)} \leftarrow \text{quantile}_{1-k/n}\left( s_{i,j} - \alpha_i^{(t)} \right),\quad \mathbf{b}^{(t+1)} \leftarrow \hat{\mathbf{b} }^{(t+1)} - \text{mean}(\hat{\mathbf{b} }^{(t+1)})\mathbf{1}
        $$
      • 实践中使用直方图估计分位数,通信代价仅为每层数百个 bins 的 all-reduce

Native Vision

  • 视觉编码器 MoonViT-V2(27 层,0.4B 参数)从头训练(不使用 SigLIP 初始化),发现从头训练更稳定且性能相当
  • 采用 RMSNorm,去除所有 bias
  • 图像和视频共享参数,通过 intra-frame spatial 和 inter-frame temporal 注意力处理,pixel-shuffle 下采样减少 token 数量

Per-Head Muon

  • 对 Attention 投影矩阵采用 Muon 优化器,并改进为 Per-Head 变体:
    • 将 momentum 矩阵按 head 维度划分,对每个 head 的 block 分别进行 Newton-Schulz 正交化,平衡各 head 的更新尺度,提高训练稳定性

Pre-Training

预训练数据

  • 涵盖四大文本领域(Web、Code、Math、Knowledge)和大规模视觉语料
  • 文本数据经规则过滤、分类器质量评分、去重,并按领域采样
  • 对知识和数学语料采用风格多样化的重述(rephrase)和忠实性验证
  • 视觉数据包括图像描述、交错图文、OCR、感知、视频以及程序化多模态数据(SVG、3D、Webpage、Game、CAD 等),训练时提供绝对和归一化坐标监督

Scaling Law

  • 新架构、数据和训练改进整体带来约 2.5 倍 scaling 效率提升(对比 Kimi K2)
  • 注:这个结论是对学习率调度进行了公平比较的:
    • 在各自最优超参数下,Cosine Decay 始终优于 Warmup Stable Decay (WSD),因此采用 Cosine Decay

Training Recipe

  • 采用原生多模态联合训练策略,语言和视觉从训练开始就共同优化(而非事后嫁接)
  • 优化器使用 Per-Head Muon 配合 weight clipping,MoE 负载均衡使用 QB
  • 采用 Cosine 学习率调度(1% 线性 warmup),weight decay 设为 0.1

Long-Context Extension

  • 位置编码 :由于使用 NoPE,KDA 的递归门控机制隐式编码位置信息,无需 RoPE 缩放或插值即可直接外推至 1M
  • 长上下文数据 :对长文档和视频进行严格的清洗(精确/模糊去重、感知哈希、质量过滤、结构验证),并上采样长序列。同时合成额外长上下文数据(将多模态文档和子任务精心排列拼接),强制模型关注分散在 1M 上下文中的信息
  • 渐进式扩展 :采用四阶段课程:预训练期间从 8K 扩展到 64K,cooldown 期间从 256K 扩展到 1M

Post-Training

Method

  • 后训练 Pipeline 遵循三阶段范式:
    • SFT: 初始化基线 Agent 能力
    • RL:在不同推理强度下开发特定领域的专家模型
    • MOPD:将这些领域专用策略整合为单一模型
SFT
  • SFT 阶段为后续 RL 阶段建立高质量的冷启动策略
  • 在之前 Kimi 模型 (2025; 2026) 的 SFT Pipeline 基础上,为 Kimi K3 扩展了 SFT 数据集
    • 核心:大幅拓宽了其对复杂 Agentic 任务的覆盖
  • 具体做法:
    • 使用先前 Kimi 系列中的领域专用模型合成数据轨迹,随后进行多阶段验证和人工参与标注
    • 为了一致地表示这些复杂的 Agentic 轨迹,使用基于 XML 的聊天模板(可扩展 Token 标记语言,eXtensible Token Markup Language;详见 § F)对所有数据进行序列化
    • 这些步骤共同生成了一个大规模指令数据集,使 Kimi K3 具备了自适应推理、精确工具调用以及在长期 Agentic 场景中的稳健执行能力
  • 此外,从 SFT 阶段起就应用量化感知训练(Quantization-Aware Training,QAT)
    • 注:采用 MXFP4 权重和 MXFP8 激活值(见 §4.1.4)
RL
  • SFT 提供了坚实的冷启动基础,RL 对于解锁高阶推理和执行能力至关重要
  • 并非针对单个任务训练专用 RL 模型,而是将 RL 扩展至三个广泛领域,每个领域涵盖大量子任务,并在每个推理强度级别上为每个领域训练一个单独的专家模型:
    • (i) 通用任务,涵盖通用体验、视觉、推理、忠实性、搜索能力和知识工作任务
    • (ii) 通用 Agent,涵盖长期助理任务、深度研究和段落级写作
    • (iii) 编码 Agent,涵盖软件工程(SWE)、编码体验、内核任务和 Web 开发
  • 如图 8 所示,扩展 RL FLOPs 持续提升了知识、推理、视觉、通用 Agent 和编码等多方面能力
    • 将这三个领域专家与三个推理强度级别 {low, high, max} 交叉,共得到九个专家模型
Algorithm
  • 为缓解长期任务中加剧的长尾延迟,扩展了同步 RL 框架 (2025; 2026) 中的 Partial Rollout 方案
  • 在每次迭代的 Rollout 阶段,对 \(N\) 个 Prompt 各采样 \(K\) 个补全,维持 \(N \times K\) 条轨迹的活动负载
  • 生成阶段一旦有 \(\lambda \in (0,1)\) 比例的轨迹完成(即 \(\lambda NK\))便暂停
    • 允许策略优化不必等待执行拖尾者
  • 暂停的 Rollout 被入队并在下一次迭代开始时优先恢复,这由沙箱基础设施(§5.3.2)支持
    • 一旦某个 Prompt 的所有 \(K\) 个 Response 完成,它们便立即被派发进行策略优化,该优化遵循 Kimi K2.5 (2026) 中的算法
  • 在本文的 Partial Rollout 方案下,单条长期轨迹自然跨越多次迭代,引入数据陈旧性,可能威胁训练稳定性
    • 本文的策略优化算法通过每 token 的正则化天然容忍这种极端的 Off-Policy 情形
    • 通过将策略更新约束在局部邻域内,该正则化使算法能够稳健处理高度陈旧的数据,并维持训练稳定性
Reasoning Effort RL
  • 为在最大化 token 效率的同时微调推理强度,在 RL 期间实施基于每个问题的预算控制机制 (2026)
    • 将每个问题 \(x\) 与一个初始 token 预算 \(b_0(x)\) 关联,该预算由冷启动模型估计,并对于总 token 预算 \(T(y)\) 超过缩放阈值 \(\tau \cdot b_0(x)\) 的轨迹,将任务奖励覆盖为 \(-1\)
  • 对于通用任务,\(T(y)\) 衡量思考 token 的数量
  • 对于 Agent 任务,\(T(y)\) 则计入累积输出 token,包括推理轨迹和工具调用参数
  • 训练遵循预算乘子 \(\tau\) 的分阶段课程
    • 首先训练一个最大预算变体,其 \(\tau\) 相对较大,同时仍设置最大预算上限以抑制过度思考
    • 然后将 \(\tau\) 退火至较小值,以获得高强度和低强度的专家模型
    • \(\tau\) 的调整按领域配置,并有人工指导
    • 所得专家在各推理强度下产生的轨迹被联合收集,用于监督微调和多教师 On-Policy 蒸馏
Agentic Generative Reward Model
  • 对于不可验证的通用任务,采用 Agentic GRM,保留 Kimi K2.5 (2025; 2026) 中采用锦标赛式成对比较的组奖励
  • 除了增强判断的通用 Agentic 能力外,Agentic 评判器还被要求遵循强制协议:
    • (1) 阅读结果、产品或文本输出
    • (2) 生成 Rubric
    • (3) 根据 Rubric 对每个候选者打分
    • (4) 将 Rubric 分配的分值记录在记分板中
  • 为缓解对越来越长输出的 Reward Hacking 行为,应用基于预算的冗长控制,类似于上述推理强度控制:
    • 给定由冷启动模型估计的初始冗长度 \(\ell_0\) 和乘子 \(\sigma\)
      • 输出长度超过 \(\sigma \cdot \ell_0\) 的候选者自动在 Pair-wise 比较中失败
MOPD
  • 采用 MOPD (2025; 2026; 2026) 将这些领域专用能力在不同推理强度下整合为统一模型
  • 在训练期间,对于给定领域 \(d\) 和采样的推理强度级别 \(e \in \{\text{low,high,max}\}\),优化由对应的教师模型 \(\pi_{\text{teacher} }^{(d,e)}\)(来自九个专家之一)指导
  • 给定输入查询 \(x\) 和前缀 Response \(y_{< t}\),教师 \(\pi_{\text{teacher} }^{(d,e)}\) 与学生 \(\pi_{\theta}\) 之间在 \(y_t\) 上的每 token OPD 奖励定义为:
    $$
    r_{\text{opt} }^{d}(y_{t}\mid e,x,y_{< t}) = \text{clip}\left(\text{sg}\left(\log \frac{\pi_{\text{teacher} }^{(d,e)}(y_{t}\mid x,y_{< t})}{\pi_{\theta}(y_{t}\mid e,x,y_{< t})}\right), - R_{\text{max} },R_{\text{max} }\right), \quad (15)
    $$
    • \(\text{sg}(\cdot)\) 表示停止梯度算子,\(R_{\text{max} } > 0\) 是裁剪阈值,用于约束极端优势信号,从而稳定 RL 训练
    • 这一密集奖励信号无缝集成到 RL 框架中,自然支持基础设施级优化,如针对长期任务的 Partial Rollout 训练
    • 本文还尝试了更细粒度的 top-\(k\) 蒸馏目标,但在设置中未观察到收敛速度或最终性能有明显优势
      • 注:这和 DeepSeek 的做法不同,结论也不同
Deployment-Aware Post-Training,部署感知的后训练
MXFP4 Quantization-Aware Post-Training
  • 为降低部署时的内存占用和服务成本,将 MoE 专家权重(占模型参数内存主体)量化为 MXFP4 (2023),激活值以 MXFP8 计算,而所有非专家组件(注意力投影、Latent MoE 投影、共享专家和 MoE 路由器)保持较高精度
  • 在整个后训练阶段(包括 SFT 和 RL)均进行量化感知训练(QAT)(2018),使模型适应量化带来的精度损失
  • 在 RL 期间,Rollout 和训练共享相同的量化方案,消除了训练-推理不匹配
    • 问题:训练也使用 MXFP4 量化?
Draft Model Fine-Tuning
  • 优化推理效率对于服务复杂、长期 Agentic 模型至关重要
  • Kimi K3 预训练时带有一个 MTP 层,其结构与主干块类似
  • 由于 EAGLE-3 (2025) 的 Draft 模型包含一个与 MTP 层结构匹配的单解码器层,本文将预训练的 MTP 层微调为 EAGLE-3 风格的 Draft 模型,目标模型冻结,仅更新 Draft 层及其特征融合投影
  • 遵循 EAGLE-3 的训练时测试协议
    • 训练期间 Draft 展开七步
    • 在第一步之后(此时最新位置的目标侧特征不可用),Draft 消耗自身较早步骤的输出,模拟推理时的循环 Draft 过程
  • Draft 输入融合目标模型的低、中、高级特征,分别取自第 1、第 4 和最后一个 AttnRes 块(§2.2)的输出
    • 这些特征被拼接并通过一个无偏置矩阵 \(W_{E3}\) 投影到隐藏维度,该矩阵初始化为 \([0 \ \mathbf{0} \ \mathbf{I}]\),使得融合表示在初始化时与高级特征 \(h_{h}\) 一致(MTP 层预训练时的输入),并在微调过程中逐渐学习融入低、中级特征
  • 推测解码的加速由每 token 接受率 \(\sum_{x\in \mathcal{V} }\min (p(x),q(x))\) 决定(在无损推测采样下),其中 \(p\) 和 \(q\) 分别为目标模型和 Draft 模型的下一 token 分布
  • 由于最小化传统 KL 散度代理并不能保证在容量受限的 Draft 模型下最大化该比率,本文直接优化基于似然的 LK 损失 (2026),即接受率本身的负对数:
    $$
    \mathcal{L}_{\text{LK} } = -\log \sum_{x\in \mathcal{V} }\min (p(x),q(x)), \quad (16)
    $$
    • \(p\) 和 \(q\) 在温度 1 下评估,且无辅助真实标签交叉熵项
  • Draft 微调遵循后训练 QAT 配置(§4.1.4),MoE 专家权重为 MXFP4,输入激活为 MXFP8,非专家模块保持较高精度

RL Task Synthesis and Agentic Environments,RL 任务合成与 Agentic 环境

  • 本文的 RL 框架的有效性在很大程度上依赖于丰富、多样且可稳健验证的环境
  • 为支持跨复杂长期任务的可扩展训练,本文设计了一系列专门的白盒环境和任务合成范式
Unified White-Box RL Environment
  • 使用单一固定 Agent 工具包(harness)进行训练可能导致模型过拟合特定的工具模式、系统 Prompt、上下文管理机制或交互协议
  • 为解决此问题,开发了一个统一白盒 RL 环境,将 Agent 工具包表示为一组可配置、可组合的模块,包括工具接口、系统 Prompt、上下文管理策略、技能、记忆、子 Agent 和其他组件
  • 通过配置组合这些模块,该环境可以实例化主流工具包,如 Kimi Code (2026)、Claude Code (2026)、Codex (2026)、OpenClaw (2026) 和 Hermes (2026),以及全新的工具包
  • 在 RL 训练期间,为不同任务组动态构建不同的工具包配置,使 Kimi K3 暴露于这些模块的多样组合,而非任何单一工具包的惯例
  • 同样的抽象也易于支持跨不同任务领域的 RL,为训练更通用的 Agent 提供了可扩展基础
Knowledge-Graph-Guided Task Synthesis,知识图谱引导的任务合成
Motivation and overview
  • 后训练任务的质量和多样性在很大程度上取决于其 source materials
    • 基于细粒度 Concept 的检索能够挖掘专业化和不常见的知识
    • 跨不同 Concept 的采样可拓宽领域覆盖
  • 为在大规模上控制粒度和覆盖,本文构建了一个 自演进的、分层组织的 知识图谱=
    • Agent 通过在知识和编码密集领域进行 web-scale 探索持续扩展该图谱
  • 图 9 展示了任务合成 Pipeline
    • 知识图谱在多个层级上表示 Concept (按照层级组织的分层结构),范围从广泛领域到细粒度 Concept
    • 对相关节点进行采样,形成一组关键词,用于指导公开 source materials 的检索
    • 对于每个合成实例,系统会选择一个任务类型,并使用检索到的材料来合成相应的任务
Agentic knowledge graph construction
  • 通过递归的 Agent 驱动扩展来构建有向无环图形式的知识图谱
    • 扩展过程从一组预定义的粗粒度种子节点开始(理解:一些高阶 Concept )
    • 然后将一个 Agent 实例分配给每个节点,执行多次 Web 搜索以探究对应 Concept (理解:针对一个 Concept 进行不断理解,构建子图)
  • 在添加新节点之前,Agent 会探索现有图谱以识别等效或相关 Concept ,复用现有节点(如果适用的话),并最小化重复
    • 理解:防止出现过多重复节点,导致图谱越来越大
  • 边始终从较粗 Concept 指向较细 Concept ,无论 Agent 先发现哪个端点
    • 理解:确保实现有向无环
  • 新添加的节点随后被分配给 Agent 进一步探索
    • 理解:这里是递归探索的 Concept
  • 当分配的 Agent 确定当前 Concept 足够原子时,分支停止扩展
    • 理解:直到原子 Concept 出现(不可再分)
  • 理解:总结知识图谱的递归构建流程如下:
    • 第一步:从一组预定义的粗粒度种子节点开始,例如“编程语言”、“金融市场”等
    • 第二步:为每个节点( Concept )分配一个 AI Agent,这个 Agent 会执行多次网络搜索,深入研究该 Concept
    • 第三步:添加新节点步骤
      • 在添加新发现的 Concept 作为子节点前,Agent 会检查现有图谱,以避免重复
      • 新节点会通过有向边连接到其父 Concept (总是从父 Concept 链接到子 Concept )
    • 第四步:新加入节点探索(递归的思路)
      • 新加入的节点会被再次分配给新的 Agent 继续探索,直到某个节点被其负责的 Agent 认定为“足够原子”,分支才会停止生长
Material retrieval and task synthesis
  • 为瞄准跨领域和任务类型的期望分布,系统在不同粒度级别上采样节点(单独或相关组合)
  • 从采样节点派生的关键词结合其在知识图谱中祖先的上下文信息,形成 Web Queries
  • 检索到的真实世界材料被组装,使合成 Agent 生成各种任务类型的训练任务
  • 理解:材料检索和任务合成的流程:
    • Concept 采样:系统会根据需求,从图谱的不同层级采样一个或多个节点
      • 可以采样一个广泛领域(如“Web 开发”)来生成通用任务,也可以采样一组细粒度的关联节点(如 “React Hooks” + “性能优化”)来生成更聚焦的任务
    • 生成查询:从采样节点及其图谱上下文(如父节点信息)中提取关键词,组合成高效的网络搜索 Query(Web Query)
    • 检索材料:使用生成的 Query 从互联网检索真实的、相关的源材料
    • 合成任务:最后,由一个 “合成 Agent” 根据预定义的任务类型模板,利用检索到的材料,生成具体的 训练任务
Verifiable Problems in Agentic Environments,Agentic 环境中的可验证问题
  • 在 Agentic 环境中使用可验证问题训练 Kimi K3
  • 代表性示例包括多步复杂信息搜索,其中模型规划其研究,逐步从 Web 收集证据,并生成最终答案
  • 还包括其他任务,如代码执行、系统管理等
Kernel Optimization Tasks
  • 为增强 Kimi K3 的 GPU 内核优化能力,本文构建了一个大规模内核任务套件,范围从单算子内核到融合巨型内核,来源包括高质量 GitHub 仓库如 Flash Linear Attention (2024)
  • 该套件涵盖多样的 GPU 编程方法,如 CUDA、Triton、CuTe DSL、Gluon、ThunderKittens (2025) 和 TileLang (2025),并覆盖广泛使用的 GPU 架构和数值格式,包括 BF16、FP8 和 FP4
  • 奖励同时评估正确性和性能:
    • 每个内核提供 PyTorch 参考实现,超过预定义数值误差阈值的解决方案获得零奖励
    • 性能对照专家实现进行评分,与之匹配得 0.5 分,接近硬件极限则奖励趋向 1
  • 为确保奖励反映真正的优化,本文开发了一个 Hacking 行为检测系统,惩罚 Reward Hacking 策略,如 CUDA graph 重放、输入缓存和精度降低,并随着 Kimi K3 开发过程中观察到新的 Hacking 策略而持续扩展防护措施
Personal Assistant Tasks
  • 对于长期个人助理任务,开发了广泛使用的应用程序(如 Gmail、Notion、Slack 和 Canvas)的逼真模拟实现
    • 它们保留了真实世界对应物的核心语义,同时支持可重现的大规模交互,无需外部 API 或速率限制
  • 在这些模拟应用基础上,设计了受真实世界专业工作流程启发的复杂任务,场景涉及人力资源、法律服务和金融
  • 在每个任务中,Agent 在持续演进的模拟环境中运行多个模拟日,并遇到分布在多个应用中的数十个相互依赖的事件
    • 单次 Rollout 可能涉及多达数千次工具调用和数百万上下文 token
  • 每个事件都带有自己的评估标准,由确定性规则或基于 LLM 的评估器判断
  • 初始工作空间由 Agent 自主搜索 Web 参考材料并将其转换为连贯、任务相关的环境
  • 本文还扩展 RL 框架以支持这种生活环境,模拟复杂事件流及其引发的世界状态转换
Autonomous Execution Tasks
  • 本文引入自主执行任务(AET)
    • 这是一种通过“验证在环”优化训练长期 Agent 智能的环境范式
    • 每个任务指定初始状态、约束目标、基于工具的动作空间、执行预算和独立验证器
    • Agent 只看到目标、上下文、约束和验证接口,而不见参考轨迹或预定义程序,必须自主进行任务分解、工具选择、规划、错误恢复和终止
    • 奖励基于验证器对最终环境状态的评估,而非 Agent 的自我报告完成情况
  • 本文设计了多种验证器类型,支持多样环境,包括黑盒系统复制(图 10)、定量因子发现和税务审计
    • 在每个环境中,Agent 迭代提交解决方案、接收验证器反馈并改进策略,训练出一个假设、行动、分析反馈和适应的通用循环
    • 通过将 Agent 与验证器隔离、提供诊断反馈的公共验证器与评估保留场景的隐藏验证器配对,并在有限提交预算下应用基于惩罚的奖励,从而缓解 Reward Hacking 行为
Web Development Tasks
  • 本文构建了一个由专家策划的多样化 Web 开发任务套件,覆盖典型场景
    • 输入范围从单行场景描述到多段落规格说明
    • Artifacts 涵盖网站、交互式游戏、3D/WebGL 场景、数据可视化、SVG 和全栈应用
  • 每个任务在容器化沙箱中运行,并在多样 Agent 工具架下 Rollout,而非单一固定工具架,以促进跨工具架的泛化
  • 奖励由两部分组成:确定性检查和内部奖励模型的模型评判
    • 确定性检查功能性地测试应用行为,并为复制参考的任务评估结构和像素级相似性
    • 当项目构建失败、运行出错或伪造(而非实现) Artifact 时,奖励置零
    • 模型评判使用其他模型进行源代码检查或查看并交互输出 Artifact

Infrastructure

KDA 的算法-系统协同设计

  • KDA 核函数 :
    • 训练和 Prefill :开发 FlashKDA(基于 CUTLASS),将 intra-chunk 计算与 cross-chunk 状态传播重叠,大幅超越 Triton 参考实现
    • 长上下文 Prefill 的 intra-device CP :将序列在单个 GPU 的 SMs 间分区,独立计算每个 segment 的转移,再精确组合,避免跨设备通信
  • KDA Context Parallelism (KCP) :
    • 由于 KDA 的更新依赖于传入状态(\(\mathbf{S}_t = \mathbf{M}_t \mathbf{S}_{t-1} + \dots\)),不能简单地从零状态求和
    • KCP 将每个 segment 的效果分解为两个局部可计算量:
      • 累积转移矩阵 \(\mathbf{M}_{t\leftarrow 1}^{[i+1]}\) 和 从零生成的状态 \(\tilde{\mathbf{S} }_t^{[i+1]}\)
    • 对于 rank \(i+1\),其状态为:
      $$
      \mathbf{S}_t^{[i+1]} = \tilde{\mathbf{S} }_t^{[i+1]} + \mathbf{M}_{t\leftarrow 1}^{[i+1]} \mathbf{S}_{T_i}^{[i]}
      $$
      • 其中 \(\mathbf{S}_{T_i}^{[i]}\) 是前一 rank 的输出状态
      • 只需一个固定大小的 all-gather 同步这些片段,再通过 prefix scan 恢复每个 rank 的传入状态,实现线性扩展

3T 级预训练基础设施

  • 采用 PP + VP + EP + ZeRO-1 DP + ZeRO-2 + CP 的组合并行策略
  • MoonEP(完美均衡的 Expert Parallelism) :
    • 保证每个 EP rank 恰好接收 \(S \times K\) 个 tokens(\(S\) 序列长,\(K\) 每 token 选专家数),所有 rank 计算量相同
    • 证明冗余专家数上界为 \(E/R\)(\(E\) 总专家数,\(R\) EP size),且此上界紧致
    • 在线规划由 GPU kernel 近优求解,零拷贝通信(fused permute/unpermute),静态形状避免 host-device 同步
  • 内存高效训练 :
    • 采用 FSDP2 + 自定义 offload,结合 ZeRO-2 梯度分片,将 optimizer states 和部分梯度 offload 到 CPU/NVMe
    • 利用梯度 buffer 复用来存储 reference model 的权重
  • 多模态编码器优化 :
    • 对大图像/视频采用动态 CP(沿 patch 维度分区,gather-KV)
    • 将 ViT 计算分解并调度到 pipeline bubbles 中,大幅隐藏视觉编码器开销

百万 Token Agentic RL 基础设施

  • 长上下文 RL 系统 :
    • 采用协同定位 RL 和 partial rollout 减少长尾延迟
    • 外部 KV cache 池 :将空闲 prefix 的 KV cache(包括 KDA 状态和 MLA KV)写回 CPU DRAM,仅在需要时预取,缓解 GPU 内存压力
    • Rollout 自动限流调度器 :根据活动请求数、排队数和 KV cache 利用率动态控制并发度
    • 非策略模型梯度 buffer 复用 :Reference 模型的权重复用在策略模型的 FP32 梯度 buffer 中,避免额外内存分配
  • 沙盒基础设施(AgentENV) :
    • 基于 Firecracker microVM,提供高隔离性和高保真度(可挂载磁盘、运行容器甚至虚拟机)
    • 支持增量 checkpoint/resume(延迟低至 133ms/49ms)、Pause/Resume、Fork(用于无副作用评判)和 Snapshot
    • 采用 OverlayBD 镜像格式和 ublk 驱动,实现 sub-second 启动;Copy-on-Write 内存和 page-cache 优化实现 6.5x 内存超售
推理与在线服务
  • KDA-Aware Prefix Cache :
    • 将 KDA 固定大小的 recurrent state 与 MLA 的 KV cache 统一放入同一 paged block pool
    • 细粒度 prefix caching :哈希基于小粒度 block(如 512 tokens),但物理块较大
      • KDA checkpoint 仅保存在稀疏边界(如对话轮次边界)
      • 查找分两阶段:MLA 哈希匹配 + KDA checkpoint 匹配,使命中边界可以是 512 的任意倍数,而非仅物理块边界
    • 一致性保证:通过 pinning、排除新注册块、原子性 checkpoint 避免并发问题
  • 高性能核函数 :
    • KDA Decoding :在 MTP 推测解码中,为避免状态回滚困难,缓存 projected inputs 而非状态,按需重建状态(类似 ReplaySSM)
    • Block AttnRes :Prefill 用 Sequence Parallelism 减少内存;Decoding 用 side stream 重叠 inter-block 计算,并融合 intra-block 更新和 RMSNorm
    • Stable LatentMoE :融合 down-projection 和 router;shard 权重并 overlap all-gather;小 batch 下采用 token-centric 的 WarDecode 风格 kernel
  • 集群级调度 :
    • 缓存感知亲和性调度 :每个 session 绑定到主/备两个集群,主集群处理流量,备集群在主集群故障时接管(需重新 prefill),通过一致性哈希分散故障影响
    • 预算感知准入控制 :为不同请求类分配独立资源预算,防止长上下文突发流量影响短请求的 SLO

Evaluations

Main Results

  • Benchmarks :
    • 涵盖 Reasoning & Knowledge(GPQA Diamond, CritPt, AA-LCR, HLE-Full)、Coding(DeepSWE, ProgramBench, Terminal-Bench 2.1, FrontierSWE, SWE-Marathon 等)、Agentic(BrowseComp, DeepSearchQA, GDPval-AA v2, Toolathon-Verified, MCPMark, AutomationBench 等)和 Vision(WorldVQA, OmniDocBench, PerceptionBench, Video-MME, MMVU, MMMU-Pro, CharXiv, Math-Vision, ZeroBench 等)
  • Baselines :对比闭源模型 Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5 和开源模型 GLM-5.2
  • 配置 :所有 Kimi K3 评估使用 max reasoning effort,temperature=1.0;推理/知识任务 top-p=0.95,Agentic/Coding 任务 top-p=1.0
  • 结果分析(Table 2):
    • Reasoning & Knowledge :GPQA Diamond 达 93.5%,接近前沿;但在 HLE-Full 和 CritPt 上仍落后于 Claude Fable 5 和 GPT-5.6 Sol,表明研究级推理是改进方向
    • Coding :ProgramBench 最佳(77.8%),SWE-Marathon 领先 Claude Fable 5 达 7 个百分点(42.0% vs 35.0%),Terminal-Bench 2.1 几乎持平 GPT-5.6 Sol(88.3% vs 88.8%),FrontierSWE 排名第二(81.2%)
    • Agentic :在 BrowseComp(91.2%)、DeepSearchQA(95.0% F1)、MCPMark-Verified(94.5%)等多项取得 SOTA;但在知识工作 Elo 套件(GDPval-AA v2, AA-Briefcase)和较难的计算机使用基准(OSWorld 2.0, SaaS-Bench)上落后于 Claude Fable 5 或 GPT-5.6 Sol
    • Vision :OmniDocBench 最佳(91.1%);Math-Vision 达 94.3%(用 Python tool 提升至 97.8%);ZeroBench-main 与 Claude Fable 5 持平(23.0% pass@5,用 tool 提升至 41.0%)

Internal Evaluation

  • 能力评估(Table 3, 4):
    • 内部基准涵盖 Coding 体验、General Agent 体验(24/7 ClawBench, MIRA, KAET, CLIF, Agentic Vision, Swarm Bench, Online Experience, Deep Research, Finance, KWV, DECK, Agent Behavior)和对话体验(Faithfulness, Chat All-in-One)
    • 强项 :Orchestration 和研究型 Agentic(Swarm Bench 76.3,Deep Research 90.0 领先);Coding 能力强(Kimi Code Bench 2.0 仅次于 Claude Fable 5,Coding Experience 最佳;Webdev 盲测中 +31.0% 胜过 Claude Opus 4.8,尤其在 3D/WebGL/Shader 领域 +59.1%)
    • 弱项 :在 Agent Behavior Bench, MIRA Bench, 24/7 ClawBench 2.0, Agentic Vision Bench, KWV Bench 上落后于领先者
  • 网络安全评估 :
    • Tier 1(漏洞发现) :在数十个广泛部署系统中识别出数百个候选漏洞,经人工确认约 70% 为真实漏洞,包括 Linux 内核中两个此前未知的高危漏洞(远程堆越界写入、Dirty-COW 类权限提升)
    • Tier 2(漏洞利用) :在 36 个专家可解任务(用户空间 16 个,内核 20 个)中,Kimi K3 解决 14 个(38.9%),优于 GLM-5.2(8 个,22.2%);但内核空间任务仅解决 4 个,表明在完整利用链和对抗缓解措施方面仍与人类专家有差距。UK AI Security Institute 的独立评估结论一致
Third-Party Evaluation, Table 5,第三方评估
  • Artificial Analysis :Intelligence Index v4.1 57.1,在 580 个模型中排名第 4(若将 GPT-5.6 Sol 变体算作一个则第 3)
  • Vals AI :Vals Index 74.7%,在 39 个模型中排名第 2(仅次于 Claude Table 5)
  • Arena :WebDev Arena Elo 1,678,排名第 1(首个登顶的开源模型);Text Arena 排名第 8(1,486 Elo);Agent Arena 排名第 4(9.1)
6.4 成本效率(Cost Efficiency)
  • 在 Kimi Code Bench 2.0、BrowseComp、GDPval-AA v2 和 AA-Briefcase 四个套件上比较分数与每任务推理成本
  • Kimi K3 接近或位于成本-效率前沿:
    • Kimi Code Bench 2.0:分数比 Claude Fable 5 低 4.0 分,但成本仅为 38%
    • BrowseComp:最佳分数(91.2%),每任务成本 $2.03,仅为 Claude 模型的一个数量级成本
    • GDPval-AA v2:Elo 落后 GPT-5.6 Sol 不到 50 分,成本低 13%;比 Claude Fable 5 便宜 2.6 倍
    • AA-Briefcase:第二好分数,成本约为 Claude Fable 5 的一半

附录:Kimi-K3 博客内容介绍(发表于 20260717)

  • 博客链接:Kimi K3: Open Frontier Intelligence, Moonshot AI (Kimi), 20260717
  • Kimi K3 整体介绍:
    • 2.8T 参数(世界上首个开放的 3T 级模型)
      • 注:在过去十二个月中的九个月里,Kimi 模型一直保持着开放模型规模的上限,中间被打断的时间是 DeepSeek-V4
    • 基于 KDA(Kimi Delta Attention)和 AttnRes(Attention Residuals)构建
    • 具备原生视觉能力(native vision capabilities)
    • 1M Token 的上下文窗口
    • 专为 long-horizon coding、knowledge work 和 reasoning 的前沿智能而设计
    • Kimi-K3 整体性能处于第一梯度
      • 虽然 Kimi-K3 整体性能仍落后于最强大的专有模型 Claude Fable 5 和 GPT 5.6 Sol
  • Kimi K3 即日起可在 Kimi.com、Kimi Work、Kimi Code 和 Kimi API 上使用
  • Kimi K3 将默认使用 max thinking effort(低强度和高强度模式将在后续更新中推出)
  • 推理和开源系统适配中
  • 完整的模型权重将于 2026 年 7 月 27 日发布
  • 注:关于架构、训练和评估的更多细节将与 Kimi K3 技术报告一同发布

Coding

  • Kimi K3 具有强大的长时程编码性能
    • 在极少的人工监督下运行,它能够持续进行长时间的工程会话,导航大规模代码仓库,并编排终端工具
    • Kimi K3 还擅长将软件工程与视觉推理相结合的任务:利用截图和视觉信息来优化游戏开发、前端和 CAD 设计
Kernel Optimization
GPU Compiler Development
  • Kimi K3 能够从头构建一个 GPU 编程系统
    • Kimi K3 开发了 MiniTriton,一个紧凑的类 Triton 编译器,拥有自己的基于 MLIR 的 tile-level IR 层、优化 passes 和 PTX 代码生成 Pipeline
  • Kimi K3 能够构建一个连贯的端到端编译器
    • 从 DSL 前端和 IR passes 到 PTX 代码生成和运行时,而不仅仅是孤立的 kernels
    • 其从头编写的 Tensor Core 路径已经可以与 Triton 大量优化的栈相媲美
Game Dev and Digital Creation
  • Kimi K3 结合了强大的 3D 推理、编码和视觉能力,将概念(Concepts)、图像和视频转化为完全可玩的交互式体验
  • Kimi K3 通过在代码和实时截图之间无缝迭代,实现了真正的 “视觉在 Loop 中(vision in the loop)”,即时查看和优化输出
Chip Design
  • 作为早期概念验证,Kimi K3 设计了一款芯片,用于服务基于其自身架构构建的 nano 模型
    • 在单次 48 小时的自主运行中,K3 使用开源 EDA 工具在 Nangate 45nm 库上构建、优化并验证了该芯片
Coding for Research
  • Kimi K3 架起了科学文献与可执行代码之间的桥梁
    • 自主实现、验证和分析复杂的计算研究工作流
  • 在一个案例中,Kimi K3 在大约两小时内完成了通常需要一位经验丰富的研究人员一到两周的工作

Knowledge Work

  • 除了公开基准测试之外,Kimi K3(max)在 Kimi 的内部评估中表现出了持续的性能提升
    • 这些评估来源于真实世界用户-Agent 工作流中观察到的重复模式和挑战
  • 这些在面向生产的不同工作流中持续存在的优势,反映了 Kimi K3 Agentic 知识工作能力的广泛提升
Research with Interactive Visualization
  • Kimi K3 在 Kimi Work 中可以在金融咨询和科学研究领域产出的一些示例:
案例 1:Interactive 42 years of AI ASIC industry research website
  • 一份可以深入探索的交互式研究报告:42 年的 ASIC 行业历史,通过 120 多轮递归自我改进(recursive self-improvement)创建而成
  • Kimi K3 将证据转化为定制图表、动画图表和交互式可视化叙事
  • 通过 2,800 多次网络搜索/获取和 1,100 多次终端数据拉取来获取数据,涵盖 11,000 多个页面,跨越 87 份季度报告和 99 份原始 PDF
案例 2:Fusion Industry Research
  • 一份咨询风格的行业报告,带有交互式可视化
    • 包括时间线、漏斗图(Funnel Chart)、范围条形图(Range Bar Chart)、甘特图(Gantt Charts)和出版质量的幻灯片
案例 3:GWTC-5 Gravitational-wave Analysis,GWTC-5 引力波分析
  • 使用 20 多个并发子 Agent(subagents)对 391 个引力波事件进行分析,生成 7 个科学可视化图表、2 个表格和来自 10 多篇论文的文献综述
  • Kimi K3 还特别擅长生成信息图风格(infographic-style)的演示文稿
Widgets and Dashboard
  • 本次新介绍:在 Kimi Work 中引入了两个新功能(Widgets 和 Dashboard),它们使与 Kimi K3 的交互更加可视化和持久化
    • Widgets 允许在对话中直接生成交互式组件,并可连接本地数据或外部插件以实现持续更新
    • Dashboard 将最关心的 Widgets 汇聚到一个持久的、个性化的视图中,围绕一个主题、项目或目标进行组织
Video Editing
  • Kimi K3 在动态设计、动画和视频编辑方面表现出色,因为其原生多模态架构(native multimodal architecture)在同一个模型中理解文本、图像和视频
  • 示例一:Kimi K3 创建了一个 3Blue1Brown 风格的动态图形解说视频,来解释其自身的架构,将技术理念转化为动画图表和转场
  • 示例二:Kimi K3 从 56 个源剪辑中编辑了自己的预告视频,处理了片段选择、动作匹配剪辑、帧级精确的节拍同步、音频处理和多轮修订
  • 像这样一个高密度的短视频通常需要一位经验丰富的编辑一到两个工作日,或者一位初学者三到五天

Architecture and Infrastructure

  • Kimi K3 基于 KDA 和 AttnRes 构建,这两项架构更新旨在改善信息在序列长度和模型深度上的流动方式
  • Kimi K3 扩大了 MoE 稀疏性
    • 与 Stable LatentMoE 框架配合,有效激活 896 个专家中的 16 个
  • 在 2.8 万亿参数规模下的稳定高效训练
    • Quantile Balancing 直接从路由器得分的分位数推导专家分配,消除了启发式更新和敏感的平衡超参数
    • Per-Head Muon 通过独立优化 Attention 头将 Muon 扩展到更自适应的规模化学习
    • Sigmoid Tanh Unit(SiTU)和 Gated MLA 分别改善了激活控制和 Attention 选择性
  • Kimi K3 从 SFT 阶段开始应用量化感知训练(quantization-aware training),使用 MXFP4 权重和 MXFP8 激活以实现广泛的硬件兼容性
    • 为防止专家不平衡在大型专家并行规模下降低吞吐量,引入了一种完全平衡的专家并行训练方法,具有静态形状且在关键路径上无主机同步
    • 由于推理效率同样受益于更大的高带宽通信域,建议在具有 64 个或更多加速器的超级节点配置上部署 Kimi K3
  • 由于 KDA 对传统前缀缓存(prefix caching)提出了新的挑战,已向 vLLM 社区贡献了相应的实现,将与模型一同发布
    • 借助带有预填充缓存(prefill cache)的 KDA,能够以极具竞争力的 Token 价格提供 Kimi K3 服务(点赞!)

Availability,Kimi 系列模型通用

  • Kimi K3 Agents :从移动应用商店下载或更新最新版 Kimi App,可在 iOS、Android 和 HarmonyOS 上使用,或访问 kimi.com
  • 使用 Kimi K3 Work :下载最新的 Kimi Work 桌面应用,版本 3.1.0 或更高,适用于 Windows 和 Apple silicon Mac
  • 使用 Kimi K3 编码 :在终端中运行 Kimi Code,并使用 /model 命令选择 Kimi K3
  • 使用 Kimi API 构建 :访问 Kimi API 平台 并选择 kimi-k3
    • 定价为缓存命中输入 $0.30/MTok,缓存未命中输入 $3.00/MTok,输出 $15.00/MTok
    • 在 Mooncake 的解耦推理架构(disaggregated inference architecture)支持下,官方 Kimi API 在编码工作负载中实现了超过 90% 的缓存命中率
  • 将 Kimi 引入工作组织 :Kimi Enterprise 提供企业级数据隐私和成员管理,个人账户与组织账户完全分离
    • 访问定价页面并选择 “Get Kimi Enterprise” 获取团队订阅

测评相关

  • 报告的所有 Kimi K3 结果均是在下面的条件下获得的
    • Reasoning 强度设置为“max”
    • 温度 temperature = 1.0
    • top-p = 1.0
  • 根据基准测试的不同,每个模型在三种 Agentic Harness 之一下进行评估
    • KimiCode
    • Claude Code
    • Codex

Limitations

  • 对思考历史的敏感性(Sensitivity to thinking history)
    • K3 是在保留思考历史模式(preserved thinking history mode)下训练的
    • 如果 Agent Harness 未能按要求传回所有历史思考内容,或者如果正在进行的会话切换到了 K3,生成质量可能会变得非常不稳定
    • 建议使用已验证兼容性的 Harness,例如 Kimi Code,并避免在会话中途切换到 K3
  • 过度主动(Excessive proactiveness)
    • K3 的训练特别强调长时程、具有挑战性的任务
      • 因此,当它在任务执行过程中遇到小问题或模糊的用户意图时,可能会代替用户做出意外的决定
      • 如果应用程序要求 Agent 在明确定义的边界内操作并避免过度即兴发挥,请在系统 Prompt 或 AGENTS.md 中对 K3 施加更明确的行为约束
    • 总体而言 K3 是一个极具竞争力的模型,但与 Claude Fable 5 和 GPT 5.6 Sol 相比,它在用户体验方面仍存在明显的差距

补充:关于 Kimi K3 位置编码的思考

  • 在 Kimi K3 中,位置编码的设计是分离且互补的 :
    • Gated MLA 层采用 NoPE(无显式位置编码)
      • 理解:实际上,传统的 Casual LM 天然就包含位置编码的,因为是任意两个 Token 位置交换结果都是不一样的,只是说仅但看某个 待输出的目标 Token 时,可能看起来交换位置前后的结果一样,所以显示加上位置编码会好些
    • KDA 提供主要位置编码信息:位置感知能力完全由 KDA 层通过其内部的递归衰减机制隐式提供
  • 这种设计的核心考量在于简化长上下文扩展并提升外推能力 ,避免了传统 RoPE(旋转位置编码)在超长文本上可能出现的“长度过拟合”问题

Kimi K3 各模块的位置编码策略

  • KDA 层 :作为位置信息的唯一来源
    • KDA 不依赖外部位置编码,而是通过自身的 通道级遗忘门(Channel-wise forget gate)和衰减机制(Decay mechanism) 隐式编码位置
    • KDA 核心公式
      $$ \mathbf{S}_t = (\mathbf{I} - \beta_t\mathbf{k}_t\mathbf{k}_t^\top)\text{Diag}(\alpha_t)\mathbf{S}_{t - 1} + \beta_t\mathbf{k}_t\mathbf{v}_t^\top $$
      • \(\text{Diag}(\alpha_t)\)( retention 因子)和 \(\beta_t\)(写入强度)都是位置敏感的,随着 token 位置变化而动态调整,从而让模型感知序列的顺序
  • Gated MLA 层 :完全采用 NoPE
    • Query 和 Key 在计算注意力时不添加任何形式的位置编码(如 RoPE 或可学习的位置嵌入),纯粹基于内容进行交互
  • 整体结构 :
    • Kimi K3 的 93 层网络组成(69 层 KDA + 24 层 Gated MLA )
      • 两者以 3:1 的比例在每个 Block 中堆叠(3 层 KDA 后接 1 层 MLA)
      • 这种结构让 KDA 处理位置信息,MLA 专注于全局内容交互,实现了分工

Kimi K3 的位置编码(“KDA 隐式编码 + MLA 无显式编码”)设计思考

  • 简化上下文扩展 :由于 MLA 层没有使用 RoPE,在将上下文从 8K 扩展到 1M token 时,无需进行 RoPE 的基础频率调整或插值(如 YaRN) 等复杂操作
    • 原始论文中作者就明确指出:Kimi K3 能直接外推至 1M 上下文,而无需任何位置编码修改
  • 避免 RoPE 导致的 “长度过拟合” :
    • NoPE MLA 避免了因 RoPE 频率固定而导致的 “长度过拟合” 问题,使模型在处理超过训练长度的文本时,鲁棒性更强
  • 架构分工 :
    • KDA 层作为高效的线性注意力,负责捕获序列的顺序和局部模式
    • MLA 层作为强大的全局注意力,则不受位置信息干扰,专注于建模 token 间的深层语义关系

NLP——技术报告解读-Ring-Zero

注:本文包含 AI 辅助创作

  • 参考链接:
    • 原始论文:Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning, 20260716, RUC & Ant Group

整体总结

  • 核心贡献
    • Zero RL 能在万亿参数规模上稳定扩展 :
      • 通过少量极简优化训练 Ring-2.5-1T-Zero
        • Cliped IS(CISPO)
        • Training-Inference Ratio Correction
        • 混合精度控制
        • 注:极简设计足以解决系统瓶颈,从零开发高质量推理
      • 在七个数学基准上取得了有竞争力的结果
      • 论文回答了这个根本性问题:Zero RL 在万亿参数级别上能够扩展
    • 提出三维 CoT 质量评估框架 :构建了独立于最终答案正确性之外的评估体系,从三个维度衡量推理轨迹的内在质量
      • 可理解性(Comprehensibility)
      • 可复现性(Reproducibility)
      • 效率(Efficiency)
    • 实证验证了“苦涩的教训”在超大模型上的有效性 :
      • 证明了万亿参数模型不仅能解锁更高的样本效率和性能上限,还能自主涌现复杂的认知策略(无需人工挖掘格式或 Pattern)
  • 核心 Insight:
    • 扩展定律决定能力天花板 :
      • 将参数规模从 104B 提升至 1T 显著提高了 Zero RL 的样本效率和最终性能上限
      • 证明参数容量是利用 Zero RL 探索推理边界的根本前提
    • RL 的训练动态遵循明确的“发现-锐化”两阶段顺序 :
      • 训练初期 RL 通过唤醒预训练中休眠的潜在路径来扩展推理边界(发现)
      • 后期在此边界内精炼策略以提高输出稳定性(锐化),两者并非对立而是前后相继的关系
    • 高级认知策略无需人工设计即可在超大规模下自主涌现 :
      • 在 1T 模型上,拟人化表达、结构化格式、并行推理、自我验证和上下文焦虑等复杂行为完全由纯 RL 自驱动产生,完全绕过了人工标注的格式奖励或验证模板
    • 训练与推理引擎间的微小数值差异是大规模 RL 崩溃的元凶 :
      • 低概率 Token 的梯度放大效应会使 Megatron 和 SGLang 间的浮点不一致性急剧累积
      • 将重要性比率分子替换为实际训练引擎 Logits 可直接消除此偏差,比复杂的阈值裁剪更有效
    • 论文认为:Token-level 损失必然导致盲目的“长度惯性”而非自适应推理 (存在疑问)
      • 模型会无差别地填满可用上下文窗口以获取累积奖励,即使在简单问题上也膨胀 Token 数,因此必须通过自蒸馏压缩轨迹并切换为 Sample-level Loss 聚合 来强行打破这种惰性
      • 理解:关于 Token-level Loss 聚合 和 Sample-level Loss 聚合 对长度鼓励与否的分析
        • 注意:本文的观点和之前的感觉不同,Token-level Loss 聚合 似乎并没有鼓励模型输出长度变长,除非正确答案的长度比错误答案更长
          • 原因:因为错误的负样本也会被打压的更惨
          • 本文观察到 Token-level Loss 聚合 在鼓励模型长度更长的原因可能是因为在当前模型下,“对于相同的 Prompt,Response 输出越长,其正确的概率确实越大!”
        • 理解:Sample-level Loss 本质是在鼓励正确的短样本,并偏好与错误的长样本
          • 这个理解是看每个 Token 收到的鼓励和惩罚来看的,因为 Token 才是模型的实际输出粒度!
        • 不论那种方式,只要满足在当前 Step 下(数据和模型确定下) “对于相同的 Prompt,Response 输出越长,其正确的概率越大” ,则一定会导致轨迹越来越长,除非奖励里面对长度有惩罚
    • 自然数据的长尾难度分布对 RL 训练并非最优 :
      • 真实世界中绝大多数问题过于简单(67.6% 可在 4k Token 内解决),在训练中保留这种分布会浪费计算资源,唯有动态课程式地主动过滤简单样本并持续提升难度,才能有效扩展模型的推理边界
    • Reasoning Format 优化 :
      • 比较了 <think>...</think> 和 <think>...</think><answer>...</answer> 两种格式标签,并最终证明 <think>...</think><answer>...</answer> 效果更好,所有 RL 训练流程全程使用这种格式
  • 本文的一些问题总结:
    • 问题:图 4b 中,GSPO 的起始 Reward 居然比别的方法高,上报有问题
    • 问题:图 5c 和 图 5b 的第 0 个 Step 指标应该是一样的,但看着不同,上报有问题
    • 问题:本文对于 Token-level Loss 聚合的理解有问题,似乎错误的认为 Token-level Loss 聚合在任何场景下都在鼓励长 Response,实际上并没有鼓励,也没有打压
  • 本文与 DeepSeek-R1 等先前工作的四个主要区别:
    • 1)关注推理过程的内在质量 :先前工作主要评估最终答案准确率,论文批判性评估中间 CoT 轨迹,提出三维评估框架
      • PS:其实之前的其他部分工作也会关注 CoT 的长度和质量的
    • 2)扩展为多阶段自迭代过程 :
      • 设计渐进式流程持续改进推理能力
      • 引入多种推理模式使单模型动态适应问题复杂度
      • 遵循极简设计原则,仅实现严格必要的优化
    • 3)**”苦涩的教训”的强实证验证** :
      • 大规模计算和模型规模超越人类工程启发式(比如不需要人工提前定义 System Prompt 给定格式等)
      • 1T 参数规模解锁更高性能上限和更优训练效率
    • 4)高级认知策略的自发涌现 :
      • 先前 RL 模型展示的是基本的自我反思
      • Ring-2.5-1T-Zero 则进花到更复杂的思维机制,使复杂的人工推理流程不再必要(无需人工挖掘格式或 Pattern)
      • 注:这一点和前一点相似

背景 & 动机

  • “Zero RL” 范式(如 DeepSeek-R1 所示)完全摒弃了监督微调阶段,直接从预训练基座模型出发进行强化学习,通过试错机制自主激发问题解决策略
  • Zero RL 在小规模模型上取得了成功,但 当 Zero RL 应用于万亿参数级别的模型时,训练动态和涌现能力将如何演化? 是未知的
  • 本文的核心目标是从基座模型中激发高质量的推理行为

CoT质量评估框架

  • 论文预先定义了理想 CoT 轨迹应具备的特征,并构建了三维评估框架:

Comprehensibility

  • 定义 :人类读者能在无需外部上下文、不承受高认知负荷的情况下跟进推理步骤的程度
  • 评估方法 :采用 LLM-as-a-Judge 的成对比较框架
  • 评判 LLM 基于三个子标准进行评估:
    • 1)逻辑连贯性(Logical Coherence) :每一步是否自然地从前一步推导而来
    • 2)因果明确性(Causal Explicitness) :因果依赖关系是否被显式陈述
    • 3)无幻觉(Absence of Hallucinations) :内容是否无幻觉事实、错误中间结果或未经支持的断言
  • 评判模型输出格式为:
    1
    2
    3
    4
    {
    "analysis": "<2-4句比较分析>",
    "verdict": "<A | Tie | B>"
    }

Reproducibility

  • 定义 :缺乏先验知识的智能体(如新手人类或较弱的学生模型)能否有效且高效地学习底层推理过程并获得可比较的任务解决能力
  • 评估方法 :通过 Knowledge Distillation 来衡量
    • 将生成的 CoT 轨迹用于微调较弱的学生模型,以学生模型的下游性能增益作为代理指标
    • 增益越大,表明教师轨迹携带了更丰富、更可迁移的推理技能

Efficiency

  • 定义 :模型简洁地解决问题、避免不必要冗长、冗余推导或循环逻辑的能力
  • 评估方法 :计算正确 CoT 轨迹的平均 Token 数量
    • 在有效解中,Token 越少表示效率越高

方法论

核心设计原则:Minimalism,极简主义

  • 论文的核心设计原则是极简主义
  • 基于 “过复杂的算法设计往往不必要” 这一发现,仅在严格需要引导模型迭代学习时才引入优化元素

多阶段训练流程总览

  • 训练流程包含四个不同阶段 ,图 1(a) 展示了完整概览:
    • 1)第一阶段 RL :从基座模型激发推理能力
    • 2)自蒸馏阶段(Self-Distillation) :压缩 CoT 轨迹并重置训练-推理引擎差距
    • 3)第二阶段 RL :采用 Sample-level Loss 聚合 进行持续优化
    • 4)第三阶段 RL :引入分级训练,赋予模型自适应推理深度

第一阶段 RL:推理激发,Reasoning Elicitation

第一阶段 RL 设计思路
  • 在 Zero-RL 中,训练直接从缺乏初始推理能力的预训练基座模型开始
  • 基座策略下推理 Token 的概率极低(很少生成逐步推导)
  • 因此,初始 RL 阶段必须 激进地放大低概率推理 Token
Clipped Importance-Sampling Policy Gradient
  • 采用 CISPO(MiniMax, 2025)算法,其核心创新在于:与标准 PPO-clip 完全将裁剪范围外的 Token 梯度置零不同,该方法仅对裁剪比率应用 stop-gradient,同时允许所有 Token 的梯度流通
    • 这确保了每个生成的 Token 都对学习过程有贡献
  • CISPO 目标函数 :
    $$
    \mathcal{I}(\theta) = \mathbb{E}_{q \sim \mathcal{D}, \{o_i\}_{i=1}^G \sim \pi_{\text{S} } } \left[ \sum_{i=1}^{G} \sum_{t=1}^{|o_i|} \text{sg}(\hat{\rho}_{i,t}) \cdot \hat{A}_{i,t} \cdot \log \pi_{\text{M} }^{\theta}(o_{i,t} \mid q, o_{i,< t}) \right]
    $$
    • \( q \):从数据集 \(\mathcal{D}\) 采样的输入问题
    • \( \{o_i\}_{i=1}^G \):从推理引擎 \(\pi_{\text{S} }\) 采样的 \( G \) 个 Rollout 响应
    • \( o_{i,t} \):第 \( i \) 个响应的第 \( t \) 个 Token
    • \( \hat{A}_{i,t} \):使用 GRPO 风格组归一化奖励计算的 Advantage 估计
    • \( \text{sg}(\cdot) \):Stop-gradient 算子
    • \( \hat{\rho}_{i,t} \):裁剪后的重要性比率
    • \(\pi_{\text{M} }^{\theta}\) 训练引擎(Megatron)对应的策略
    • \(\pi_{\text{S} }^{\theta}\) 推理引擎(Sglang)对应的策略
Training-Inference Ratio Correction
  • 关键 Insight :
    • 放大低概率 Token 会放大一个关键的系统级漏洞:训练引擎(Megatron)与推理引擎(SGLang)之间的数值差异
    • 浮点精度和内核实现的差异产生略微不同的 Logits,这些微小差异可能累积成宏观的训练崩溃
  • 解决方案 :将重要性采样比率的分子替换为实际的训练引擎 Logits :
    $$
    \begin{align}
    \rho_{i,t} = \frac{\pi_{\text{M} }^{\theta}(o_{i,t} \mid q, o_{i,< t})}{\pi_{\text{S} }^{\theta_{\text{old} } }(o_{i,t} \mid q, o_{i,< t})} \\
    \hat{\rho}_{i,t} = \text{clip}(\rho_{i,t}, \epsilon_{\text{low} }, \epsilon_{\text{high} })
    \end{align}
    $$
    • \( \pi_{\text{M} }^{\theta} \):训练引擎中参数为 \( \theta \) 的当前策略
    • \( \pi_{\text{S} }^{\theta_{\text{old} } } \):推理引擎中使用旧参数 \( \theta_{\text{old} } \) 的 Rollout 策略
    • \( \epsilon_{\text{low} } \):下界(论文不设置下界)
    • \( \epsilon_{\text{high} } \):上界(设为 5.0),防止过大的更新
KL 散度惩罚
  • 为进一步稳定训练,对冻结的参考模型施加 KL 散度惩罚 ,防止策略偏离参考模型过远:
    $$
    \mathcal{L}_{\text{KL} }(\theta) = \sum_{i=1}^{G} \sum_{t=1}^{|o_i|} \mathcal{D}_{\text{KL} } \left( \pi_{\text{M} }^{\theta}(\cdot \mid q, o_{i,< t}) \parallel \pi_{\text{ref} }(\cdot \mid q, o_{i,< t}) \right)
    $$
    • \( \pi_{\text{ref} } \) 是冻结的参考策略模型
第一阶段 RL 总损失
  • 第一阶段 RL 总损失为:
    $$
    \mathcal{L}_{\text{Ring-2.5-1T-Zero-1} }(\theta) = -\mathcal{I}(\theta) + \beta \cdot \mathcal{L}_{\text{KL} }(\theta)
    $$
    • \( \beta \) 是 KL 惩罚系数(设为 \( 10^{-4} \)),平衡探索与稳定性

Self-Distillation:压缩与稳定化

Self-Distillation 设计动机
  • 第一阶段的 Token-level Loss 聚合 虽然成功激发了推理能力,但引入两个关键缺陷:
    • 1)过度冗长 :生成的 CoT 轨迹过长,包含冗余步骤、循环逻辑和不必要的赘述
    • 2)训练不稳定 :极端长度严重破坏 RL 稳定性,训练与推理引擎的数值差异累积,急剧扩大训练-推理差距,导致优化崩溃
两步骤长度精炼过程
  • 步骤 1 :使用第一阶段专家策略 \( \pi_{\text{expert} } \) 为每个查询采样多个 Rollout,从中选择最短的正确推理轨迹
  • 步骤 2 :Prompt 模型对选中的轨迹进行自我评估 ,过滤掉任何被识别为冗余的段落
    • 这有效地修剪了循环逻辑,压缩了冗长推导,同时不牺牲正确性
Self-Distillation 损失
  • 将精炼后的高质量语料库用于通过标准监督学习微调原始基座模型:
    $$
    \mathcal{L}_{\text{self-distillation} }(\theta) = -\mathbb{E}_{q \sim \mathcal{D}, o \sim \pi_{\text{expert} } } \left[ \sum_{t=1}^{|o|} \log \pi_{\theta}(o_t \mid q, o_{< t}) \right]
    $$
    • \( o \) 表示长度精炼后的响应
    • \( \pi_{\theta} \) 是基座预训练模型
  • Self-Distillation 效果 :
    • 通过用缩短的响应进行蒸馏,模型获得专家的推理能力,同时产生更简洁的轨迹,并有效消除了引擎间累积的数值错误,为后续 RL 阶段提供了高度有能力、简洁且稳定的基础

第二阶段 RL:Sustained Optimization

背景 & 分析
  • 自蒸馏后,模型展现出更小的训练-推理 Gap,为下一阶段 RL 提供了稳定起点
  • 第二阶段 RL 相对第一阶段 RL 的关键变化在于 损失计算策略
Sample-level Loss 聚合
  • 第一阶段使用 Token-level Loss 聚合 以鼓励更长响应,但模型现在自然产生长 CoT
    • Token-level Loss 聚合 的含义是 Token 等权,长 Response 的权重会更大,对模型的影响也越大
  • 继续使用 Token-level Loss 聚合 会导致输出长度无界增长,破坏自蒸馏获得的简洁性
  • 解决方案 :转为 Sample-level Loss 聚合 ,使梯度幅度与输出长度无关:
    $$
    \mathcal{L}_{\text{Ring-2.5-1T-Zero-2} }(\theta) = -\mathbb{E}_{q \sim \mathcal{D} } \left[ \sum_{\{o_i\}_{i=1}^G \sim \pi} \frac{1}{|o_i|} \sum_{t=1}^{|o_i|} \text{sg}(\hat{\rho}_{i,t}) \cdot \hat{A}_{i,t} \cdot \log \pi_{\theta}(o_{i,t} \mid q, o_{i,< t}) \right]
    $$
  • 理解:这里说是 Sample-level Loss 聚合,实际上仅仅考虑了损失的聚合方式,这里 Sample-level Loss 聚合 的含义是样本等权
    • 注:Token-level Loss 聚合 的含义则是 Token 等权
  • 注:我们平时使用最多的也是 Sequence-mean-Token-mean,属于是本文所谓的 Sample-level Loss 聚合
其他配置
  • 保持与第一阶段相同的裁剪重要性采样策略梯度和比率校正
  • 移除 KL 惩罚(不再需要)
  • 更新参考模型的频率:每 400 步用最新检查点更新

第三阶段 RL:Tier-Based Training,分级自适应训练

背景
  • 不同问题固有地需要不同层次的推理深度
    • 但标准训练流程通常产生受固定响应预算约束的单模式模型
  • 为解决此问题,引入分级训练
  • 将问题按难度分为三个等级:
    • 低(Low,4k Token)
    • 中(Medium,16k Token)
    • 高(High,64k Token)
  • 每个等级接收特定的 System Prompt,教会模型根据可用推理预算自适应其推理深度
推理模式
  • 训练完成后,模型支持三种不同的推理模式:
    • High 模式(64k 预算)
    • Medium 模式(16k 预算)
    • Low 模式(4k 预算)
  • 这实现了从刚性的”一刀切”到动态的、查询依赖的计算分配的转变

Reward Design

  • 整个训练过程中,奖励由准确性组件 和格式组件 组成:
    $$
    r_i = r_{\text{acc},i} + r_{\text{format},i}
    $$
    • \( r_{\text{format},i} \in \{0, 1\} \):检查响应是否遵循所需结构(<think>...</think> 和 <answer>...</answer> 标签)
    • \( r_{\text{acc},i} \in \{0, 1\} \):衡量最终答案的正确性
  • 早期训练阶段 :使用易于验证 的问题,正确性通过确定性规则匹配判断
  • 后期阶段 :问题难度显著增加,答案可能采用多种有效形式或需要语义理解
    • 规则验证变得不可靠,因此将 \( r_{\text{acc},i} \) 替换为 LLM-as-a-Judge 评估器(Qwen3-Next-80B-A3B-Instruct),接收模型响应和参考答案,输出二值正确性判断
    • 问题:问题难度增加,不一定代表验证难度增加吧
  • 论文比较了两种格式规范:
    • 格式 A :仅要求单一开标签 <think>...</think> → 模型利用松散格式,在答案后附加无尽乱码,序列长度快速增长而奖励停滞
    • 格式 B :要求双闭合标签 <think>...</think><answer>...</answer>,响应必须以 EOS Token 结束 → 防止由尾部垃圾驱动的退化长度增长
    • 最终通过实验验证并选择了格式 B

Infra 优化

Infra 总体架构
  • 训练引擎 :Megatron
  • 推理/Rollout 引擎 :SGLang
  • RL 流程编排 :Areal 框架(2025)
  • 硬件 :320 × H200 GPU
Context Parallelism Optimization
  • 长上下文窗口训练需要上下文并行(CP)将单条长序列分区到多个设备
  • 标准 Ring Attention 的瓶颈 :KV Chunk 按顺序在环中传递,每个设备必须等待与所有其他设备的完整通信轮次才能完成注意力计算,造成严重延迟瓶颈
    • Ring Attention 让每张卡只需要维护自己那部分 Sequence chunk 的 MHA
      • 原始论文:Ring Attention with Blockwise Transformers for Near-Infinite Context, arXiv 2023, UC Berkeley
      • 图解大模型训练系列:序列并行3,Ring Attention - 猛猿的文章 - 知乎
  • 本文的优化策略 :针对模型的混合架构(MLA + Lightning Attention 层):
    • 1)MLA 层(DeepSeek-AI, 2024):采用 All-to-All CP 策略
      • 沿 Head 维度使用单次集合通信重排数据,每个设备可独立计算整个序列中部分 Head 的完整注意力
      • 由于 MLA 将 Key 和 Value 压缩到低秩潜在空间,All-to-All 通信量相比发送完整 KV 张量大幅减少
    • 2)Lightning Attention 层(2024):计算依赖于小尺寸、固定大小的 KV 状态矩阵
      • 使用单次 AllGather 操作 一次性将所有本地状态广播到所有设备,立即可完成计算
    • 这些优化在数学上等价于标准 Ring 注意力,产生相同的梯度
混合精度控制
  • 论文还实现了混合精度控制以确保稳定高效训练

实验

实验设置

  • 基座模型
    • 从两个预训练的 Ling-2.5 基座模型开始,未经任何监督微调 :
      • 1)Ling-2.5-1T-Base :1T-A63B
      • 2)Ling-2.5-flash-Base :104B-A7.4B
  • 超参数
    • 一些超参数汇总表格
      参数 第一阶段 RL 后续阶段
      Batch Size 512 256
      Minibatch Size 32 32
      优化器 Adam Adam
      \(\beta_1, \beta_2\) 0.9, 0.999 0.9, 0.999
      学习率 \(2 \times 10^{-6}\)(常数) \(2 \times 10^{-6}\)(常数)
      Weight Decay 0.01 0.01
      Rollout 数量 \(G\) 16 16
      采样温度 1.0 1.0
      \(\epsilon_{\text{high} }\) 5.0 5.0
      \(\epsilon_{\text{low} }\) 无下界 无下界
    • 其他超参数设置
        • KL 惩罚 :第一阶段使用 \(\beta = 10^{-4}\),后续阶段移除
      • 课程学习(Curriculum Learning) :响应窗口从 4k 逐步扩展到 64k Token,每 800 步翻倍
      • 参考模型更新 :每 400 步用最新检查点更新参考模型,确保 KL 锚点与策略改进保持相关
      • 自蒸馏微调 :3 Epochs,序列长度 64k,学习率 \(7 \times 10^{-5}\)
  • 评估基准:七个具有挑战性的数学推理基准
    • AIME 2024, AIME 2025, AIME 2026
    • HMMT February 2025, HMMT November 2025, HMMT February 2026
    • IMOAnswerBench
  • 评估参数 :温度 0.6,Top-k 0.95,Pass@1 准确率(64 次运行平均)

主要结果

  • 整体结果表(当前模型与 SOTA 模型的对比):
  • 结果1:Zero RL 从零实现有竞争力的推理
    • Ring-2.5-1T-Zero(第一阶段 RL)在 AIME 2026 上达到 84.2% 的准确率,证明第一阶段 RL 能有效从预训练基座模型激发高级数学推理
    • 课程式响应窗口扩展(4k→64k)结合重要性比率校正,稳定有效地激励模型发展涌现的 CoT 行为
  • 结果2:每个后续阶段都带来可测量的性能提升,验证了多阶段方法的整体有效性
    模型阶段 AIME 2024 AIME 2025 AIME 2026
    第一阶段 RL 89.1 83.3 84.2
    自蒸馏 92.3 87.3 88.1
    第二阶段 RL 93.5 91.6 92.5
    第二阶段 RL (Yarn=2) 94.1 92.3 93.2
  • 结果3:自适应推理模式提供灵活的性能-效率权衡
    模式 训练截断 推理 Token AIME 2024
    Low 4k 2,353 82.3
    Medium 16k 8,085 90.9
    High 128k (Yarn=2) 20,817 93.2
    • 注:第三阶段 RL 的性能略低于第二阶段峰值,主要归因于:
      • 1)缺乏高质量超长推理数据限制了 High 模式的上界
      • 2)三个不同长度联合训练引入负迁移(Negative Transfer)
  • 结果4:模型规模放大了 Zero RL 收益(问题:其实应该是跟原来的 Base 比才合适,不然模型参数多了,效果肯定是提升的,不能说明 Zero-RL 本身如何)
    • Ring-2.5-flash-Zero(104B):AIME 2024 71.2%,AIME 2025 63.5%
    • Ring-2.5-1T-Zero(1T):AIME 2024 89.1%,AIME 2025 83.3%
    • 在更难基准上性能差距更为显著,证明在 Zero RL 设置中,激进的参数扩展至关重要
    • 更多参数提供必要的表示能力和更宽的内部知识库,以自主导航巨大的搜索空间

补充:第一阶段的训练动态

  • 图 2 展示了 Ring-2.5-1T-Base 模型在第一阶段 RL 中的训练过程
    • (a)(b) 前 2800 步:使用初始相对简单的数据,Reward 和 Sequence Length 平稳上升,表明模型正从零开始自举推理能力
    • (c)(d) 切换到更难的新数据后:模型继续提升,奖励持续增长,同时序列长度也保持增长,说明难度递增的课程学习有效推动了推理边界

CoT 质量评估结果

  • 整体评估结果:
可理解性结果
  • 论文观察到 1T 模型自发发展出结构分段的推理
    • 即使没有显式格式约束,也会使用 Step 1:、Step 2: 等标记自然地划分推理阶段
    • 理解:应该是跟模型预训练和 Mid-traing 阶段看过类似数据有关
  • 量化评估 :使用 LLM-as-a-Judge 对全部 90 个 AIME 问题(2024-2026)进行成对比较,将论文模型与四个强基线(GLM-5.1、Kimi-k2.6、MiniMax-M2.7、Qwen3.5-397B)对比
    • 论文模型在所有对比中均取得主导性胜率(图 3a),确认涌现的结构化推理反映了真正优越的逻辑组织
可复现性结果
  • 蒸馏设置 :
    • 将论文模型的推理轨迹蒸馏到 Qwen2.5-32B 和 Llama3.3-70B-Instruct,使用仅 100K 数据样本(DeepSeek-R1 使用 800K)
      学生模型 从 Ring-Zero 蒸馏 从 DeepSeek-R1 蒸馏 增益
      Qwen-32B 78.4 72.6 +5.8
      Llama-70B 74.5 70.0 +4.5
  • 从 Ring-Zero 轨迹蒸馏模型需要的数据量显著更少,且优于 DeepSeek-R1 对应版本
    • 证明本文的分步分段推理轨迹提供了更丰富、更可迁移的学习信号
    • 理解:不一定,有可能仅仅是模型效果本身带来的,而且可能和教师 VS 学生模型的分布有关
效率结果
  • 在所有五个模型都正确回答的 AIME 问题子集上比较平均 Token 数:
    • Ring-Zero :6,368 Tokens
    • 其他 4 个 SOTA 模型:超过 12,000 Tokens
    • 理解:Ring-Zero 的 Token 效率至少是其他模型的 2 倍以上
      • 但这个比较可能不是很公平,因为 Ring-Zero 的效果并不如其他模型,如果一味的压低模型的 Token 数,且仅看大家都正确的 Query,确实可能会得到很高的 Token 效率

补充:详细分析

不同 RL 算法对比

  • 在 Flash Model 上比较四种 RL 算法:GRPO、DAPO、CISPO、GSPO
  • 关键 Insight :
    • CISPO 和 DAPO 通过放大低概率 Token 的梯度信号,比 GRPO 更快减少全失败组比率,实现更快的奖励增长和序列长度增长
      • 但这种加速以稳定性为代价
      • 理解:
        • CISPO 本身将梯度截断变成了 Soft 的 Advantage,允许模型更新更多本该截断的 Token,所以更新更快
        • DAPO 的动态过滤等方式相当于隐形提升了学习率,相同步数下训练更快是符合预期的
          • 注:DAPO 本身提升 Clip 上界本该引起熵增加,但是可能因为一些别的策略混合导致图 4c 中观察不到这个点
        • GRPO 中,没有过滤各种全对全错样本,可能存在学习率低的问题,所以前期学不动(几乎全错)
    • 稳定性比较:
      • CISPO 最易发生熵崩溃和训练不稳定
        • 理解:因为 CISPO 允许了一些异常的 Token 也更新了,虽然快,但是容易出现问题
      • DAPO 次之
        • 理解:因为 DAPO 的动态过滤相当于提升了学习率了,所以学得快, 但是学习率大,波动也大
      • GRPO 最稳定
        • 理解:学的慢当然稳定,前期学习率极低
    • 奖励改进速度和不稳定程度遵循完全相同的顺序 :CISPO > DAPO > GRPO
    • GSPO 使用是 真正 Sample-level 的损失,能显式维持高熵,防止熵崩溃,但几乎不提供探索更长序列长度的激励 ,不适合引导早期推理能力
      • 理解:
        • 可以看到,GSPO 比较特别,模型的熵几乎没有降低,序列长度也是最短
        • 奇怪的问题:GSPO 的起始 Reward 居然比别人高,这个是否是曲线上报有错?
        • 看起来 GSPO 相对其他算法也没有特别明显的优势,可能是因为 GSPO 针对整个 Sample 进行 Clip 容易造成样本效率低下
  • 基本结论:放大低概率 Token 对从零激发推理高度有效,但需要仔细的稳定化处理
    • 理解:在原始模型未经过 SFT ,没有任何推理能力时,模型产生 CoT 需要部分原本低概率 Token 概率变大
  • 一些其他观察和理解:
    • GRPO 长度先增加再降低,可能是前期探索更长的 CoT,后期大家都正确以后逐步寻找短的 CoT
      • 注:原始 GRPO 是 Sample-level Loss 聚合
    • 其实这些方法对超参数都是比较敏感的,特别是学习速度跟超参数相关性特别高,加上跟模型和数据也有较大关系,所以这些曲线只能作为参考观察,不代表任何场景都一样
    • Reward 值大于 1,应该是奖励不仅仅是正确性,还有格式等导致

RL 稳定化策略

KL 惩罚的效果
  • 比较有无 KL 散度惩罚的训练运行(图5):
    • 无 KL :训练与 Rollout 引擎的 Log-概率差异无界增长 → 熵崩溃 → Reward 崩溃
    • 有 KL :所有训练指标保持健康,数值差距受控,熵保持健康水平,Reward 稳步提升
  • 理解:KL 惩罚作为关键正则化器,约束整体策略漂移,防止过早熵崩溃,维持模型探索能力
  • 理解:文章没有明确说明,但这个实验应该是针对第一阶段 RL 的
  • 问题:图 5c 和 图 5b 的第 0 个 Step 指标应该是一样的,但看着不同,上报必然有问题
Ratio 校正策略对比
  • 比较三种配置(图6):
    • 1)Baseline :仅使用 SGLang Logits 的标准比率 → 约 800 步内崩溃
    • 2)**+ IcePop** :Baseline 加上裁剪重要性比率阈值 → 延迟崩溃,但约 2700 步最终失败
    • 3)**+ Ours** :使用 Megatron 作为分子,SGLang 作为分母 → 成功维持稳定 RL 训练 ,Log-概率差异接近零,熵被保留,Reward 一致提升
  • 而且:本文方法避免了阈值调优,节省计算时间

不同格式奖励差异巨大

  • 比较两种格式规范(图7):
    • 格式 A(仅需单一开标签):模型利用松散格式,在答案后附加无尽乱码 → 序列长度快速增长,奖励完全停滞
    • 格式 B(双闭合标签 + EOS 强制终止):只有正确终止的 Rollout 获得信用 → 防止由尾部垃圾驱动的退化长度增长
  • 论文在所有训练阶段采用格式 B

Length Inertia,长度惯性

现象描述
  • 论文揭示了标准 RL 训练中的根本缺陷,即 长度惯性(Length Inertia) :
    • 早期阶段使用 Token-level Loss 聚合 ,隐式地给更长序列分配更高信用
    • 模型发现”懒惰捷径”:仅仅生成更多 Token 是获得高累积奖励的数学上更安全的方式
      • 原文认为:即使针对已经能答对的简单题,只要把回答写长,积累的正向梯度总和就更大,因此模型会无脑地堆砌冗余内容
      • 我的理解:使用 Sample-level 会鼓励短的正样本,可以缓解这个问题,但这个问题本身并不是 Token-level 导致的,理论上 Token-level 并不鼓励任何长度倾向,仅仅把长度倾向交给隐式的奖励模型了(“对于相同的 Prompt,Response 输出越长,其正确的概率越大” (等价于 “对于相同的 Prompt,正确 Response 的平均长度比错误 Response 长” ) 则说明奖励倾向于将整体长度变长)
        • 使用累计正向梯度总和更大这个点来解释不太准确,应该看 RL 算法更新时对单个 Token 的鼓励和打压程度来区分生成的概率
          • 比如:
            • 假设某个位置的候选 Token 为 TokenA 和 TokenB,原本输出两者的概率都是 0.49,TokenA 之后会输出很长的答案,TokenB 是结束字符
            • 此时如果 RL 算法对 TokenB 的鼓励高于 TokenA,则无论 TokenA 之后的 Token 如何被鼓励,生成结束字符(短队列)的概率都会增加!!!
            • 假设 TokenB 和 TokenA 之后得到的 Response 都是正确的,那么 GRPO 算法下:
              • Token-level Loss 聚合 下,两者的 Advantage 相等,更新后两者的概率仍然相等
              • Sample-level Loss 聚合 下,TokenA 的 Advantage 更低(被其他 Token 平均了),更新后 TokenB 的概率会高于 TokenA 的概率
          • 结论:Token-level Loss 聚合 并不鼓励长文本,如果 “对于相同的 Prompt,正确 Response 的平均长度比错误 Response 短” ,则输出长度会逐步缩短
  • 越来越长的理解:“对于相同的 Prompt,Response 输出越长,其正确的概率越大”
实验结果分析
  • 实验结果1 :追踪模型首次 Rollout 就完美回答的简单问题的序列长度(图10c):
    • 模型不维持简洁答案 ,序列长度随训练无条件扩展
    • 证明标准 RL 训练使模型变懒,因强前向惯性而膨胀 Token 使用
  • 实验结果2 :比较 16k 和 32k 响应窗口的训练运行(图8):
    • 模型不将额外 32k 容量留给真正困难的问题
    • 而是在所有问题上统一提高冗长度
    • 32k 设置产生近乎两倍长的平均响应,但奖励增益微乎其微

超参数分析

  • 超参数实验结果(图9)
  • 学习率(\(1\times10^{-6}, 2\times10^{-6}, 3\times10^{-6}\))
    • 三者收敛到高度相似的奖励水平和序列长度,训练对学习率变化具有鲁棒性
  • Rollout 数量(\(G \in \{8,16,32\}\))
    • \(G=32\) 每步收敛最快
    • \(G=8\) 实际墙钟时间最快(计算开销低)
    • \(G=16\) 作为平衡默认值
  • 损失归约(Token-level vs. Sample-level)
    • Token-level 显著促进 CoT 长度增长
    • Sample-level 保持响应长度完全平坦
    • 确认设计选择:Token-level 损失对初始激励长推理链至关重要
  • 更多理解:
    • 相同 Step 下,Rollout 增大时,确实会获得更高的 Reward,但是并不明显,特别是 32 和 16 之间对比不明显,而且继续训练下去,可能会收敛到同一个奖励上限
    • 相同 Step 下,学习率越大,确实 Reward 越大,但是长远训练下去推测也会收敛到同一个 Reward 上
    • Token-level Loss 聚合方式的 Reward 更高些,但是长度其实涨的非常多(Token-level Loss 聚合 不像 Sample-level Loss 聚合一样鼓励短的正样本)
      • Token-level Loss 聚合是否是一个合适的选择有待考量

补充讨论

模型规模对训练的影响

  • 比较 104B(flash)和 1T 模型在相同配置下 1T 模型的优势:
    • 性能上限 更高: AIME 2024: 89.06% vs 71.72%;AIME 2025: 83.28% vs 63.54%
    • 样本效率 更高:整个训练过程中保持持续更快的推理改进速率(更少的数据就能拿到相同的效果)
  • 结论 :海量参数容量是有效 Zero RL 的基本先决条件

RL 是否真正扩展推理边界?

  • 这是一个长期争论的问题:RLVR 是真正扩展模型的推理边界(Discovery),还是仅锐化其现有分布(Sharpening)?
  • 本文的答案 :Zero RL 是明确的两阶段现象(图10b):
    • 1)发现阶段(Discovery Phase) :
      • Pass@1024 在训练早期增加
      • RL 通过发现预训练期间休眠的新推理模式来主动扩展推理边界
      • 训练数据有效解锁模型先前未展现的潜在能力
    • 2)锐化阶段(Sharpening Phase) :
      • Pass@1024 最终趋于平稳
      • Pass@1 准确率持续稳步攀升
      • RL 锐化输出分布、精炼策略,教会模型在已建立的推理边界内持续产生正确解
  • 关键 Insight :一旦潜在能力被完全解锁,”发现”阶段结束,RL 平滑过渡到”锐化”阶段
  • 理解:实际上,取决于我们如何认知 Pass@K
    • 如果从比较小的 K 看 Pass@K(极端情况是 Pass@1),则可以认为模型一直在 Discovery
    • 如果从比较大的 K 看 Pass@K(极端情况是 Pass@\(\infty\)),则可以认为模型一直在 Sharpening

如何在保持效率的同时改进推理能力?

  • 原文认为: Token-level Loss 聚合 天然鼓励更长响应(梯度幅度与序列长度成比例)
    • Token-level Loss 聚合 对引导早期 CoT 高度有效,但与推理效率产生严重冲突
    • 理解:这句话不对,Token-level 鼓励更长响应的前提是 “对于相同的 Prompt,正确 Response 的平均长度比错误 Response 长”
    • 理解:应该重新审视这个问题,是 Sample-level Loss 聚合本身鼓励短的正样本,而不是 Token-level Loss 聚合 鼓励更长的响应(Token-level Loss 聚合 不鼓励也不打压)
  • 论文的两阶段解决方案 :
    • 1)自蒸馏阶段 :主动修剪推理轨迹
      • 移除重复验证步骤
      • 压缩冗长子推导
      • 消除循环推理
    • 2)第二阶段 RL :切换为Sample-level Loss 归一化
      • 原文认为:这是因为消除对更长响应的数学偏好,允许模型优化准确率而无不受控制的长度增长
      • 实际理解:在正确轨迹中,Sample-level Loss 更偏好短的 Response
  • 原文提到这种方法本身也有局限性 :Sample-level Loss 仍是启发式变通方案,理想方法应在单一统一 RL 目标中联合优化推理质量和 Token 效率
    • 理解:本质上可以添加长度惩罚实现这个,实际场景中也常常是添加了长度惩罚的

如何平衡训练效率与稳定性?

  • 核心挑战 :低概率 Token 具有巨大价值(代表新颖策略、创造性技术和方案)
    • 放大它们可能显著加速学习,但放大数值不一致性会导致不稳定
    • 理解:在原始模型未经过 SFT ,没有任何推理能力时,模型产生 CoT 需要部分原本低概率 Token 概率变大
  • 论文的双重机制 :
    • 1)KL 散度惩罚 :约束整体分布漂移,防止策略崩溃到狭窄、退化的 Token 序列集合
    • 2)训练-推理 Ratio 校正 :从根本上消除浮点差异,防止放大过程放大数值错误
  • 实验结果:这个 Setting 下训练极快收敛,同时在数千步上保持完美稳定训练

原生 RL 的 CoT 与蒸馏方法对比

  • 原生 Zero RL
    • 无外部教师,可独立推动前沿模型的推理边界
    • 海量预训练模型蕴含巨大未开发潜力,持续探索还能解锁深层推理能力
  • 蒸馏:
    • 高度样本高效
    • 仅转移已有知识,静态蒸馏永远无法实现
  • 实验观察 :将训练好的第一阶段 RL 专家的轨迹蒸馏到 Ling-2.5-flash-Base,性能匹配或超过 flash 模型上的长时间 Zero RL 训练
    • 但蒸馏 无法突破已建立的知识边界

RL 可扩展 CoT 的基本限制是什么?

训练数据分布
  • 关键 Insight :自然真实世界数据与最优 RL 训练数据之间存在根本性不匹配
    • 真实世界呈现长尾难度分布 ,严重偏向简单问题(图10d:67.6% 的问题可在 4k Token 内解决)
    • 但有效模型训练不需要保留此长尾
      • 理解:模仿自然频率对 RL 模型无益 ,RL 需要的是有正负信号的 Query
    • 过度训练长尾简单问题浪费计算资源,停滞学习过程
    • 模型严格需要动态课程 ,问题难度随能力增长持续扩展
  • Mid-training 阶段的其他类似观察 :
    • 通用世界知识也存在长尾低效性,大多数自然文本包含基础和重复事实,必须在 Mid-training 阶段人为最大化复杂 Agent 数据的密度
模型容量
  • 模型规模决定性能上限和学习速度
  • 更大模型拥有更丰富的内部表示,更可能产生令人惊讶的涌现行为并达到更强最终结果
上下文窗口
  • 更长推理链解锁复杂的多步推导
  • 受硬件资源限制,本文训练限制在 64k 上下文窗口,作者坚信进一步扩展将直接解锁新的数学能力水平
预训练先验
  • Zero RL 只能从预训练中已嵌入的知识引导推理
  • 如果特定数学概念或证明技术不在预训练数据中,RL 无法凭空创造
    • 预训练模型的世界知识和模式库形成刚性上界 ,RL 可在此边界内锐化和优化,但无法根本超越
  • 理解:这里论文的理解和前面的 Pass@K 评估 RL 是否提升模型 Discovery 能力还是锐化的理解一致

A Bitter Lesson

  • 本文对 “苦涩的教训” 理论进行了验证:简单、可扩展的计算优于复杂人类规则
    • 论文的核心发现:当扩展到 1T 参数时,human-engineered heuristics 变得完全冗余
    • 在纯 Zero RL 下,1T 模型从零自发发现 五种高级认知策略,无任何显式监督或辅助奖励

Anthropomorphic Reasoning Traces,拟人化推理轨迹

  • 模型在复杂问题解决中频繁表现拟人化特征,分为三类心理行为:
    • (1) 模拟挫折与发泄(Simulated Frustration and Venting)

      “Wait, but I might have a brain fart here…”

    • (2) 模拟懈怠与猜测(Simulated Slacking and Guesswork)

      “Therefore, I’ll wing it and go with \(\boxed{2}\).”

    • (3) 自我赞美与戏谑(Self-Praise and Playful Banter)

      “Genius Idea. I think I’ve heard of this problem before…”

Structured Format

  • 没有任何格式指令(仅”reason step by step”),模型自然地将思想组织为高度结构化、教学清晰的轨迹:
    • 显式步骤编号
    • 清晰的阶段转换
    • 不同的中间总结
  • 深层含义 :结构清晰不仅是需要通过人类标注教授的风格偏好,而是模型组织自身长上下文注意力的自然最优策略
    • 从算法角度看,这表明 LLM 推理可形成更高层次的动作空间 ,超越标准 Token 级动作或 Agent 风格任务步骤,为未来 RL 优化开辟新路径
  • 理解:本质还是模型内部藏着这个模式且这个模式更容易生成更高的奖励

Parallel Reasoning,并行推理

  • 模型自发分支到替代策略,而非困于单一狭窄 CoT:
    • 在单个线性 Rollout 内有效执行 自包含的 “Tree-of-Thought” 搜索
    • 评估竞争方法
    • 比较其输出
    • 仅当多条独立证据线收敛时才提交最终答案
  • 意义 :并行探索是 RL 发现的自然最优算法 ,而非需要特殊优化的工程技巧

Context Anxiety, 上下文焦虑

  • 当模型接近其感知的最大 Token 限制时,经历策略性恐慌 :
    • 主动中止复杂推理链以强制启发式猜测
    • 有意识地优先考虑结构完整性而非数学严谨性
    • 展现出对游戏规则的深层学习意识 :格式错误得零分,但猜测至少提供非零成功概率
  • 示例 :”Given the time I’ve invested and the ambiguity, I will proceed to make an educated guess…”
  • 理解:这个是因为训练时给了模型 “被强制截断不如自己尽快结束” 的偏好

Self-Verification

  • 模型自发学习验证中间推导:
    • 主动重新检查初始假设
    • 对照已知公式进行交叉检查
    • 将结果代回原始约束以确保逻辑一致性
  • Insight :这些严谨的合理性检查完全出于获得最终正确性奖励的学习必要性 ,完全绕过人类设计的验证模板

附录:论文中的其他补充说明

RLVR 方向改进

  • RLVR 关键里程碑:
    • DeepSeekMath(2024):引入 GRPO,消除 Critic 模型依赖
    • DeepSeek-R1(2025):纯 RL 直接应用于基座模型可自发激励涌现 CoT
    • SimpleRL-Zoo(2025b)、Open-Reasoner-Zero(2025):系统识别关键超参数选择
    • AceReason-Nemotron(2025a):原生 RL 在模型有足够容量时可超越静态蒸馏
  • 算法改进:
    • DAPO(2025):非对称裁剪和动态采样
    • VAPO(2025b):基于价值的增强 PPO 显式支持长链推理
  • 本文贡献:聚焦于扩展 Zero RL 的数值和结构瓶颈,采用裁剪重要性比率策略优化,引入训练-推理比率校正,构建多阶段流程

大规模模型训练改进

  • 关键基础设施:
    • Megatron-LM(2019; 2021):张量和流水线并行
    • ZeRO(2020):分区优化器状态
    • MegaScale(2024):数万 GPU 的生产级解决方案
    • veRL(2025)、OpenRLHF(2024):RL 特定工作负载的分布式编排
  • 本文贡献:成功将 Zero RL 扩展到 1T 参数模型,利用优化上下文并行高效支持稳定长上下文训练

附录 A:Comparison of Our CoT with Other Models

  • 这一节给出了 Ring-Zero 与其他前沿模型(Claude Opus 4.7、GPT-5.5、Gemini 3.1 Pro、DeepSeek-V4-Pro、GLM 5.1、Kimi K2.6、Qwen 3.5、MiniMax 2.7、Doubao 2.0)在同一数学问题上的 CoT 轨迹对比,证明 Ring-Zero 的 Token 效率(3301 tokens vs 其他模型 522-39192 tokens)和结构化清晰度
  • 详情见原始论文

附录 B:LLM-as-a-Judge Evaluation Prompts

  • 完整评估 Prompt 包含三个核心标准及其详细说明,以及评分量规和输出格式要求

  • Comprehensibility Evaluation Prompt

    1
    2
    3
    4
    5
    6
    7
    8
    9
    10
    11
    12
    13
    14
    15
    16
    17
    18
    19
    20
    21
    You are an expert evaluator assessing the comprehensibility of mathematical reasoning traces (Chain-of-Thought). You will be given a math problem and two reasoning traces generated by different models (Model A and Model B). Your task is to judge which trace is more comprehensible to a human reader.
    Evaluation Criteria. Comprehensibility measures the degree to which a human reader can follow and fully understand the reasoning steps without requiring external context or repeated reading.
    Evaluate along three dimensions:
    1. Logical Coherence: Does each reasoning step follow naturally from the preceding one? Is there a clear, smooth progression from the problem statement toward the conclusion? Are there any abrupt jumps, non-sequiturs, or unexplained transitions?
    2. Causal Explicitness: Are the causal dependencies between steps explicitly stated? Can the reader understand not only what the model concludes at each step, but also why each intermediate result is derived? Are key logical connections made explicit rather than left implicit?
    3. Absence of Hallucinations: Is the content free from hallucinated facts, incorrect intermediate results, or unsupported assertions? Are all mathematical claims justified or derivable from prior steps?
    Scoring Rubric.
    • A: Model A’s trace is more comprehensible—it is clearer, better structured, or more reliable than Model B’s.
    • Tie: Both traces are roughly comparable in comprehensibility—neither has a meaningful advantage.
    • B: Model B’s trace is more comprehensible—it is clearer, better structured, or more reliable than Model A’s.
    Important Notes.
    • Focus only on comprehensibility of the reasoning process, not on whether the final answer is correct.
    • A shorter trace is not inherently better or worse—judge by clarity, not length.
    • Consider the perspective of a mathematically literate reader.
    • If both traces contain errors, judge which one is still easier to follow and less misleading overall.
    Input: [Problem], [Model A’s Reasoning Trace], [Model B’s Reasoning Trace].
    Output Format:
    {
    "analysis": "<2-4 sentence comparative analysis>",
    "verdict": "<A | Tie | B>"
    }
    • 汉语版本:
      1
      2
      3
      4
      5
      6
      7
      8
      9
      10
      11
      12
      13
      14
      15
      16
      17
      18
      19
      20
      21
      22
      23
      24
      25
      26
      27
      28
      29
      你是一名专业评估员,负责评判数学推理过程(思维链)的易懂程度。你将拿到一道数学题,以及由两个不同模型生成的两段推理过程(模型A、模型B)。你的任务是判断哪一段推理更便于人类阅读者理解。

      ## 评估标准
      易懂程度:衡量人类读者无需额外背景信息、无需反复阅读,就能跟上并完全读懂推理步骤的程度。

      从三个维度开展评估:
      1. 逻辑连贯性:每一步推理是否能顺承上一步自然推导?从题目条件到最终结论,推导流程是否清晰流畅?是否存在逻辑断层、前后无关的推论、无解释的跳转?
      2. 因果明确性:步骤间的因果关联是否清晰写明?读者不仅能看懂模型每一步得出了什么结论,还能明白该中间结果的推导依据;关键逻辑联系是否直白呈现,而非含糊省略?
      3. 无虚构错误:内容不存在凭空捏造的知识点、错误中间结果、无依据的论断;所有数学结论都能由前文步骤推导得出、有理可依。

      ## 评分判定规则
      • A:模型A的推理过程更易懂——相比模型B,条理更清晰、结构更完善、推导更严谨可靠。
      • 持平:两段推理易懂程度大致相当,不存在明显优劣之分。
      • B:模型B的推理过程更易懂——相比模型A,条理更清晰、结构更完善、推导更严谨可靠。

      ## 重要注意事项
      • 仅评判推理过程的易懂性,不考量最终答案是否正确。
      • 推理篇幅长短不代表优劣,评判依据是条理清晰度,而非文字长度。
      • 站在具备基础数学素养的读者视角进行评判。
      • 若两段推理均存在错误,综合判断哪一段整体更易于梳理逻辑、误导性更低。

      ## 输入内容
      [数学题目]、[模型A推理过程]、[模型B推理过程]

      ## 输出格式
      {
      "analysis": "<2至4句对比分析文字>",
      "verdict": "<A | Tie | B>"
      }

附录 C:Showcase of Our Reasoning Traces

  • 原文在本节展示了 Ring-2.5-1T-Zero 在三个不同基准(AIME 2026、HMMT Feb 2026、IMO AnswerBench)上的完整推理轨迹
  • 观察到的结论:模型自发产生的高度结构化、可读性强的推导过程
123…352
San Ye

San Ye

Stay Hungry. Stay Foolish.

704 posts
53 tags
© 2026 San Ye
Powered by Hexo
|
Theme — NexT.Gemini v5.1.4