已核验 · Aug 5, 2026
已独立佐证Ring-Zero 7/16(arXiv 2607.12395):1T 参数 zero RL 在 AIME 2024 上 94.1%,自发涌现 5 种认知行为
2 个信源arXiv 2607.12395(在 HF daily papers 上 7/16 索引)提出 Ring-2.5-1T-Zero —— 一个用 zero RL 在预训练 base 模型上直接训练、不需要人工标注 CoT 数据、依赖 RLVR 的模型;架构使用 Ling-2.5-1T-Base(1T MoE / 63B 激活)与 Ling-2.5-flash-Base(104B MoE / 7.4B 激活)两个 base 模型,四阶段训练 pipeline(一阶段 RL 用 clipped importance sampling policy gradient + token-level loss 诱发推理 / 自蒸馏用最短正确 rollout + 自反思压缩冗长 CoT / 二阶段 RL 用 sample-level loss normalization 做稳定优化 / 三阶段 RL 引入 4k / 16k / 64k 三层 token budget tier);基础设施用 320x H200 GPU + Megatron + SGLang + Areal 编排,BF16 body + FP32 attention softmax / LM head 混合精度,context parallelism 针对 hybrid MLA + Lightning Attention 架构调优。Ring-2.5-1T-Zero(Second Stage RL)在 AIME 2024 上达 94.1%,在 AIME 2025-2026 / HMMT 2025-2026 / IMOAnswerBench 上有竞争力;自发涌现 5 种认知行为(anthropomorphism / structured formatting / self-verification / parallel reasoning / context anxiety);CoT trace 在 comprehensibility / reproducibility(Qwen-32B 自蒸馏比 DeepSeek-R1 高 5.8 分)/ efficiency(用不到一半 token)上优于 baseline。
为什么现在讲
7/16 索引的 Ring-Zero 是 7 月初最强 zero RL + 1T 参数研究 —— 在不需要人工标注 CoT 数据的前提下,1T 参数模型在 AIME 2024 上达 94.1%、自发涌现 5 种认知行为;创作者可以做出「RLVR 时代 1T zero RL 也能自发涌现认知行为」的对照内容
推荐理由
可演示空间大:可以拉 Ring-2.5-1T-Zero 的 5 种 emergent cognitive behavior 列表(anthropomorphism / structured formatting / self-verification / parallel reasoning / context anxiety)做对照卡,讲清「为什么 zero RL 训练能自发涌现,而非人工显式监督」
依据
arXiv 7/16 索引 + 1T 参数 + AIME 2024 94.1% + 5 种 emergent cognitive behavior,作为单一研究事件热度中上
“「Ring-Zero 7/16 上 arXiv —— 1T 参数 zero RL 在 AIME 2024 上 94.1%,自发涌现 anthropomorphism / self-verification / parallel reasoning 等 5 种认知行为,不需要任何人工标注 CoT 数据。」”
切入角度
把 Ring-Zero(arXiv 2607.12395)讲成「7 月初最强 zero RL + 1T 参数研究」 —— 创作者做出「RLVR 时代 1T zero RL 也能自发涌现认知行为」的对照内容,而不是只念 AIME 2024 94.1%
形式
长视频讲解
演示想法
做一段 10 分钟四阶段对照 demo:第一段 3 分钟讲「为什么 zero RL 能跑出 1T」(Ling-2.5-1T-Base / Ling-2.5-flash-Base + RLVR 不用人工标注 CoT);第二段 3 分钟讲四阶段训练 pipeline(第一阶段 RL 用 clipped importance sampling / 自蒸馏压缩 CoT / 第二阶段 RL 用 sample-level loss normalization / 第三阶段 RL 三层 4k/16k/64k token budget tier);第三段 2 分钟讲「5 种 emergent cognitive behavior」(anthropomorphism / structured formatting / self-verification / parallel reasoning / context anxiety),讲清「为什么 zero RL 训练能自发涌现」;第四段 2 分钟讲 CoT trace 在 comprehensibility / reproducibility / efficiency 上优于 baseline(Qwen-32B 自蒸馏比 DeepSeek-R1 高 5.8 分、用不到一半 token)
平台注意
论文自报 AIME 2024 94.1% + 5 种 emergent cognitive behavior(中等风险),不要改写为「peer-reviewed 分类法」或「业界标准框架」;具体训练算力与 reward formulation 摘要里没给(中等风险),不要凭印象补
可用说法
- arXiv 2607.12395(在 Hugging Face daily papers 上 2026-07-16 索引)提出 Ring-2.5-1T-Zero —— 一个用 zero RL 在预训练 base 模型上直接训练、不需要人工标注 CoT 数据、依赖 verifiable reward RL(RLVR)的模型;架构使用 Ling-2.5 系列的两个预训练 base 模型 —— Ling-2.5-1T-Base(1T MoE,63B 激活)与 Ling-2.5-flash-Base(104B MoE,7.4B 激活)—— 以及四阶段训练 pipeline:(1) 一阶段 RL 用 clipped importance sampling policy gradient 加 token-level loss 来诱发推理;(2) 自蒸馏用最短正确 rollout + 自反思压缩冗长 CoT trace;(3) 二阶段 RL 用 sample-level loss normalization 做稳定持续优化;(4) 三阶段 RL 引入三层难度 tier(4k / 16k / 64k token budget);基础设施用 320x H200 GPU,Megatron 作为训练引擎,SGLang 做 rollout,Areal 框架做编排;BF16 body + FP32 attention softmax / LM head 混合精度;针对 hybrid MLA + Lightning Attention 架构的 context parallelism;关键发现包括在 1T 参数规模上验证「bitter lesson」、两阶段训练动态(初始发现阶段 + 后续 sharpening 阶段)、Ring-2.5-1T-Zero(Second Stage RL)在 AIME 2024 上达到 94.1%(并在 AIME 2025-2026 / HMMT 2025-2026 / IMOAnswerBench 上取得有竞争力的成绩)、以及在无显式监督下自发涌现 5 种认知行为:anthropomorphism / structured formatting / self-verification / parallel reasoning / context anxiety;CoT trace 在 comprehensibility、reproducibility(Qwen-32B 自蒸馏比 DeepSeek-R1 高 5.8 分)、efficiency(用不到一半 token)上优于 baseline。
证据链
拆解
Ring-Zero 单独念任何一个事实点(1T MoE / 63B 激活 / 4 阶段训练 pipeline / AIME 2024 94.1% / 5 种 emergent cognitive behavior / Qwen-32B 自蒸馏比 DeepSeek-R1 高 5.8 分 / 用不到一半 token)都会变成「只念单一基准分」。本篇解释怎么用「RLVR 时代 1T zero RL 也能自发涌现认知行为」框架讲 —— 创作者做出「为什么 zero RL 训练能自发涌现、而非人工显式监督」的对照内容,把 4 阶段训练 pipeline + 5 种 emergent cognitive behavior + CoT trace 优势绑成一条。
信源
风险
- 固定链到每条 source,只引用摘要里已公开的内容,不要改写除摘要之外的基准分、性能指标、论文细节、集成里程碑或架构细节。
- 固定链到 arXiv 论文页面,只引用论文摘要里已公开的内容;不要把 emergent-behavior 分类法描述为同行评议或业界标准框架;明确指出头条分数为论文自报。
演示思路
- 做一张「Ring-Zero 5 种 emergent cognitive behavior」信息卡:每种行为配 1 个具体 demo prompt(anthropomorphism / structured formatting / self-verification / parallel reasoning / context anxiety)
- 录一段「为什么 zero RL 能跑出 1T」对照 demo —— 拉 Ling-2.5-1T-Base + SGLang + Areal 的实际训练栈细节,讲清 RLVR 时代「不需要人工标注 CoT 数据」的现实意义
- 做一段「四阶段训练 pipeline」流程卡:第一阶段 RL 用 clipped importance sampling → 自蒸馏用最短正确 rollout + 自反思 → 第二阶段 RL 用 sample-level loss normalization → 第三阶段 RL 三层 4k/16k/64k token budget tier