已核验 · Aug 5, 2026
已独立佐证LongStraw 7/17(arXiv 2607.14952,#1 Daily Paper):百万 token RL execution stack,8x H20 上跑到 2.1M positions + 4.46M 压力测试
2 个信源arXiv 2607.14952(7/17 索引,207 赞,#1 Daily Paper,Mind Lab)提出 LongStraw —— 一个固定 GPU 预算下做百万 token RL post-training 的架构感知 execution stack,以 GRPO 实例化;方法:只用一次无 autograd 评估 shared prompt,只保留后续 token 所需的 model-specific state,短 response 分支在 autograd 下逐个 replay,把 live training graph 从「整段 prompt + response」压到「单条 response 分支」,用 replay 时间换 GPU 内存;模型实现:Qwen3.6-27B(hybrid recurrent + full-attention)与 GLM-5.2(compressed-attention MoE,78 层)。自报数字:8x H20 GPU 上 group=2 与 group=8 完成 grouped Qwen scoring + response backward 在 2.1M positions;group size 增长每档仅 +0.21 GB peak allocated memory;压力测试达到 4.46M positions;32x H20 GPU 上对 2.1M-token prompt 跑完整 78 层 GLM-5.2 做端到端验证。关键洞察:瞄准「inference(~1M token 上下文)与 RL post-training(经常 ≤256K token)」之间的差距,对带累积轨迹的 AI agent 尤其相关;作者说明这些实验只建立 execution capacity、不构成完整训练正确性 —— captured prompt state 是 detached 的、一些 distributed forward / gradient composition 路径仍未完成。
为什么现在讲
7/17 索引的 LongStraw 是 7 月最强 RL 系统研究 —— 百万 token RL post-training execution stack,#1 Daily Paper,207 赞;创作者可以做出「inference 与 RL post-training 的 context 长度鸿沟如何被 execution stack 填平」的内容
推荐理由
可演示空间大:可以拉 LongStraw GitHub repo + HF papers page 的 #1 Daily Paper 状态,讲清「execution capacity 不等于完整训练正确性」的边界
依据
arXiv 7/17 索引 + #1 Daily Paper + 207 赞 + 跨 Qwen3.6-27B / GLM-5.2 双模型实现 + 8x H20 + 32x H20 验证,作为单一系统研究事件热度中上
“「LongStraw 7/17 上 arXiv 拿下 #1 Daily Paper —— 百万 token RL post-training execution stack,8x H20 上跑到 2.1M positions + 4.46M 压力测试,但作者明说这是 execution capacity,不是完整训练正确性。」”
切入角度
把 LongStraw(arXiv 2607.14952)讲成「7 月最强 RL 系统研究 —— 百万 token RL execution stack 填平 inference 与 RL post-training 的 context 长度鸿沟」 —— 创作者做出「execution capacity vs 完整训练正确性」的边界对照,而不是只念 2.1M / 4.46M positions 数字
形式
长视频讲解
演示想法
做一段 10 分钟三段对照 demo:第一段 3 分钟讲「inference vs RL post-training 的 context 鸿沟」(inference 跑 ~1M token、RL post-training 经常 ≤256K token);第二段 4 分钟讲「LongStraw execution stack 三招」(只用一次无 autograd 评估 shared prompt / 只保留后续 token 所需的 model-specific state / 短 response 分支在 autograd 下逐个 replay);第三段 3 分钟讲「execution capacity vs 训练正确性的边界」(作者明说 captured prompt state 是 detached、一些 distributed forward / gradient composition 路径仍未完成,跑通的是 execution 不是 end-to-end RL)
平台注意
2.1M / 4.46M positions 是 LongStraw 作者自陈(中等风险);作者明说这是 execution capacity 不是完整训练正确性(中等风险) —— 不要凭印象改写为「1M token RL 训练已经跑通」
可用说法
- arXiv 2607.14952(在 HF daily papers 上 2026-07-17 索引)提出 LongStraw —— 一个固定 GPU 预算下做百万 token RL post-training 的架构感知 execution stack,以 GRPO 实例化;方法:只用一次无 autograd 评估 shared prompt,只保留后续 token 所需的 model-specific state,短 response 分支在 autograd 下逐个 replay,把 live training graph 从「整段 prompt + response」压到「单条 response 分支」,用 replay 时间换 GPU 内存;模型实现:Qwen3.6-27B(hybrid recurrent + full-attention)与 GLM-5.2(compressed-attention MoE,78 层);自报数字:8x H20 GPU 上 group=2 与 group=8 完成 grouped Qwen scoring + response backward 在 2.1M positions;group size 增长每档仅 +0.21 GB peak allocated memory;压力测试达到 4.46M positions;32x H20 GPU 上对 2.1M-token prompt 跑完整 78 层 GLM-5.2 做端到端验证;关键洞察:瞄准「inference(~1M token 上下文)与 RL post-training(经常 ≤256K token)」之间的差距,对带累积轨迹的 AI agent 尤其相关;作者说明这些实验只建立 execution capacity、不构成完整训练正确性 —— captured prompt state 是 detached 的、一些 distributed forward / gradient composition 路径仍未完成;207 赞,7/17 #1 Daily Paper。
证据链
来自新闻
拆解
LongStraw 单独念 2.1M / 4.46M positions 数字会变成「execution capacity 数字念稿」。本篇解释怎么用「execution capacity vs 完整训练正确性」的边界框架讲 —— 创作者做出「8x H20 跑 2.1M + 32x H20 跑 78 层 GLM-5.2 端到端 + 作者明说 captured prompt state 是 detached」的三段对照,讲清「execution 层能跑 ≠ RL 训练已经验证」。
信源
风险
- 固定链到每条 source,只引用摘要里已公开的内容,不要改写除摘要之外的基准分、性能指标、论文细节、集成里程碑或架构细节。
- 固定链到 arXiv 论文页面,只引用论文摘要里已公开的内容;明确指出头条 positions 数字证明的是「execution capacity」、而非完整端到端 RL 训练正确性;不要改写为「1M token RL 训练已经跑通」。
演示思路
- 做一张「inference vs RL post-training」context 长度鸿沟对照卡:推理 ~1M token、RL post-training 经常 ≤256K token、AI agent 累积轨迹超过 256K
- 拉 LongStraw GitHub repo + HF papers page #1 Daily Paper 状态 + 207 赞 + 41 stars 的 GitHub 统计做「系统研究热度」对照
- 录一段「execution capacity vs 完整训练正确性」的边界 demo —— 跑 Qwen3.6-27B + GLM-5.2 在 32x H20 上 78 层 2.1M-token prompt 端到端验证,讲清「execution 层能跑 ≠ RL 训练已经验证」