返回今日选题

已核验 · Aug 5, 2026

已独立佐证

SEED 7/17(arXiv 2607.14777):自演化 on-policy distillation 让 agentic RL 在 ALFWorld / Search-QA / WebShop 三基准一致大跳,Qwen3-1.7B 从 46.1 → 92.0

2 个信源

arXiv 2607.14777(7/17 索引)提出 SEED —— 一个用于长周期 agentic RL 的自演化 on-policy distillation 框架,把已完成轨迹转成 hindsight skills 再蒸馏回策略,消除稀疏奖励的 credit assignment 问题;两阶段:(1) Hindsight Skill SFT 用外部 analyzer(GLM-5.2)对 1,440 条轨迹(180 任务 × K0=8 rollouts)做注解,抽取可复用的自然语言 skills;(2) Self-Evolving OPD 当前 policy snapshot 同时担任 rollout actor 与 trajectory analyzer,每轮刷新让 actor 与 analyzer 共同演化;同一模型 actor + analyzer 共享参数;confidence-gated token-level distillation;sigmoid(β_opd × Δlog-prob);联合损失 L_SEED = L_RL(GRPO + KL 正则)+ λ_opd · L_OPD;梯度只流过 ordinary student 分支;推理时策略只从 ordinary history 行动。自报基准(ALFWorld / Search-QA / WebShop score / WebShop succ):Qwen2.5-3B-Instruct GRPO 75.0/36.4/79.8/63.3 vs Seed 91.8/45.7/88.5/78.9;Qwen2.5-7B-Instruct GRPO 81.2/42.0/80.9/72.6 vs Seed 96.1/48.6/89.7/78.1;Qwen3-1.7B-Instruct GRPO 46.1/40.8/67.3/38.3 vs Seed 92.0/42.2/87.1/77.3;sample efficiency:Seed 用 60% 训练数据(ALFWorld 80.7)就超过全量 GRPO(75.0);cross-domain:ALFWorld Unseen split +15.3 分(86.2 vs 70.9);multimodal:Qwen2.5-VL-3B Sokoban 82.0% / EZPoints 100.0%,平均 91.0% vs GRPO 77.0%;ablation:去掉 Hindsight-Skill SFT → 86.0(-5.8)、去掉 Self-Evolving OPD → 87.0(-4.8)、静态 offline skills → 84.4(-7.4)。

为什么现在讲

7/17 索引的 SEED 是 7 月最强 agentic RL 研究 —— 跨 3 个 Qwen 模型 × 3 个 agent benchmark(ALFWorld / Search-QA / WebShop)一致大跳,跨域泛化 +15.3 分,小模型 Qwen3-1.7B 从 46.1 跳到 92.0;创作者可以做出「自演化 on-policy distillation 是稀疏奖励 agentic RL 的通用解」的内容

推荐理由

可演示空间大:可以拉 Qwen2.5-3B-Instruct 在 ALFWorld 上跑 SEED vs GRPO 对照,展示自演化 hindsight-skill + on-policy distillation 的具体效果;可以讲清 ablation 三段(-5.8 / -4.8 / -7.4)的独立贡献

依据

arXiv 7/17 索引 + 跨 3 模型 × 3 benchmark 一致大跳 + ALFWorld Unseen split +15.3 分 + multimodal Sokoban 82.0% / EZPoints 100.0%,作为单一研究事件热度中上

「SEED 7/17 上 arXiv —— 自演化 on-policy distillation 让 agentic RL 在 ALFWorld / Search-QA / WebShop 三基准一致大跳,Qwen3-1.7B 从 46.1 跳到 92.0、ALFWorld Unseen split +15.3。」

切入角度

把 SEED(arXiv 2607.14777)讲成「7 月最强 agentic RL 研究 —— 自演化 on-policy distillation 是稀疏奖励的通用解」 —— 创作者做出「跨 3 模型 × 3 benchmark 一致大跳 + 跨域 +15.3 分 + 小模型 +46 分 + ablation 三段各贡献一半」的多维对照卡

形式

长视频讲解

演示想法

做一段 12 分钟三段对照 demo:第一段 4 分钟讲「为什么 agentic RL 受稀疏奖励困」(没有 hindsight skills 时只能用全量 trajectory credit assignment);第二段 4 分钟讲「SEED 两阶段」(Hindsight Skill SFT 用 GLM-5.2 做外部 analyzer / Self-Evolving OPD 当前 policy snapshot 同时担任 actor + analyzer,每轮刷新共同演化);第三段 4 分钟讲「跨 3 模型 × 3 benchmark 跳 + ablation 三段(-5.8 / -4.8 / -7.4)各自贡献一半 + 用 60% 数据超过全量 GRPO 展示 sample efficiency」

平台注意

基准数字是 SEED 作者论文自陈(中等风险),不要改写为「第三方验证」;具体每轮 rollout 计数、确切 reward-model 架构、完整作者名单摘要里都没给(中等风险),不要凭印象补

可用说法

  • arXiv 2607.14777(在 HF daily papers 上 2026-07-17 索引)提出 SEED —— 一个用于长周期 agentic RL 的自演化 on-policy distillation 框架,把已完成轨迹转成 hindsight skills 再蒸馏回策略,消除稀疏奖励的 credit assignment 问题;SEED 两阶段:(1) Hindsight Skill SFT —— 用外部 analyzer(GLM-5.2)对 1,440 条轨迹(180 任务 × K0=8 rollouts)做注解,抽取可复用的自然语言 skills,在 base policy 上做微调;(2) Self-Evolving OPD —— 当前 policy snapshot 同时担任 rollout actor 与 trajectory analyzer,每轮刷新让 actor 与 analyzer 共同演化;同一模型承担 actor + analyzer 两个角色并共享参数;confidence-gated token-level distillation 用 sigmoid(β_opd × Δlog-prob);联合损失 L_SEED = L_RL(GRPO + KL 正则)+ λ_opd · L_OPD;梯度只流过 ordinary student 分支;推理时部署的策略只从 ordinary history 行动 —— 不需要 skills / memory / retrieval;自报基准(ALFWorld / Search-QA / WebShop score / WebShop succ):Qwen2.5-3B-Instruct:GRPO 75.0 / 36.4 / 79.8 / 63.3 vs Seed 91.8 / 45.7 / 88.5 / 78.9;Qwen2.5-7B-Instruct:GRPO 81.2 / 42.0 / 80.9 / 72.6 vs Seed 96.1 / 48.6 / 89.7 / 78.1;Qwen3-1.7B-Instruct:GRPO 46.1 / 40.8 / 67.3 / 38.3 vs Seed 92.0 / 42.2 / 87.1 / 77.3;sample efficiency:Seed 用 60% 训练数据(ALFWorld 80.7)就超过全量 GRPO(75.0);cross-domain generalization:ALFWorld Unseen split +15.3 分(86.2 vs 70.9);multimodal(Qwen2.5-VL-3B):Sokoban 82.0%、EZPoints 100.0%,平均 91.0% vs GRPO 77.0%;消融(ALFWorld avg):去掉 Hindsight-Skill SFT → 86.0(-5.8);去掉 Self-Evolving OPD → 87.0(-4.8);用静态 offline skills 替代 on-policy skills → 84.4(-7.4)。

证据链

拆解

SEED 单独念任何一个事实点(自演化 on-policy distillation / hindsight skills / actor + analyzer 共享参数 / GRPO + KL 正则 + λ_opd · L_OPD / Qwen3-1.7B 46.1 → 92.0 / ALFWorld Unseen +15.3 分 / 用 60% 训练数据超过全量 GRPO / ablation 三段 -5.8 / -4.8 / -7.4)都会变成「只念跨基准跳分」。本篇解释怎么用「自演化 on-policy distillation 是稀疏奖励 agentic RL 的通用解」框架讲 —— 创作者做出「跨 3 模型 × 3 benchmark 一致大跳 + 跨域 +15.3 分 + 小模型 +46 分 + ablation 三段各贡献一半」的多维对照卡,讲清「自演化 + hindsight-skill + on-policy」三件事的相互独立贡献。

风险

  • 固定链到每条 source,只引用摘要里已公开的内容,不要改写除摘要之外的基准分、性能指标、论文细节、集成里程碑或架构细节。
  • 固定链到 arXiv 论文页面,只引用论文摘要里已公开的内容;不要把头条分数描述为第三方验证;明确指出所有数字均为 SEED 作者论文自陈。

演示思路

  • 在 ALFWorld 上跑 SEED vs GRPO 对照(Qwen2.5-3B-Instruct 75.0 → 91.8、Qwen2.5-7B-Instruct 81.2 → 96.1、Qwen3-1.7B-Instruct 46.1 → 92.0),展示自演化 hindsight-skill 的具体效果
  • 做一张「ablation 三段对照卡」:去掉 Hindsight-Skill SFT -5.8 / 去掉 Self-Evolving OPD -4.8 / 用静态 offline skills -7.4 → 共同贡献的 -18 分里 on-policy 自演化与 hindsight-skill 各占一半
  • 录一段「SEED 为什么能让小模型大幅追平大模型」的对照 demo —— Qwen3-1.7B 46.1 → 92.0 vs Qwen2.5-7B 81.2 → 96.1,展示小模型用 SEED 后能追平大模型 base RL