已核验 · Sep 3, 2026
已独立佐证据报道 OpenAI 的 Astra 用「循环」推理——而造安全监控的人坐不住了
2 个信源据 The Information 周二报道、经 TechCrunch 转述:OpenAI 的 Astra 模型据报道使用「recurrent depth」(也称「opaque recurrence」)——把同一个查询在循环中处理多次,而非顺序逐步推理——留下比标准思维链更少的可读痕迹。安全研究者反应激烈:Redwood Research CEO Buck Shlegeris「深感担忧」;首席科学家 Ryan Greenblatt 担心不透明推理扩展更快、模型「完全或几乎完全在潜空间中推理」;Zvi Mowshowitz 称「玩火」,可能需要立法防止逐底竞争。OpenAI 首席科学家 Jakub Pachocki 称保留思维链监控是「我们当前研究计划的核心目标」;按报道,Astra 的使用看起来有限,其思维链仍预计保持可读。报道中不存在任何基准或测量数据。
为什么现在讲
Anthropic 8 月 31 日的对齐与安全报告、9 月 1 日的模型发布做了铺垫——如今这项被报道的技术把底层问题从「模型在评估里做了什么」转向「到底还有没有人能看着模型思考」。Shlegeris 与 Greenblatt 所在的 Redwood Research,其监控工具是全行业真的在用的,他们的反应不是泛泛的安全评论;而且争议悬而未决——OpenAI 的监控承诺正面对抗那个「如果扩展」版本的担忧。
推荐理由
本周最值得教的一堂 AI 安全课:它用具体的语言解释了思维链可读性为什么重要(那是安全监控器读取的东西),有具名的、以此为业的专家;而证据上的限定——单一付费墙信源、无 OpenAI 论文、无测量——让它同时也是一堂「怎么读单一信源报道」的课,正是本站的信任护城河。
依据
TechCrunch 2026-09-03 全文阅读(发布于 2026 年 9 月 2 日 1:19 PDT)+ The Information 报道作为引用主源(付费墙,AITopic 无法独立打开;事实经 TechCrunch 转述承载)。
“据报道,OpenAI 下一代模型用「循环」而不是「步骤」来思考——造安全监控器的研究者坐不住了。”
切入角度
解释推理可读性为什么是安全基础设施问题:思维链是监控器读取的东西;recurrent depth 在模型内部循环同一个查询、留下更少痕迹;担忧针对「如果扩展会怎样」,不是 Astra 今天的行为。然后是争议双方:Redwood 的人拉响警报,OpenAI 首席科学家承诺监控是核心研究目标——任何一方都没有测量数据。
形式
长视频讲解
演示想法
白板并排画两种架构——顺序思维链(每一步可读)vs 循环递归(同一查询在模型内反复处理)——在每一边标注安全监控器能看到什么、看不到什么,最后收在三段引语:Shlegeris、Greenblatt、Pachocki。
平台注意
每条技术主张都是「据报道」——据 The Information 的付费墙报道、经 TechCrunch 转述;OpenAI 没有发表描述该技术的论文,也不存在任何测量。专家引语针对扩展风险,不是已测结果——连 Shlegeris 都承认 Astra 今天未必明显更难监控。每条引语注明发言人,并说明 OpenAI 对这些推论有异议。
可用说法
- 据 The Information 9 月 1 日(周二)的报道、经 TechCrunch 周三转述:OpenAI 的 Astra 模型据报道使用一种名为「recurrent depth」(也称「opaque recurrence」)的技术——把同一个查询在循环中处理多次,而非多数推理模型那种顺序逐步的方式——因而比标准思维链留下更少的可读痕迹。按 TechCrunch 引述的安全研究者反应:Redwood Research CEO Buck Shlegeris 写道「我看到 Astra 使用 opaque recurrence 的报道,深感担忧」;Redwood Research 首席科学家 Ryan Greenblatt 担心不透明推理的扩展速度可能超过思维链推理,模型将「完全或几乎完全在潜空间中推理」,并说「我希望避开最令人担忧的架构还为时不晚」;AI 安全评论人 Zvi Mowshowitz 称这是「玩火」,认为更密集的使用会损害可监控性,可能需要立法来防止实验室之间的「逐底竞争」。
- OpenAI 的回应,按 TechCrunch:首席科学家 Jakub Pachocki 在 X 发帖称,OpenAI 自第一批推理模型起就致力于保留思维链监控,并称之为「我们当前研究计划的核心目标之一」;OpenAI 也反驳了任何关于它转向「neuralese」的说法,且按报道所述,Astra 对该技术的使用看起来是有限的,其思维链仍预计保持可读。
证据链
拆解
据 The Information 的付费墙报道、经 TechCrunch 转述:Astra 据报道使用 recurrent depth——在模型内部循环查询而非逐步推理——留下的可读痕迹少于思维链。本篇把三层分开:被报道的技术(没有 OpenAI 论文描述它)、专家反应(Shlegeris 的担忧连同他自己的保留、Greenblatt 的潜空间扩展之忧、Mowshowitz 的立法呼吁)、OpenAI 的回应(Pachocki 的监控承诺)——并指出争议针对的是扩展前景而非任何已测量的事实,Astra 的思维链目前仍预计保持可读。
信源
风险
- 每条技术主张都带上「据报道」/「据 The Information 的报道」,把付费墙缺口讲明,并提醒观众:OpenAI 迄今自己的表述只有 Pachocki 的监控承诺。
- 每条专家引语都保留条件框架(「可能」「或许」「如果扩展」),并给出反向事实——Shlegeris 自己的保留意见与 OpenAI 的监控承诺——同时明说报道中没有任何测量数据。
演示思路
- 双架构白板:思维链 vs recurrent depth,每一边下面加一层「监控器看到什么」
- 引语阶梯卡片:Shlegeris(担忧,附他自己的保留)、Greenblatt(潜空间扩展之忧)、Mowshowitz(呼吁立法)、Pachocki(监控承诺)——四个具名信源,零测量数据