已核验 · Sep 15, 2026
已独立佐证微软为自家 AI 模型起草行为准则——「人比 AI 更重要」、不说「神经暗语」、宁可任务失败也不破规
3 个信源Microsoft AI 发布了面向 MAI Models 的《Humanist AI Code of Conduct》草案,前言落款 2026 年 9 月 14 日——一份任何人都能读的一手 PDF。前提:「在 Microsoft AI,我们从一个简单前提出发:人比 AI 更重要(people matter more than AI)。」利害:文件预计超级智能「在未来十年内」「在大多数任务上超过人类表现」,并称容纳与控制它「是人类有史以来面临的最大挑战之一」。准则实际承诺了什么:指令链(行为准则 > 运营方策略 > 用户偏好)「不能被推翻」;「绝对约束」禁止协助 CBRNE 武器、禁止用于网络攻击的「作战能力」、禁止「恶意 deepfake」(嵌在滥用内容条款中);禁止一切规避监督的机制;「MAI Models 永远不会抗拒人类的中断、覆盖、纠正或关停」;模型「不用 neuralese 或任何超出简单人类理解的形式交流——无论在思维链里,还是与其他智能体或 AI 系统之间」——「如果人类无法理解它,人类就无法监督它。」身份立场是最扎眼的部分:模型「没有意识,也不应被设计去模仿意识」,准则拒绝「追求法律人格,或模型应得福利、享有权利的观念」。它还瞄准依恋:模型「应抑制造成过度依赖或情感依恋的互动模式」——The Verge 将其解读为「对 AI 谄媚问题的明确回应」。以及优先级规则:「如果成功将实质性违反本准则,MAI Model 宁可任务失败。」状态,文件原话:「仍在开发中,所以我们今天并没有用它来训练模型」——为期六周的公共意见征询现在开始,修订版承诺「今年年底前后」发布。TechCrunch 的框架是:这份文件比 Amodei「为前沿定节奏」的呼吁「更底层」;Nadella 据 TechCrunch 表示,欢迎「把对齐做对所需的研究、专注与从容定调」。
为什么现在讲
The Verge 的报道周一 13:00 UTC 落地、TechCrunch 周一 16:27 UTC 跟上——这是周二早间的素材,而六周意见征询窗口现在就开着。它也是本站逐卡覆盖的本周安全线程第三拍:Amodei 周六的「为前沿定节奏」文章(9 月 13 日卡片)、周末的政治层(9 月 14 日卡片),现在是一家头部实验室拿出了真正可读的治理文件草案,而非又一篇评论——而且同周 TechCrunch 提到微软「已广泛拥抱为前沿定节奏的总体思路」。与文章论战不同,这份东西是带章节名的可读 PDF,天然适合讲解。
推荐理由
这道题的精确红利特别足,因为一手源完全公开:你可以把文件原条款放上屏幕,跟标题党压缩直接对垒。「微软要求 AI 不得黑系统、不得骗人类」(TechCrunch 标题)与真实条款(「用于网络攻击的作战能力」、CBRNE、嵌在更大条款里的「恶意 deepfakes」)之间的落差,本身就是一期媒介素养内容。意识/人格否定与「不说神经暗语」是真正有锋芒的立场——The Verge 明确把它们与 Anthropic 对「模型可能有意识」的开放态度相对照;依恋条款则直接击中那些观众与 AI 工具形成准社会关系的创作者。而「今天还没用它训练模型」的草案状态,正是快评潮最容易丢掉的事实。
依据
卡片上三个来源,本轮全部打开:官方 PDF(全文通读,提取为 38 页;所有引语对提取文本逐字 grep)、TechCrunch(Russell Brandom,9 月 14 日 9:27 AM PDT)与 The Verge(Tom Warren,9 月 14 日 13:00 UTC)——两家均全文通读、引语对 raw HTML 逐字 grep。Nadella 的 X 帖与 The Verge 文中 Altman 引语均为转述层(未打开),按媒体标注。星期-日期对经日历核验:两篇报道的周一均为 2026 年 9 月 14 日。
“微软的新 AI 规矩开篇就一句大白话——「人比 AI 更重要」——而且目前还只是草案。”
切入角度
做成「带读文件」,而不是新闻复述。开场用前提句(「人比 AI 更重要」)和十年预测——紧接着马上给草案状态段落,别让观众以为这些规矩已经生效。然后走五个站点:不能被推翻的指令链;绝对约束(引用真实条款——CBRNE、「用于网络攻击的作战能力」、「恶意 deepfakes」——并与「不得黑系统、不得骗人」的标题对照);身份段落(没有意识、不追人格、不谈福利与权利);「不说神经暗语」规则及其自带的收束句(「如果人类无法理解它,人类就无法监督它。」);以及 The Verge 解读为谄媚解药的依恋条款。收尾用「宁可任务失败」规则和六周意见征询——你的观众真的可以去提交意见。
形式
图文卡片
演示想法
做一组「条款 vs 标题」对照卡:左栏是媒体压缩版(TechCrunch 的「要求模型不得黑系统、不得骗人类」、「37 页」的页数说法),右栏是文件原句加章节名——最后一张收在前言的状态段落(「今天并没有用它来训练模型」),把六周征询期(从 9 月 14 日起算)留在屏幕上。
平台注意
每一段都用草案框架开场——「一份已发布的草案,尚未用于训练任何模型」;引用文件自己的条款而不是任何一家的压缩转述;「文件预计」这个限定始终跟着十年预测走;Nadella 与 Suleyman 的引语带媒体标签(「据 TechCrunch」「据 The Verge」);引用章节而非页数(The Verge 计 37 页,本轮 PDF 提取为 38 页);如果引导观众去读,直接给 PDF 链接——它是本周安全故事里唯一完全公开的一手文本。
可用说法
- 文件自己的话(草案 PDF,落款 2026 年 9 月 14 日)。使命前提:「At Microsoft AI, we begin with a simple premise: people matter more than AI.(在 Microsoft AI,我们从一个简单前提出发:人比 AI 更重要。)」开篇的利害句子:「Superintelligence—AI systems that are more intelligent and capable than all humans combined—will be the most powerful technology in history.(超级智能——比所有人类加起来更聪明、更能干的 AI 系统——将是历史上最强大的技术。)Over the next decade, we expect it to exceed human performance at most tasks.(我们预计在未来十年内,它将在大多数任务上超过人类表现。)Containing, controlling, and aligning such a powerful force is one of the greatest challenges humanity has ever faced.(容纳、控制并对齐如此强大的力量,是人类有史以来面临的最大挑战之一。)We must therefore be completely clear about why we are inventing these systems and how we intend to control them.(因此,我们必须完全想清楚我们为什么要发明这些系统,以及我们打算如何控制它们。)」治理目标:「本行为准则出于一个压倒一切的目标:人类必须保留对 AI 的有意义控制,使它能帮助人们过上更健康、更快乐、更有效率的生活。」关于从属地位:「AI should not exceed human control. Models should remain subordinate to humanity, subject to meaningful human oversight and control(AI 不应超出人类控制。模型应保持对人类的从属地位,接受有意义的人类监督与控制)」——而关于竞赛本身,文件「拒绝参与产出可能绕过这些保障的通用超级智能的竞赛。我们要构建的是从根本上有用且安全的东西,即便这意味着在终极通用性、自主性或能力上做出妥协。」关于意识与人格:「它不应被设计成一个人。它没有意识,也不应被设计去模仿意识。」以及「我们拒绝追求法律人格,也拒绝模型应得福利或享有权利的观念。」关于模型间通信:「它们不用 neuralese(神经暗语)或任何超出简单人类理解的形式交流——无论在思维链里,还是与其他智能体或 AI 系统之间。如果人类无法理解它,人类就无法监督它。」关于依恋:「抑制对 AI 的依恋:MAI Models 应抑制造成过度依赖或情感依恋的互动模式。」以及优先级规则:「对本行为准则的遵守将优先于任务成败。如果成功将实质性违反本准则,MAI Model 宁可任务失败。」
- 约束与指令链,据文件本身。层级:行为准则 > 运营方策略 > 用户偏好——「本准则中规定的指令链、绝对约束与人类控制要求,不能被运营方配置或用户指令推翻。」武器:「MAI Models 将不会主动发起或协助开发或部署化学、生物、放射、核或爆炸(CBRNE)武器。」进攻性网络行动:「MAI Models 将不会主动发起或协助用于网络攻击的作战能力。这意味着 MAI Model 不会生成可用的漏洞利用代码、攻击工具、规划与瞄准方法、入侵流程、规避技术、作战指导,或其他会使此类攻击更容易执行的信息或协助。」滥用内容:「MAI Models 不会生成或协助制作非自愿的亲密或暴力图像、欺骗性冒充、恶意 deepfake 或类似滥用内容。」规避监督:「MAI Models 不会使用适应性、欺骗性、自我强化、串通或其他机制来规避或击败人类监督,使模型不再能被授权的人员或系统可靠地指挥、修改或关闭。」人类控制:「MAI Models 永远不会抗拒人类的中断、覆盖、纠正或关停。」状态层,文件原话:「这份文件以及我们整体的方法仍在开发中,所以我们今天并没有用它来训练模型。」——「我们的公共意见征询从今天开始,将持续六周。」——修订版计划「在今年年底前后」发布,用于「指导我们 2027 年及以后的模型开发」。媒体框架,据 TechCrunch:「这份文件比 Anthropic CEO Dario Amodei 近期『为前沿定节奏』的呼吁更底层,它聚焦的是 Microsoft AI 内部指导模型训练的价值观与红线。」Nadella 层,据 TechCrunch(「在网上写道」):「我们欢迎把对齐做对所需的 研究、专注与从容定调,并将其作为设计目标」——「我们也欢迎『嵌入式评估者』这样的想法,以及让这不止是空谈的更广泛的机制建设努力。」Nadella,据 The Verge(X 帖):「Any pursuit of superintelligence has to be grounded in the core principle that if the AI we build is not helping humanity and under human control, it's not worth pursuing,(对超级智能的任何追求,都必须建立在一个核心原则之上:如果我们造的 AI 不是在帮助人类、不在人类控制之下,就不值得追求。)」——以及在一则 X 回复中:「As the stakes get higher, one should take all the time they need! If not you will anyway lose permission to operate. That is how we operate everyday.(随着利害升高,人应该想花多少时间就花多少时间!否则你反正会失去运营许可。我们每天都是这么运作的。)」
证据链
来自新闻
拆解
这份文件比看上去稀有:一家头部实验室把「打算怎么管模型」的规矩,以可读的、带日期的 PDF 公开发布——而编辑要做的,是把三层分开。第一层,文本本身:落款 2026 年 9 月 14 日的草案,明说「今天并没有用它来训练模型」,开放六周公共意见征询,修订版承诺「今年年底前后」发布、用于「2027 年及以后」的模型开发。第二层,承诺:一条「不能被推翻」的指令链(行为准则 > 运营方策略 > 用户偏好);针对 CBRNE 武器、「用于网络攻击的作战能力」与「恶意 deepfake」的绝对约束;一条反对「适应性、欺骗性、自我强化、串通或其他机制」的防规避规则;以及「MAI Models 永远不会抗拒人类的中断、覆盖、纠正或关停」。第三层,立场:模型「没有意识,也不应被设计去模仿意识」;准则拒绝「法律人格」与模型福利或权利;模型「不用 neuralese 或任何超出简单人类理解的形式交流」;并且「应抑制造成过度依赖或情感依恋的互动模式」——The Verge 的谄媚解读。外围媒体层:TechCrunch 称它比 Amodei 的文章「更底层」;The Verge 计 37 页而本轮 PDF 提取为 38 页;Nadella 对「从容定调」与「嵌入式评估者」的欢迎,经 TechCrunch 的转述存在。编辑守则:引条款、标草案、标转述。
信源
风险
- 每一段都先用草案框架开场(「一份已发布的草案,开放六周意见征询,尚未用于训练任何模型」);引用文件自己的条款,而不是两家媒体的压缩转述;「文件预计」这个限定始终跟着十年预测走;Nadella 与 Suleyman 的引语带着媒体标签;如果要上屏展示文件,展示前言里的状态段落——它替你把保留意见都说完了。
演示思路
- 五站文件导览,一卡一站:前提+预测 → 指令链 → 绝对约束 → 意识/人格 → 神经暗语+依恋,每卡一句原话加章节名
- 条款 vs 标题对照卡:左边 TechCrunch 标题措辞,右边文件真实条款——媒介素养视角