← 返回

p(doom) 证据 — 节点 11:公司治理空心化

2026年7月5日

证据索引 · English · 主文

每条格式:主张 · 理由 · 证据 · 类比 · 什么情况下会改 · 置信度(高/中/低)。


父文档: 节点 11 公司治理
目的: 主张 | 理由 | 证据 | 类比 | 什么情况下会改 | 置信度 — 针对每个 Node 11 概率。


1. 节点定义 — 治理结构对暂停承重

主张: 前沿实验室 企业治理(董事会独立性、PBC/LTBT 实效、安全汇报线)是与吹哨人 事件(Node 4)分离的 关键假设:它设定 P(暂停 | 内部危机) ≈ 0.12,非 ~0.40 天真先验。

理由: Node 4 建模人类对泄露的 响应;Node 11 建模泄露面对的 制度默认。董事会危机 2023 + Leike 2024 + Sharma 2026 = 反复 观察 训练停,尽管有 内部 杠杆。

证据:

  • (内部笔记) §29–31 — 董事会危机、Leike、Saunders
  • (内部笔记) §2 — 空心化分支 0.65
  • (内部笔记) §2.3,§5 — 危机时间线

类比: 2008 金融危机 — 董事会风险委员会纸面存在;模型崩溃时 交易暂停。

什么情况下会改: ≥2 家实验室在 纯治理 危机(无自主伤害)后暂停 >90d。

置信度: H


2. 分支 M1 — 模态空心化 P = 0.65

主张: P(2026–28 持续安全团队空心化 + 叙事无否决权) = 0.65

理由: 2024–26 默认轨:superalignment 解散,安全并入产品部门,条件暂停 rhetoric 无暂停,Sharma 退出非组织。2025-10 OpenAI recap 与 2026-04 LTBT 多数席位是 纸面升级 atop 实践平坦

证据:

  • (内部笔记) §23 OpenAI — 「行动与声明承诺矛盾」
  • (内部笔记) §23 — P(公开暂停 >30d) = 0.08 模态
  • OpenAI 董事会危机后:训练继续(node4 §29)

类比: 制药 — 药物警戒团队存在;重磅上市 压力压倒罕见撤药。

什么情况下会改: 有记录 ≥2 家实验室恢复 独立 安全组织仅向 CEO 汇报且 部署否决 使用一次。

置信度: M


3. 分支 T1 — 董事会危机重演无暂停 P = 0.25

主张: P(2028 前急性 OpenAI-2023 级治理斗争 训练停) = 0.25

理由: 最强单一类比:董事会 解雇权,5 天媒体风暴,安全对齐董事 — 训练 从未暂停。给定 capex/Stargate 压力,OpenAI 或同行第二次危机 2 年窗口约 1/4

证据:

  • (内部笔记) §2.3 — Altman 2023-11-17 被解雇,2023-11-21 复职,Toner 出局
  • (内部笔记) §29 — 「有杠杆的内部人仍败」
  • NBC News — OpenAI restructuring Oct 2025 — 商业/IPO 压力 持续

类比: WeWork 2019 — 董事会挑战 → CEO 回归 → 治理 还原

什么情况下会改: OpenAI Foundation 移除 Altman 新 CEO 宣布 30d 训练暂停。

置信度: M


4. 分支 T2 — 安全再赋权 P = 0.10

主张: P(2028 前安全团队 再赋权 — 硬 RSP/FSF 停触发 + 可见暂停或部署阻断) = 0.10

理由: 反尾部留给 已观察 invocation,非 rhetoric。Anthropic RSP v3.0、OpenAI SSC、DeepMind FSF v3.1 创造 机制;2024–26 公开 invocation。LTBT 多数(2026-04)理论上 可阻断 — 同季 Sharma 退出 削弱 内部信心。

证据:

  • Anthropic RSP v3.0(2026-02)— 自执行,无外部问责(research_ai_governance_landscape.md
  • Anthropic LTBT announcement
  • Node 4 §23 — P(RSP 硬停) = 0.12 模态,0.25 tail-gov

类比: 核 SCRAM — 设计可用;生产危机中 极少 测试。

什么情况下会改: 公开 RSP ASL-4+ 触发 → 有记录 训练放缓 + 风险报告。

置信度: L–M


5. P(暂停 >30d | 内部治理危机) = 0.12

主张: P(任一前沿实验室 公开训练暂停 >30 天 | 无自主伤害的内部治理危机) = 0.12(范围 0.08–0.18)。

理由: 节点 11 公司治理 条件链乘积 — 董事会偏安全 ~15% × 评估触发 ~35% × 低竞赛压力反事实 ~20%。四次 历史危机 → 暂停。

证据:

  • Node 4 §29–31 — 董事会、Leike、Saunders
  • (内部笔记) §5.2 — Sharma 2026 无暂停
  • Crosscut §2 — 导出 P(暂停|危机) 0.10–0.15

类比: node4 丑闻 | 实验室暂停复合先验。

什么情况下会改: Leike 级辞职 立即 后跟具名运行暂停(从未观察)。

置信度: M


6. P(≥2 家实验室暂停 >30d | 治理危机) = 0.03

主张: P(治理危机下 多实验室 协调暂停 >30d) = 0.03

理由: Node 4 §23 — P(≥2 家暂停) = 0.18 × 0.15 tail-gov ≈ 0.03 于吹哨人框架;纯治理危机 弱于 C10 评估触发 — 同数量级,非更高。

证据:

  • (内部笔记) §23,§308–309
  • Anthropic RSI — 多边验证 前提Anthropic_When_AI_Builds_Itself_2026.md §1)
  • Seoul 2024 Frontier Commitments — 自愿,无暂停

类比: COVID 疫苗暂停(AZ 血栓)— 单一 产品 hold,非行业暂停。

什么情况下会改: Seoul 式峰会产生 约束 同步暂停条款及验证。

置信度: M


7. OpenAI 董事会危机 2023 — 训练继续(锚点)

主张: OpenAI 2023-11 危机是 P(暂停 | 丑闻) 最强下界:董事会权力 + 内部联盟 → 商业默认

理由: 即便 结构性 治理失败(CEO 被解雇)也未暂停 GPT-4 时代训练。为所有后续实验室危机设定先验。

证据:

  • (内部笔记) §2.3–2.4 — 「安全派输了董事会战争」
  • (内部笔记) §29
  • (内部笔记) — 董事会危机 → 商业默认

类比: 强于 FLI 2023(无内部杠杆)用于模态校准。

什么情况下会改: FOIA/SEC 文件显示 11-17–21 窗口 未披露 训练暂停(无公开证据)。

置信度: H


8. Leike / superalignment 解散 — 零运营杠杆

主张: Jan Leike 2024-05 辞职 + superalignment 团队解散移动 叙事 对 OpenAI 训练的运营杠杆。

理由: 病毒推文(「安全文化输给闪亮产品」);20% 算力承诺 放弃;团队吸收。 Saunders 廉价信号(无备忘录 dump)— Node 4 分类介于 E4 与 E1。

证据:

  • (内部笔记) §3.2 — Leike 2024-05-17,superalignment 解散
  • (内部笔记) §23 OpenAI — 算力承诺否认
  • Node 4 §31 — 「内部人道德权威 ≠ 运营杠杆」
  • TechCrunch — superalignment withered

类比: 高管原则性辞职 — 股价小波动, 战略变更。

什么情况下会改: OpenAI 重建 独立 superalignment 级团队并 公布 算力预算。

置信度: H


9. Sharma 退出 2026 — 退出非组织;管道变薄

主张: Mrinank Sharma 2026-02 退出(Sleeper Agents 合著 → 离行业写诗)提高 P(吹哨人管道变薄) 降低 P(代价高昂内部泄露)。

理由: 打破「迁往 Anthropic」模式(Leike、Schulman)。信号 结构性 绝望非公司特有。Safeguards Research 负责人空缺 公开继任叙事。

证据:

  • (内部笔记) §5.1–5.2 — Sharma 2026-02-09
  • (内部笔记) — Sleeper Agents,Constitutional Classifiers 谱系
  • Node 4 §24 — 「Sharma 2026:退出非组织 — 内部倡导派叛逃」
  • Node 4 §10 — E4 ↑ 作受控披露替代

类比: 气候科学家离开学界务农 — 领域失倡导者,非仅雇主失员工。

什么情况下会改: Sharma 或同行发表 有记录 泄露且有政策效应(Kokotajlo 级)。

置信度: M


10. Anthropic RSI 文章 — E4 受控披露;继续训练

主张: Anthropic Institute When AI Builds Itself(2026-06-04)是 主要 E4 路径:内部 RSI 数据 + 条件 expect 暂停 — 同月 Trump EO + GAAIA 加速 框架胜出。

理由: 措辞 we expect that we wouldcommit;验证机制 不存在;发表 抢占 吹哨人压力同时训练隐含继续。Node 4 P(E4)=0.37 锚点。

证据:

  • (内部笔记) — §1 条件,§5.2 张力(8× 代码速度 + expect 暂停)
  • (内部笔记) §5.1 — 2026-06-04 条目
  • Node 4 §32 — 「实验室以受控披露抢占吹哨人」

类比: 烟草业「我们支持监管」同时反对约束规则。

什么情况下会改: Anthropic 实际暂停 具名训练运行并援引 RSP + RSI 文章触发器。

置信度: H


11. P(RSP 硬停 2028 前 invocation) = 0.12

主张: P(Anthropic 公开 invocation RSP ASL 硬停并有记录保障升级至 2028) = 0.12

理由: RSP v3.0 最详框架;v3.0 诚实 区分承诺与建议 — 削弱 约束质量。Apollo 阴谋、Greenblatt 失对齐报告下 2024–26 仍零 invocation。12% = tail-gov 邻近,非模态。

证据:

  • (内部笔记) §23 Anthropic RSP v3.0
  • Node 4 §23 — P(RSP 硬停) = 0.12 模态
  • Anthropic RSP v3.0

类比: 联储「破玻璃」紧急放贷 — 存在,危机前 极少 使用。

什么情况下会改: 失对齐风险报告触发 ASL-4+ 且 公开 部署延迟 >30d。

置信度: M


12. OpenAI 2025-10 重组 — 纸面治理 ↑

主张: OpenAI Foundation + OpenAI Group PBC recap(2025-10-28)提高名义 安全治理(SSC、仅使命 fiduciaries 管安全)但 尚未 降低 P(无暂停) — track record 折扣适用。

理由: 结构在 superalignment 掏空 之后、SSC 否决使用证明 之前。CA AG MOU 条件不反对 recap。Kolter SSC 主席 独占 Foundation 董事会 — 纸面 分离

证据:

类比: 2008 后银行 living wills — 合规文件直至测试。

什么情况下会改: SSC 12 月内 公开阻断具名模型发布并 CA AG 通知。

置信度: M


13. P(OpenAI SSC 2028 前阻断前沿发布) = 0.15

主张: P(OpenAI Safety and Security Committee 阻断或延迟 前沿模型发布超过内部计划至 2028) = 0.15

理由: CA MOU 授予 SSC 超风险阈值发布角色;高于 P(全训练暂停) 因 部署 否决窄于 算力 停。2025–26 recap 后仍 观察阻断。

证据:

  • CA AG MOU § — SSC 提前通知、重大风险
  • OpenAI structure 页 — SSC「继续当前角色」管安全实践
  • Node 11 实验室追踪 — OpenAI P(暂停|危机) = 0.08 vs P(SSC 阻断) = 0.15

类比: FDA 完整回复函 — 延迟上市,非关厂。

什么情况下会改: GPT-5.x 或后继发布 公开延迟 并援引 SSC。

置信度: L–M


14. Anthropic LTBT 董事会多数 — 2026-04

主张: LTBT 任命董事达 董事会多数(Narasimhan,2026-04-14)纸面 真实 治理权力但 P(invoked 延迟发布)0.12 given Sharma 退出 + RSI 隐含继续。

理由: Trust 持 Class T 股;受托人 无股权 — 使命对齐 by design。多数 首次 — 但同期内部人外流与 expectcommit 暂停 rhetoric。

证据:

类比: 双重股权创始人控制 — 潜在 否决,观察 产品速度。

什么情况下会改: LTBT 董事会 公开阻断 DoD 合同或前沿部署并援引公共利益。

置信度: M


15. P(Anthropic 条件暂停 → 实际多实验室暂停) = 0.08

主张: P(Anthropic RSI 式条件暂停 转化为 ≥2 家可验证暂停至 2028) = 0.08

理由: 需 (a) 验证基础设施 建成,(b) 其他前沿实验室 同步,(c) Anthropic 行动预期。Node 3 P(验证训练上限条约) ≈ 0.04–0.06 — 多边暂停 上界

证据:

  • Anthropic_When_AI_Builds_Itself_2026.md §1.1 — 四条件
  • Node 9 — P(持久多边暂停) < 0.05
  • Node 4 §219 — 「无收入峰值自愿暂停先例」

类比: 巴黎气候 — 条件承诺无执法。

什么情况下会改: Anthropic Institute 发表 可用 验证协议并被 OpenAI + DeepMind 采用。

置信度: M


16. P(吹哨人管道 2026–28 变薄) = 0.60

主张: P(2026–28 内部倡导从 组织/泄露 转向 退出/沉默) = 0.60

理由: Sharma 模式 + Kokotajlo 代价信号 罕见 + Right to Warn 透明度非暂停 + NDA 执行。E4 受控披露 替代 泄露。

证据:

  • Node 4 §105 — 「Sharma 后安全员工管道结构性无家可归」
  • Node 4 §162 — 内部人疲惫 ↑
  • (内部笔记) §6.4 — 退出派 vs 中悲观派表

类比: 后 Snowden 科技 — 新吹哨人少,内部合规表演 多。

什么情况下会改: 12 月内 ≥3 名具名前沿研究员 宣誓作证 并文件 dump。

置信度: M


17. P(安全组织向产品/收入汇报,≥2 家实验室 2028 前) = 0.45

主张: P(2028 前至少 两家 前沿实验室安全/研究诚信组织 正式向 CPO、产品或收入负责人汇报) = 0.45

理由: OpenAI post-superalignment 吸收有记录;Google 2024-04 Responsible AI 并入 DeepMind 建模(Building for our AI future)。行业趋势 = 贴近模型 framing 为安全;独立性 ↓。

证据:

  • (内部笔记) §23 OpenAI — 「吸收进其他部门」
  • Google blog Apr 2024 — Responsible AI → DeepMind
  • Crosscut §2 would-update — 「安全重组向产品/收入汇报」↑ 空心化

类比: 安全嵌入 DevOps(DevSecOps)— 出货更快,否决 更弱。

什么情况下会改: OpenAI 或 Anthropic 公开恢复 Alignment/Safeguards 仅向 CEO 汇报线并董事会席位。

置信度: M


18. Google DeepMind — AI Safety 组织 + FSF v3.1

主张: DeepMind 框架复杂度 ↑(FSF v3.1 2026-04,AI Safety & Alignment 组织 2024-02)但 P(FSF 触发 部署暂停) ≈ 0.10 — 自执行,Alphabet 产品压力。

理由: FSF 增加 TCL、SL2+,失对齐域并入 ML R&D;治理节描述升级至「适当公司治理机构」— 公开暂停先例。Gemini 发布节奏 继续

证据:

类比: OpenAI Preparedness — 精致纸面,未测 刹车。

什么情况下会改: Gemini 前沿发布 延迟 并援引 FSF CCL 阈值。

置信度: M


19. Meta / xAI — 最弱治理;竞赛压力 ↑

主张: P(Meta 或 xAI 自愿暂停 | 内部危机) < 0.03;P(xAI 2028 前 使命漂移 于国防/商业压力) = 0.75

理由: Meta — 开放权重哲学,无 RSP 级硬停。xAI — 2026-02 Pentagon 机密 Grok 交易「all lawful purposes」vs Anthropic 保障拒绝叙事;无正式对齐框架。

证据:

  • (内部笔记) — xAI Pentagon 2026-02
  • (内部笔记) §23 Meta — 最弱正式框架 4/10
  • Crosscut §2 — 「xAI all lawful purposes Pentagon 交易 vs Anthropic 保障」

类比: 开源 vs 安全 — 权重放出后 召回不可能

什么情况下会改: xAI 发表 RSP 等价物并 外部 审计。

置信度: M


20. P(E4 受控披露抢占暂停压力) = 0.40

主张: P(内部对齐担忧上升时,实验室 发表 受控长文(RSI 文章类)而非 泄露 且继续训练) = 0.40

理由: Anthropic Institute 模型 — 吹哨人前自有叙事。降低代价泄露激励;制度化 透明无刹车(Cluster D)。

证据:

  • Node 4 §32,P(E4)=0.37
  • Anthropic_When_AI_Builds_Itself_2026.md §5.2 — 公司框架 + 条件暂停
  • Node 4 §417 — 「我们认真对待 + 继续」

类比: 危机 PR 预辟谣

什么情况下会改: 受控披露 立即后跟 暂停(从未观察)。

置信度: M


21. 收入 / capex 峰值阻止自愿暂停 P = 0.70

主张: P(前沿实验室在 Stargate 级 capex / 收入峰值 自愿暂停,给定治理危机) = 0.70

理由: Node 1 劳动力/capex 模态 + Node 4「无收入峰值自愿暂停先例」。OpenAI/Microsoft/Google 2025–26 $100B+ AI 基建承诺 — 暂停机会成本

证据:

  • Node 4 §161 — 「收入峰值 + capex 周期 — 无自愿暂停先例」
  • Node 1 — 智能体劳动力冲击模态强化商业默认
  • OpenAI recap 2025-10 — 投资者回报 + IPO 路径(NBC

类比: 油价高峰时石油巨头 — 延迟 气候 capex,非停抽。

什么情况下会改: 主要实验室 公开削减 训练预算 >20% 并援引安全(非市场)。

置信度: M


22. PBC 使命条款 invoked 延迟发布 P = 0.10

主张: P(2026–28 任一前沿 PBC 公开援引 使命/公益条款 延迟 前沿发布) = 0.10

理由: 法律空间存在(OpenAI PBC articles,Anthropic charter);观察 invocation 。条款作 诉讼盾营销,非运营刹车。

证据:

  • OpenAI PBC incorporation — 仅安全 fiduciaries 语言
  • Anthropic PBC 公益目的(research_ai_governance_landscape.md
  • Crosscut §2 — 「PBC 在收入/capex 压力下侵蚀」

类比: B-Corp 认证 — 极少 阻挡盈利产品。

什么情况下会改: SEC 或 CA 文件援引 PBC 义务为 延迟 上市理由。

置信度: L–M


23. P(2028 前第二次 OpenAI 治理危机) = 0.18

主张: P(OpenAI 2028 前经历 第二次 C-suite/董事会治理危机并有全球媒体报道) = 0.18

理由: 首次危机 2023;recap 集中 Foundation 权力但 同一 CEO;投资者/IPO 压力 + 安全张力 复发。非等同 P(暂停) — 危机可触发 暂停(T1 分支)。

证据:

  • 2023 危机基础率 — 前沿规模 ~4 年公司史 1 次
  • 2025-10 结构 — Altman 双董事会 CEO
  • AI_safety_大事记 — 「安全 vs 商业」 recurring 叙事

类比: Uber 2017 — 反复治理丑闻, 商业模式暂停。

什么情况下会改: 24 月 OpenAI 治理头条(下调)。

置信度: L


24. Superalignment 弧线在另一实验室重演 P = 0.35

主张: P(2026–28 另一前沿实验室 宣布 专用超级智能/安全团队及算力承诺,然后 24 月内解散或空心化) = 0.35

理由: DeepMind AI Safety & Alignment(2024)平行 superalignment 叙事;行业模式 = 宣布 → 吸收。OpenAI 模板 复制后抛弃。

证据:

  • TechCrunch 2024 — DeepMind 组织「Similar in mission to Superalignment」
  • OpenAI superalignment 弧线(AI_safety_大事记 §3.2)
  • research_ai_governance_landscape.md — 矛盾模式

类比: 企业 创新实验室 生命周期 — 启动、炒作、并入核心产品。

什么情况下会改: DeepMind 维持 独立 AGI 安全团队并 公布 预算至 2028。

置信度: L–M


25. Node 11 → P(无有效暂停) +3–5pp

主张: 整合 Node 11 分支混合将 P(2028 前无联邦/行业训练暂停) 从 0.82–0.84 提至 0.85–0.89(+3–5pp)。

理由: 65% 模态空心化 + 25% 危机无暂停 二者 隐含继续;仅 10% 再赋权尾部减少。确认 Node 4 模态吹哨人分支 结构性支撑

证据:

  • (内部笔记) crux #5 — 0.82(0.72–0.92)
  • Node 9 对 P(无暂停) 净 +0.02–0.03 — Node 11 更强 通道(美国实验室)
  • Crosscut §2 p(doom) — 空心化 vs 再赋权对灭绝「+3–5pp vs −2–3pp」

类比: 贝叶斯 — 同证据,显式 制度先验。

什么情况下会改:已观察 RSP 硬停 invocation 重缝。

置信度: M


26. Node 11 → P(ASI 时无关停) +3–5pp

主张: Node 11 将 P(ASI 阈值时无有效关停) 从 ~0.60 提至 ~0.63–0.65(+3–5pp)。

理由: 无法在 C7–C9 暂停(治理证据)的实验室 unlikely 在 C10 执行关停 无外部强制(DPA 0.03,EU 部署 0.14 — 不足以训练停)。Node 4 乘数 3 链。

证据:

  • Node 4 §672 — RSP 硬停 0.12;若不可信,提高 P(无关停)
  • (内部笔记) — 失败模式 bang vs whimper;模态 = 监督非暂停
  • Node 4 §585 — P(ASI 时无有效关停) × 0.50–0.70 于灭绝链

类比: 福岛 — 机构 未能 SCRAM 当设计假设会。

什么情况下会改: ≥1 前沿实验室 实弹关停演练 并公开报告。

置信度: M


27. Cluster A 相关 — 空心化 ↔ 竞赛 ↔ 无暂停

主张: P(模态空心化) 与 P(无暂停)、P(窃取后竞赛 N3)、P(GAAIA 优先权 N6) 相关 — 联合尾部 ~3–5× 边际乘积,非独立。

理由: 同资本/capex/国安联盟阻挡暂停。Node 11 显式化 correlation matrix Cluster A 所列。

证据:

  • (内部笔记) Cluster A — 加速块
  • Crosscut §2 链接表 — N1、N3、N4、N6
  • Node 3 — 窃取后竞赛与空心化相关

类比: CDO 相关违约 — 联合 尾部风险。

什么情况下会改: 仅 EU 刹车 解耦 美国实验室节奏(Node 9 T1 尾部)。

置信度: M


28. p(doom) 净 — 灭绝桶 +1.5–3pp

主张: Node 11 对 Phase 2b 重缝贡献 ~+1pp(prior pass → ~17% doom region),主要经失对齐尾部分支(+0.5–1pp)与模态竞赛速度(+0.5pp)。

理由: 增加独立生物风险。失对齐分支权重 25% × 更高 P(无关停) × 持续训练 → 复合 非可加 — 用混合非 28 边际乘积。

证据:

  • (内部笔记) — 分支模型 58% 模态 / 25% 失对齐 / 17% 生物
  • Crosscut §2 — 「对 P #1 与 P #6 +3–5pp」
  • Node 11 父文档 — p(doom) 表

类比: Phase 4a 缝合方法 — 逐节点 delta。

什么情况下会改: 以 correlation_matrix Cluster A 折扣完整重缝。

置信度: L — 待 Phase 4b 校准


相关文件


更新日志

日期变更
2026-07-04初版 — 28 节证据 P