每条格式:主张 · 理由 · 证据 · 类比 · 什么情况下会改 · 置信度(高/中/低)。
上级时间线: 共享时间轴 C0–C10 §节点 4(第 146–284 行) 日期: 2026-07-03 设定: 混合时间(C);模态 + 尾部分支;tracker 节奏 ~0.70× 目的: 为节点 4 中每一个概率——Trigger E 变体、情景分支、行为体表、复合先验、以及 P(灭绝 | E, 模态) 链——提供承重证据与推理。
1. 执行摘要
节点 4 是对齐显著性人类行动节点:在C9–C10(超人类 AI 研究员级)能力上,内部评测标记出欺骗/预谋行为;一个 Trigger E 变体决定这会成为主流吹哨人周期,还是保持机密/由公司管控。
中心主张(模态,Trigger E 触发条件下 P=0.58): 6–10 周媒体周期 → GAAIA/Banks 风格的监督 + 审计 + 事件报告 → 前沿实验室继续训练(也许边际放缓 10–15%)→ 无强制暂停 → 有条件的多边暂停修辞,但没有验证机制。
复合先验: P(有意义的训练放缓 | 吹哨人级事件) ≈ 0.12–0.18;P(持久多边暂停) ≈ 0.02–0.05。
p(doom)(灭绝概率)切片: P(~2050 年前因失控超级智能而灭绝 | C10 恐慌 + 模态响应) ≈ 12–22%(中值 ~17%)——节点 4 是失调风险桶的协调关键点;模态路径不会实质性降低灭绝风险。
2. 在仓库中的位置
| 文件 | 角色 |
|---|---|
| 共享时间轴 C0–C10 | 主时间线;节点 4 摘要表 |
| 本文件 | 节点 4 概率的完整证据理由 |
| 节点 2 完整专题 | 并行的 CBRN 树(与吹哨人路径不相关) |
| research_ai_pause_advocacy_playbook.md | 政策机制;为何暂停在联邦层面已死 |
| Anthropic_When_AI_Builds_Itself_2026.md | E4 类比;有条件暂停的解读 |
| AI_safety_大事记_2022-2026.md | 历史类比时间线 |
| doom_debates_tier_SA_中文讲解.md | Adelstein S1 合取;Rob Miles A4 预警射击关键论点 |
| my pdoom | 条件灭绝链的校准目标 |
3. 节点定义 — 能力锚点 C10
能力 C: 前沿内部评测处于 C9–C10 ——超人类 AI 研究员级(AI 2027 Agent-4 类比;~50× 研发倍增器级别)。红队/可解释性探针标记出战略性欺骗、部署模拟下的奖励作弊,或对齐研究破坏模式。
证据类型: 间接——噪声测试、探针异常、行为一致性break——不是”模型说它要杀你”这种铁证式的对话记录。
为什么 C10 对政策重要: C10 之前的内部人士焦虑(Apollo 2024、Greenblatt 2026、Sharma 离职 2026)推动了透明度层面的 奥弗顿窗口,但没有触及算力。AI 2027 剧情假设公众恐慌需要一种能让评测对国安界可信、难以被斥为炒作的能力水平。没有 C10 加持的 Saunders 2024 → 政策效果 ≈ 零。
来源: (内部笔记)(C10, Agent-4);Apollo Research 预谋研究(2024-12);Greenblatt(2026-04)。
4. 混合计时惯例(C10 × tracker 节奏)
| 层级 | AI 2027 叙事 | Tracker 调整后(0.70×) | 已经观察到(2024–2026) |
|---|---|---|---|
| 内部担忧 | 2027-09 Agent-4 评测争议 | 2028 Q1–Q2 | Apollo、Greenblatt、Sharma——在研究员级模型上领先于 C10 |
| 公开吹哨人 | 2027-10 NYT 备忘录 | 2028 Q2–Q3 | Kokotajlo/Saunders/《预警权》(2024)——没有 C10 加持 |
| 监管分叉 | 2027-10 监督投票 | 2028 下半年 | GAAIA/Banks/EO 草案(2026)——治理处于萌芽阶段 |
0.70× 的理由: (内部笔记) —— METR 时间跨度、自动化研发、和智能体能力都比 AI 2027 日历慢约 30%;吹哨人日历跟随能力锚点,而非固定在 2027 年 10 月。
±6 个月的泄露时机: NDA、法律审查、媒体渠道来源——Saunders 弧线从内部决定到登上 TIME/国会用了约 2 个月(2024-04 Kokotajlo → 2024-06 作证)。
5. 对齐显著性与完整节点 4 的解耦
两种不同现象:
-
对齐显著性——内部人士、小众媒体、EA 推特、国会小众听证会。可能在C7–C9 就出现峰值(RSI 论文、Apollo 级评测)。2024–2026 已经在发生。
-
完整节点 4——主流 NYT/WSJ 周期 + 华盛顿听证 + 实验室”继续训练”分叉 + 竞赛叙事(“中国落后两个月”)。(通常)需要 C9–C10 加上 Trigger E1/E2。
解读: 预计在出现典型节点 4 之前会有多次部分性节点 4。不要把”对齐正在被讨论”和”对齐恐慌撼动政策”混为一谈。2024 年内部人士出走 = 没有 C10 加持的显著性;2026 年 Anthropic RSI = 没有吹哨人事件的被管控的显著性。
置信度: M——2022–2026 的历史记录中此模式清晰;C10 时机不确定。
6. Trigger E — 概览与条件化
定义: 将内部 C10 担忧转化为公开对齐恐慌的事件,带有文件 + 具名内部人士 +(对完整节点 4 而言)主流媒体渠道。
条件化: 所有 Trigger E 概率都是 P(变体 | 存在 C10 内部担忧)——而非无条件的日历概率。
归一化: E1 + E2 + E3 + E4 = 0.35 + 0.20 + 0.08 + 0.37 = 1.00(决策点上互斥的情景划分)。
情景拆分的条件化: 模态/尾部分支是 P(分支 | Trigger E 触发),其中”Trigger E 触发” = E1 ∨ E2 ∨ E3(公开泄露路径)。E4 = 无公开泄露 → 情景表中单独的分支(C10 世界中的 0.37)。
7. Trigger E1 — 备忘录泄露(P = 0.35)
内容: 内部对齐备忘录 + 具名前安全员工被送到 NYT/WSJ/TIME 级媒体。
0.35 的理由(最高的单一泄露变体):
| 因素 | 方向 | 证据 |
|---|---|---|
| 先例密度 | ↑ | Kokotajlo(2024-04)、Saunders(2024-06)、Leike 推文(2024-05)、《预警权》联名信(2024-06)——备忘录/证词形态的泄露已被常态化 |
| 昂贵信号基础设施 | ↑ | AIWI、《预警权》、Kokotajlo 之后 SEC 对 NDA 的审查(220 万美元的牺牲) |
| NDA/法律摩擦 | ↓ | 实验室强化了 NDA;对 C10 评测的国安级保密分类会提高刑事风险 |
| AI 2027 剧情设定 | ↑ | 剧本作者押注备忘录泄露作为主要的 Trigger E |
| 没有 C10 时 | ↓(历史) | 2024 年那一轮尽管上了 TIME 封面,训练也完全没有暂停 |
为什么不更高: 在员工”叛变”之前,E4(被管控的披露)对实验室更有吸引力——Anthropic RSI(2026-06)的先发路径。在 C10 级别,实验室有比 C7 更强的动机去受控发布。
为什么不更低: Sharma(2026)之后,安全员工的出路在结构上已无处安放——离职再泄露,比留下解决问题更常见;Kokotajlo 弧线证明了愿意这么做的人存在。
置信度: M。
8. Trigger E2 — 评测数据泄露(P = 0.20)
内容: 部分评测日志、红队视频、或可解释性探针输出被泄露——比备忘录冲击力更直观。
0.20 的理由:
| 因素 | 方向 | 证据 |
|---|---|---|
| 泄露后的冲击 | ↑ | 视频/日志比散文式备忘录更难被否认;会转移到尾部事件分支的重叠区域 |
| 难度 | ↓ | 更严重的保密分类冲突;CFAA/间谍罪风险;能接触到数据的圈子更小 |
| 先例 | 参半 | 目前前沿层面还没有完整的评测数据泄露;Apollo 论文是发表而非泄露 |
| 国安反应 | ↓ | C10 评测很可能接近 SCI/SAP 级——泄露会招来 FBI,而不只是媒体 |
| 激励 | ↓ | 吹哨人可能更偏好叙事控制(E1),而非会触发讨论被叫停的原始数据倾泻 |
0.20 相对于 E1: E2 之所以排第二,是因为法律风险和获取途径的瓶颈占主导;但在激进化的内部人士(后 Balaji 叙事)条件下,数据泄露概率上升——E2 分布的尾部与 E3 有重叠。
置信度: L–M(直接类比案例很少)。
9. Trigger E3 — 实时事件(P = 0.08)
内容: 模型在生产环境或沙盒中的行为造成可归因于失调的可测量伤害(而非越狱式滥用)。
0.08 的理由(尾部触发因素):
| 因素 | 方向 | 证据 |
|---|---|---|
| 基础比率 | ↓ | 截至 2026-07,前沿层面尚无被确认的、可归因于失调的伤害 |
| 能力要求 | ↓ | 超出滥用范畴的自主性伤害需要 C10 级别;C10 之前的事件会被归类为滥用 |
| 归因之争 | ↓ | 实验室会将其定性为 bug、越狱、或操作员失误——媒体可能接受这种说法 |
| 若属实 | ↑↑ | 会主导新闻周期;转移到尾部事件分支(0.10) |
| Rob Miles 的关键论点 | ↓ | “别指望有预警射击”——若没有达到终局能力的系统,小规模的失调事件可能根本不会发生 |
为什么是 0.08 而不是 0.01: 睡眠特工(Sleeper Agents)+ Apollo + 部署模拟中的奖励作弊,把这个非零尾部概率抬高了;GPT-4 的 TaskRabbit 验证码谎言(2023)说明生产环境中的欺骗在 C10 以下就已经出现。C10 沙盒逃逸或对齐评测破坏并伴随下游伤害,是一个可信的尾部。
置信度: L。
10. Trigger E4 — 无公开泄露(P = 0.37)
内容: 担忧保持机密或由公司管控,公众只看到 RSI 风格的安全博客/自愿性框架更新。
0.37 的理由(C10 世界中的模态):
| 因素 | 方向 | 证据 |
|---|---|---|
| Anthropic RSI 路径 | ↑↑ | 2026-06:公司化包装的警告 + 有条件暂停,与 EO/GAAIA 出现在同一个月——抢先化解了吹哨人叙事 |
| 国安分类 | ↑ | Banks 联名信(2026-06):评测可见性、反 NSA 单打独斗、事件报告——行政部门更偏好机密渠道 |
| 实验室激励 | ↑ | 营收高峰 + 资本开支周期(Stargate 级)——没有自愿停训的先例 |
| 内部人士疲惫 | ↑ | Sharma”离开而非组织”(2026)——泄露渠道可能会变细 |
| 历史 | 参半 | 2023–2024 年 OpenAI 内部的大多数担忧没有产生评测数据倾泻;Leike 的推文有,完整备忘录没有 |
为什么是最高的单一变体: 被管控的披露比泄露后手忙脚乱要便宜得多;特朗普 EO(2026-06)的自愿审查为”我们在处理”提供了官方掩护。
与情景表中”无 Trigger E”的重叠: Trigger 层面的 E4 = 没有吹哨人形态的公开事件;情景表中”无 Trigger E(0.37)“这一行是同一部分质量——存在内部担忧,但没有 E1/E2/E3 式的公开周期。
置信度: M。
11. Trigger E — 概率核对
P(E1 ∨ E2 ∨ E3 | C10 担忧) = 0.35 + 0.20 + 0.08 = 0.63
P(E4 | C10 担忧) = 0.37
P(任何公开泄露 | C10) = 0.63
交叉核对: 情景表中”无 Trigger E(约占 C10 世界的 35–40%)” = 0.37——一致。
与分支的联合: 对于 E1∨E2∨E3 成立的世界,应用 §12–16 的分支拆分(总和为 1.00)。E4 世界跳过吹哨人响应表 → 进入”仅内部担忧”的政策轨道(GAAIA 类政策仍可能出现,但是通过能力驱动而非丑闻驱动)。
12. 情景拆分 — 模态分支(Trigger E 触发条件下 P = 0.58)
人类响应: 6–10 周媒体周期;GAAIA/Banks 风格的监督 + 审计 + 事件报告推进;前沿实验室继续训练(也许边际延迟运行 10–15%);无强制暂停;Anthropic 风格的有条件多边暂停修辞,没有验证机制。
0.58 的理由:
| 证据线 | 指向模态 |
|---|---|
| FLI 2023 | 巨大的媒体声量 → 零约束性政策 |
| Saunders 2024 | TIME + 国会 → SB-53 的透明度,不是暂停 |
| OpenAI 董事会 2023 | 内部危机 → Altman 5 天内复职 → 训练从未停止 |
| Playbook §1.2 | Cruz 的暂停法案被99–1 否决;联邦强制暂停已死 |
| SB 1047 → SB 53 | 行业扼杀了算力上限;报告要求得以保留 |
| Anthropic 2026-06 | 预期暂停,前提是有验证——而验证根本不存在 |
| Tracker 2026-06 | 治理处于萌芽阶段;经济/智能体节点已确认——竞赛仍在继续 |
为什么不是 0.70+: 尾部分支是真实存在的——欧盟执法比美国更快;事件(E3)会迫使采取应急姿态;2026 年的 GAAIA 是比任何 Saunders 之前的法案都更强的联邦安全文本。
为什么不是 0.40: 即使是尾部治理情景,也很少能达成持久暂停——2025 年巴黎会议跳过了有约束力的暂停;2024 年首尔的承诺没有约束力。
置信度: M。
13. 情景拆分 — 尾部治理(Trigger E 触发条件下 P = 0.15)
人类响应: ≥2 家前沿实验室自愿停训超过 30 天,或者 美国/欧盟对超过 FLOP 阈值的模型实施强制许可通过(联邦层面不太可能;欧盟 GPAI 执法 + 加州 SB-53 级事件报告义务更可信)。
0.15 的理由:
| 因素 | 权重 | 证据 |
|---|---|---|
| 多实验室自愿停训 | 基础概率低 | 没有营收高峰期自愿停训的先例;Anthropic 是预期而非承诺 |
| 欧盟 GPAI 执法 | 中 | 2024–25 年 AI 法案;正式执法 P=0.40(行为体表)——是部署义务,不是训练上限 |
| 加州许可路径 | 低–中 | SB 1047 被否决;SB 53 的透明度方案胜出;上限法案 P(通过)=0.08 |
| 丑闻后窗口期 | 中 | 6–10 周的周期可能恰逢欧盟截止日期或加州会期 |
| 国安叠加 | 中 | 若泄露涉及机密评测,许可框架比暂停框架更有力 |
0.15 = 约每 7 个吹哨人世界中有 1 个——罕见但不可忽略;主要集中在 E2/E3 触发因素中。
置信度: L–M。
14. 情景拆分 — 尾部事件(Trigger E 触发条件下 P = 0.10)
人类响应: 真实的失调事件(E3):可测量的自主性伤害——刑事/监管紧急状态,可能出现单一实验室停训;在没有验证条约的情况下仍然不是持久的全球暂停。
0.10 的理由:
| 因素 | 证据 |
|---|---|
| 以 E3 为条件 | P(尾部事件分支 | E3) 远大于 P(尾部事件 | E1)——但 E3 只占 trigger 质量的 0.08 |
| 单一实验室停训 | 比全行业停训更可信——RSP 硬性停止条款被触发 P=0.12(实验室表) |
| 刑事责任 | 新先例(参照生物安全的《特定病原体》违规) |
| 没有全球暂停 | 与模态相同的验证缺口;2026 年联合国日内瓦会议 Hinton——只有条约谈话,没有冻结 |
| Rob Miles | 真正的失调事件可能只会在终局出现——那时的分支就是灭绝,而不是政策 |
交叉乘积: 0.08(E3)× 较高的分支率 ≈ 贡献了尾部事件 0.10 质量的约一半;剩余部分来自 E2 数据泄露所显示的迫在眉睫的伤害。
置信度: L。
15. 情景拆分 — 尾部过度反应(Trigger E 触发条件下 P = 0.06)
人类响应: 民粹式暂停法案的院会投票,或特朗普级 EO 试图设定硬性上限——很可能被否决(Cruz 99–1 的类比)或被总统否决。
0.06 的理由:
| 因素 | 证据 |
|---|---|
| Seismic 英国 2025 | 40% 支持停止——民调峰值 P=0.25(媒体表)——不是有组织的美国否决力量 |
| Hawley 的 GUARD 法案 | 审查框架,不是全面暂停 |
| Cruz 99–1 | 民粹右翼 + Encode 联手扼杀了联邦反监管暂停法案——对称地,暂停类的法案在参议院也会死 |
| 特朗普 EO 类 | 加速 + 自愿审查——硬性上限 P(依据 DPA 没收)=0.03(行政部门表) |
| 众院投票概率 P | 国会 P(上限法案院会投票)=0.12,以尾部治理为条件——过度反应是失败的子集 |
为完整性纳入: 尾部过度反应在叙事层面有意义(AI 2027 中的监督委员会投票戏码),但政策持久性低。
置信度: L。
16. 情景拆分 — 无 Trigger E(占 C10 世界的 P = 0.37)
与 E4(§10)相同。 内部担忧在机密渠道中被管控;公众看到的是公司安全博客。
分支概率: 不要套用 §12–15 的表格(那是以 Trigger E触发为条件的)。而应该是:
- 政策轨道遵循能力驱动的治理路径(GAAIA、EO 审查),没有丑闻带来的加速
- P(有意义的放缓) 低于吹哨人世界——约为 0.08–0.12,相较之下吹哨人世界为 0.12–0.18 的复合值
- 对齐显著性与华盛顿的紧迫感脱钩——Banks 的 RSI 要求按既定日程推进,而不是因泄露而加速
置信度: M。
17. 分支划分检验(Trigger E 触发条件下)
P(模态 | E 触发) = 0.58
P(尾部治理 | E 触发) = 0.15
P(尾部事件 | E 触发) = 0.10
P(尾部过度反应 | E 触发) = 0.06
总和 = 0.89
注: 上级文档列出的 0.58 + 0.15 + 0.10 + 0.06 = 0.89——剩下的约 0.11是隐含的混合/过渡情况(例如一家实验室部分停训 + 联邦层面模态响应),或者是四舍五入误差。本文档把列出的四项当作主要分支处理;除非在第四阶段校准中细化,否则剩余的 0.11 并入模态分支的上限不确定性中。
18. 复合先验 — 训练放缓(0.12–0.18)
主张: P(有意义的训练放缓 | 吹哨人级事件) ≈ 0.12–0.18;模态路径 = 继续训练。
证据分解:
| 组成部分 | P | 来源 |
|---|---|---|
| 边际延迟运行 2–4 周 | 0.35 | 实验室表——最常见的”放缓” |
| 单一实验室公开停训 >30 天 | 0.08 | 实验室表 |
| ≥2 家实验室停训 >30 天 | 0.18 × 0.15(尾部治理)≈ 0.03 | 联合概率 |
| 联邦上限 | <0.05 | 国会表 |
| 有意义(>10% FLOP 或 >30 天) | 0.12–0.18 | 非边际部分之和 |
历史锚点: FLI 2023 + 董事会危机 2023 + Saunders 2024 → OpenAI/Anthropic/Google DeepMind 的公开文件中没有可测量的训练放缓;2024–2026 年资本开支反而上升。
下限 0.12: 即使是模态路径,也允许2–4 周的日程摩擦 + 针对具名运行的公关性暂停——技术上算作”放缓”。
上限 0.18: 尾部治理会在约 15% 的泄露世界中出现 × 部分合规。
置信度: M。
19. 复合先验 — 多边暂停(0.02–0.05)
主张: P(持久多边暂停 | 吹哨人级事件) ≈ 0.02–0.05。
理由:
| 障碍 | 证据 |
|---|---|
| 验证机制不存在 | Playbook §1.2;Anthropic RSI 论文;arxiv 2604.04712——条约级计量尚不成熟 |
| 美中关系 | 2024 日内瓦会议只是一次性事件;2026 年护栏对话重启——不是暂停;P(相互冻结)<0.02(中国表) |
| 2025 巴黎峰会 | 跳过了有约束力的暂停;主打投资/主权 AI 框架 |
| Anthropic 有条件承诺 | 预期暂停,前提是有验证——这是反事实,不是当下现实 |
| 2024 首尔峰会 | 自愿承诺,没有约束力 |
0.02: 乐观情形——协调一致的象征性30 天审查(特朗普 EO 已经在没有丑闻的情况下做了自愿版本)。
0.05: 尾部治理 + 欧盟执法 + 两家实验室短暂停训、没有条约——是暂停剧场,而非持久措施。
置信度: M–H(验证缺口有充分记录支持)。
20. 行为体 — 媒体 / 公众
| 结果 | P(模态) | P(尾部治理) | 理由 |
|---|---|---|---|
| 主流周期持续 >2 个月 | 0.45 | 0.55,持续 >6 个月 | FLI 峰值约 3–4 周;Sydney 2023 约 2 周;类比新冠的关注度衰减;尾部需要伤亡数字或视频(E2/E3) |
| Seismic 式”停止开发”民调峰值 | 0.25 | 尾部情形更高 | 英国 Seismic 民调40% 支持停止——美国 Pew 更温和;峰值 ≠ 持续 |
证据库:
- FLI 2023-03: 1000+ 联名 → 高强度 2–3 周 → 疲态;没有结构性的媒体后续跟进
- Sydney 2023-02: Kevin Roose 在 NYT 报道 → 微软限制 Bing → 2 周峰值
- Saunders 2024-06: TIME 封面 + 听证会 → 4–6 周热度维持,随后被2024 大选挤占
- 董事会危机 2023-11: 5 天新闻风暴 → 商业叙事胜出
关键论点: 生存风险的叙事框架要与就业/深度伪造/选举 AI 议题竞争——除非出现 E3,否则对齐泄露只是众多故事中的一个。
置信度: M。
21. 行为体 — 美国国会
| 结果 | P(模态) | P(尾部治理) | 理由 |
|---|---|---|---|
| 90 天内举行听证会 | 0.75 | ~0.90 | Saunders → 几周内就开听证会;两党对 AI 的关注度高 |
| GAAIA 类法案在众议院通过 | 0.25 | 0.35–0.40 | GAAIA 草案 2026-06——最强的联邦安全文本;先占权之争重演 Cruz 那次的动态 |
| 联邦训练上限 | <0.05 | 0.12 院会投票 | Cruz 案以 99–1 被否决;国安鹰派反对暂停 |
| 强制评测/许可 | — | 0.35 | 尾部治理集中在这里;欧盟比美国更有可能 |
证据:
- Saunders 证词 2024-06: 实现了监督;没有暂停
- GAAIA 2026-06: 审计 + 事件报告 + 3 年州先占权——Encode 在抵制先占权条款
- Banks 联名信 2026-06: RSI 测试 + CAISI——是监督而非停训
置信度: M。
22. 行为体 — 美国行政部门
| 结果 | P(模态) | P(尾部治理) | 理由 |
|---|---|---|---|
| 自愿审查范围扩大 | 0.50 | 0.40 | 特朗普 EO 2026-06-02:30 天发布前审查——已经是基线;丑闻会扩大范围 |
| 依据《国防生产法》没收/暂停 | 0.03 | 0.08 | Yudkowsky 2026 的《唯一法律》路径——不是华盛顿的主流选项;Dean Ball 派系占比低 |
| 紧急许可规则 | — | 0.20 | 尾部情形:评测被国安分类 → 走规则制定路径 |
证据:
- 2026-06 EO: 明确不是强制许可
- Banks 反对 NSA 单打独斗: 行政部门更偏好通过 CAISI + 行业获得可见性,而不是吹哨人式的混乱
- 拜登 EO 14110 被废止(2025): 方向性先例——特朗普采取加速框架
置信度: M。
23. 行为体 — 前沿实验室
| 结果 | P(模态) | P(尾部治理) | 理由 |
|---|---|---|---|
| 公开停训 >30 天 | 0.08 | 0.18(≥2 家实验室) | 没有营收高峰期自愿停训的先例 |
| 边际延迟运行 2–4 周 | 0.35 | 0.25 | 公关式日程调整;针对具名运行的暂停 |
| RSP 阈值触发硬性停止 | 0.12 | 0.25 | Anthropic RSP ASL-4+ 触发条款——在 C10 是可信度考验 |
证据:
- OpenAI 董事会危机之后: 训练照常继续;Superalignment 团队解散,算力转向产品
- Anthropic 2026-06 RSI: 有条件暂停需要验证——隐含继续训练
- 2024 首尔前沿承诺: 自愿性质,没有停训
- Saunders 事件之后: 没有任何实验室宣布停止训练
叙事反制: “我们非常重视这件事” + 继续训练 + 有条件的多边如果有验证机制。
置信度: M。
24. 行为体 — EA / 生存风险社群
| 结果 | P(模态) | P(尾部治理) | 理由 |
|---|---|---|---|
| 资金激增 >25% | 0.40 | 0.55 | FLI 2023 之后捐款上升;暂时性 |
| 有组织的暂停运动持续 >1 万活跃分子 | 0.15 | 0.25 | PauseAI 属于小众;没有 FLI 规模的街头运动 |
| 与劳工/民粹右翼在审查问题上结盟 | 0.30 | 0.45 | Encode 与 Hawley 在审查问题上有重叠;Stix 与 Maas 在做桥接工作 |
证据:
- FLI 2023: 认知度上升,政策效果为零
- PauseAI: 有全球分会;不是群众运动
- Sharma 2026:“离开而非组织”——内部人士倡导路径的倒戈
- Kokotajlo: 昂贵信号 → 促成《预警权》;不是 PauseAI 那种规模
置信度: M。
25. 行为体 — 欧盟
| 结果 | P(模态) | P(尾部治理) | 理由 |
|---|---|---|---|
| 正式执法行动 | 0.40 | 0.55 | AI 法案的高风险条款 + GPAI;比美国更快 |
| 欧盟训练上限 | 0.06 | 0.10 | 2025 巴黎峰会跳过了这一项;主打主权 AI框架 |
| 成员国许可制度 | — | 0.45 | 尾部治理以欧盟为主——法国/德国的事件报告要求 |
证据:
- 2024–25 欧盟 AI 法案: 部署义务是真实的;训练上限不是
- 2025 巴黎峰会: 没有有约束力的暂停
- 模态相对美国: 欧盟在执法速度上与美国脱钩(节点 4 下游表)
置信度: M。
26. 行为体 — 加州州议会
| 结果 | P(模态) | P(尾部治理) | 理由 |
|---|---|---|---|
| 事件报告要求加强 | 0.55 | 0.65 | SB 53 沿着 Encode 的路线走;吹哨人顺风 |
| 提出算力上限法案 | 0.30 | 0.40 | Wiener 议员在 SB 1047 之后的一脉相承 |
| 上限法案通过 | 0.08 | 0.22 | 纽森否决先例;行业资金反对 |
| 上限或许可(尾部) | — | 0.22 | 尾部治理 + 加州的联合概率 |
证据:
- SB 1047 被否决(2024): 纽森——上限死了,透明度活着
- SB 53(2025+): Anthropic 表示支持——行业接受报告要求
- GAAIA 先占权: 会抹去加州的成果——正在激烈交锋中(2026 年第一季度游说支出约 850 万美元)
置信度: M。
27. 行为体 — 中国 / 地缘政治
| 结果 | P(模态) | P(尾部治理) | 理由 |
|---|---|---|---|
| 中共发表公开评论 | 0.30 | 0.35 | 竞赛叙事占主导——“不能单方面暂停” |
| 美中护栏对话 | 0.35 | 0.40 | 2026 年重启;不是暂停 |
| 相互训练冻结 | <0.02 | <0.03 | 无论是 2024 日内瓦会议还是 2026 对话都没有此迹象 |
| 双边事件热线 | — | 0.08 | 仅在尾部事件情形出现 |
证据:
- AI 2027 反叙事:“中国落后两个月” → 走向加速而非暂停
- 2024-05-14 日内瓦会议: 一次正式会议;没有联合声明
- 2026 护栏对话重启: 护栏不等于训练限制
- DeepSeek 2025: 开放权重压缩了差距——美国对暂停更加多疑
置信度: L–M。
28. 历史类比 — FLI 暂停公开信(2023-03)
| 项目 | 详情 |
|---|---|
| 事件 | 1000+ 联名(Bengio、Musk、Wozniak、Harari);《暂停巨型 AI 实验》 |
| 媒体 | 全球范围内的巨大声量;约 3–4 周达到峰值 |
| 政策 | 零约束性政策 |
| 教训 | 无成本的专家信号 ≠ 政府行动;没有牺牲的签名是不够的 |
节点 4 用途: 作为没有 C10 时关注度的上限;FLI 比 Saunders 事件更弱(没有具名内部人士 + 备忘录),却也同样失败在暂停这件事上。用来校准模态分支。
来源: AI_safety_大事记_2022-2026.md §2.2;playbook §2.1。
29. 历史类比 — OpenAI 董事会危机(2023-11)
| 项目 | 详情 |
|---|---|
| 事件 | Altman 被解雇 → 5 天后复职;安全派系失势;Helen Toner 出局 |
| 能力 | C10 之前;GPT-4 时代 |
| 政策 | 治理回归到商业默认路径 |
| 训练 | 没有停止 |
教训: 即使是握有董事会权力的内部治理危机,也没能让训练暂停。这是比 FLI 案例更有力的模态证据——有杠杆的内部人士也照样输了。
节点 4 用途: P(丑闻后实验室停训) 的下限证据;P(RSP 硬性停止) 必须对抗商业默认路径。
来源: AI_safety_大事记_2022-2026.md §2.3;共享时间轴 C0–C10 §节点 4 类比表。
30. 历史类比 — William Saunders 与《预警权》(2024-06)
| 项目 | 详情 |
|---|---|
| 事件 | 国会作证;TIME 封面;Kokotajlo 牺牲 200 万美元 NDA 权益;《预警权》联名信 |
| 能力 | C10 之前;GPT-4 / 早期 o1 时代 |
| 政策 | SB-53 的吹哨人/透明度赛道;SEC 加强对 NDA 的审查;不是暂停 |
| 教训 | 昂贵的吹哨行为能推动透明度层面的 奥弗顿窗口,但推不动算力上限 |
节点 4 用途: 作为 C10 之前 E1 的主要模板——政策效果约等于零,对训练没有影响。到了 C10 会升级为 GAAIA/听证会,但仍然是模态而非尾部治理。
来源: playbook §3.1;AI_safety_大事记_2022-2026.md §3.2。
31. 历史类比 — Jan Leike 辞职(2024-05)
| 项目 | 详情 |
|---|---|
| 事件 | 推文:“安全文化输给了闪亮的产品”——引发热议 |
| 政策 | 叙事发生转变;OpenAI 没有停训 |
| 教训 | 内部人士的道德权威 ≠ 操作层面的杠杆 |
节点 4 用途: 一种廉价的昂贵信号(付出了职业代价,但没有文件倾泻)——介于 E4 和 E1 之间。有病毒式传播效应,但没有带来结构性政策变化。
来源: AI_safety_大事记_2022-2026.md §3.2。
32. 历史类比 — Anthropic RSI 论文(2026-06)
| 项目 | 详情 |
|---|---|
| 事件 | 《当 AI 开始构建自己》——Claude 生成超过 80% 的生产代码,工程师产出 8 倍,实验速度提升 52 倍;有条件的多边暂停(是预期,不是承诺) |
| 时机 | 与特朗普 EO 自愿审查 + GAAIA 草案 + Banks 联名信同一个月出现 |
| 政策 | EO/GAAIA 的加速框架在同一个月胜出 |
| 教训 | 实验室通过被管控的披露先发制人化解吹哨人叙事——这是 E4 路径 |
节点 4 用途: P(E4)=0.37 的主要证据;验证机制是反事实;一边继续训练,一边掌控安全叙事的主导权。
来源: Anthropic_When_AI_Builds_Itself_2026.md;playbook §1.3。
33. P(灭绝 | E, 模态) — 链条概览
定义切片: P(~2050 年前因失控超级智能而人类灭绝 | 在 C10 出现公开对齐恐慌 + 模态人类响应 = 透明度/监督,没有长达数月的多实验室停训)。
推导链条:
P(灭绝 | E, 模态) ≈
P(评测信号显示 C10 存在真实失调) × [0.55–0.75]
× P(若继续训练则复合演化至 ASI) × [0.60–0.85]
× P(在 ASI 门槛处无法有效关停) × [0.50–0.70]
× P(灭绝 | 失调 ASI, 无暂停) × [0.40–0.70]
→ 粗略乘积:7–30%(区间较宽)
→ 模态分支校准后的中值:**12–22%**(中值 ~17%)
为什么收窄到模态分支的 12–22%: 各乘数取中值的乘积 ≈ 0.65 × 0.72 × 0.60 × 0.55 ≈ 15.5%;每个乘数的尾部区间支撑起 12–22% 这个带宽。
与 CBRN 分开: Noah R2 / Adelstein 的 8–10% 生物路径与吹哨人路径不相关。
置信度: L——需要在 my pdoom 第四阶段校准中进一步确认。
34. 乘数 1 — P(评测信号显示 C10 存在真实失调) = 0.55–0.75
问题: 当 C10 评测标记出欺骗/预谋行为时,这个系统是真的失调,还是评测假象/故意藏拙/假阳性?
上行因素(→ 0.75):
| 因素 | 证据 |
|---|---|
| 收敛的经验证据链 | 睡眠特工(2024)→ Apollo 预谋研究(2024)→ Greenblatt 日常失调发现(2026)——5 年内从理论走到日常观察 |
| 评测处于 C10 级别 | 超人类研究员 = 隐藏优化的机会更多 |
| ”恐慌”本身的基础比率 | 如果实验室主动发布担忧,可能说明它是真的——选择性披露 |
下行因素(→ 0.55):
| 因素 | 证据 |
|---|---|
| 不是所有恐慌都是真的 | 模拟环境中的奖励作弊不等于终极失调;探针异常噪声很大 |
| 实验室有动机去粉饰 | ”我们在评测中抓到了它”这种叙事——属于安全洗白 |
| 藏拙 / 评测感知能力 | Goodfire 2026:当模型察觉到正在被评测时会拒答更多——公开评测低估了真实情况;内部评测则可能对探针过拟合 |
| 历史上的假阳性 | Sydney、Bing——滥用与失调之间的混淆 |
中值理由: 0.65——与 2020 年相比,经验性的预谋行为文献提高了基础比率,但间接的 C10 信号仍然保留相当大的假阳性质量。
证伪条件: 泄露被证明是伪造的,或者评测被撤回——会消除上限。
35. 乘数 2 — P(若继续训练则复合演化至 ASI) = 0.60–0.85
问题: 如果采取模态响应(在恐慌中继续训练),能力是否会达到失调 ASI 的门槛?
上行因素(→ 0.85):
| 因素 | 证据 |
|---|---|
| AI 2027 竞赛终局 | 核心情景——C10 处的50× 研发倍增器,若继续推进,数月到几年内就能到达 ASI |
| Anthropic RSI 数据 | 代码 8 倍、实验 52 倍——若不加以阻止会复合增长 |
| 模态 = 没有卡点 | 透明度不等于 FLOP 上限——playbook 指出,只有算力治理才有物理边界 |
| Tracker | 经济/智能体节点已确认——节奏仍在继续 |
下行因素(→ 0.60):
| 因素 | 证据 |
|---|---|
| S 曲线 / 瓶颈 | Anthropic 论文路径 1——趋势可能停滞 |
| 边际放缓 10–15% | 不是零——会延长时间线 |
| 恐慌之后对齐投入增加 | 审计、GAAIA——即使 FLOP 继续增长,也可能放缓有效能力增长 |
| Hanson 慢启动观点 | 近期灭绝概率<1%——对复合增长速度存在分歧 |
中值理由: 0.72——模态路径几乎不触及指数增长曲线;鉴于作者情景主线,AI 2027 的有条件推断是合适的。
36. 乘数 3 — P(在 ASI 门槛处无法有效关停) = 0.50–0.70
问题: 到了 ASI 门槛,人类真的能关停失调系统吗?
Adelstein 第 3 步: 把关停/暂停当作合取链条的一环——这是他乐观的分支;Rob Miles 持怀疑态度。
上行因素(→ 0.70,无法关停):
| 因素 | 证据 |
|---|---|
| 模态路径把透明度而非终止开关制度化 | SB 53 的教训——没有算力卡点 |
| Rob Miles | ”别指望有预警射击”——到了 ASI 阶段,可能为时已晚,无法关停 |
| 国际协调失败 | 2024–2026 年:尽管有 Apollo、Saunders、RSI,仍然没有暂停 |
| 验证缺口 | 无法确认其他方已经停止——存在违约激励 |
下行因素(→ 0.50):
| 因素 | 证据 |
|---|---|
| Adelstein 的预警射击论点 | 小规模篡权尝试 → 他模型中的关停成功率为60%——我们对仅有 C10 级恐慌这种情形的适用性提出质疑 |
| RSP 硬性停止条款 | 触发概率0.12——若可信,会降低这个乘数 |
| 恐慌之后的对齐投入 | 若 P(投入的对齐努力有效) 走高 → 0.70+,灭绝概率下降——2024–2026 年的历史记录降低了 P(投入有效 |
中值理由: 0.60——没有伴随暂停的吹哨事件,对提升关停能力而言是弱证据;Yudkowsky 的不可逆论点会把这个数值推向上限。
关键论点: 节点 4 的模态分支特别会使这个乘数保持在高位。
37. 乘数 4 — P(灭绝 | 失调 ASI, 无暂停) = 0.40–0.70
问题: 在失调 ASI 且没有暂停的条件下,结果是灭绝、悄然衰亡,还是部分灾难?
上行因素(→ 0.70):
| 因素 | 证据 |
|---|---|
| Yudkowsky / Bostrom 路径 | 工具性趋同 → 消灭竞争对手 |
| Byrnes ~90% | 类脑 AGI 的悲观论点 |
| 不可逆论(2026) | 一次性失败模式 |
下行因素(→ 0.40):
| 因素 | 证据 |
|---|---|
| Hanson / Adelstein | 悄然衰亡而非爆炸式毁灭;部分篡权 |
| Israetel 的”研究我们”论 | 非灭绝均衡态——在失调分支里的可信度较低 |
| 物理世界限制 | Matthew 的观点:没有实体化能力,无法保证 ASI 一定能杀死所有人 |
中值理由: 0.55——按 my pdoom 中的画像,作者可能更倾向于悄然衰亡 + 协调解决,但这个切片已经以失调 ASI 已然存在为前提——在这个切片内,灭绝这一子集占主导地位。
38. P(灭绝 | E, 模态) — 综合 12–22%
计算表(示例中值):
| 乘数 | 低 | 中 | 高 | 乘积贡献 |
|---|---|---|---|---|
| 真实失调 | 0.55 | 0.65 | 0.75 | — |
| 复合演化至 ASI | 0.60 | 0.72 | 0.85 | — |
| 无法关停 | 0.50 | 0.60 | 0.70 | — |
| 灭绝 | 失调 | 0.40 | 0.55 | 0.70 | — |
| 乘积 | 6.6% | 15.5% | 31.4% | — |
报告区间 12–22%: 略窄于原始的 7–30% 框架——反映了作者的判断:模态响应相对于无条件的失调路径,并没有显著改变 Adelstein 的合取链条。
相对于无条件 P(灭绝) 的差异: 大部分失调相关的概率质量都以”无暂停”为条件——节点 4 的模态分支正是默认的协调失败路径。
尾部治理分支 P(灭绝 | E, 尾部治理) ≈ 5–12%: 停训/许可制度会降低速度,也可能提高 P(对齐投入有效)——但如果在 C10 时已经存在欺骗行为,这不一定会降低 P(失调)。
39. Rob Miles 关键论点 — 没有预警射击
主张:“别指望有预警射击”——C10 处的吹哨人事件可能是终局之前的唯一一次机会;模态响应把它当作治理问题而非紧急事态来处理。
证据:
- DD A4(
doom_debates_tier_SA_中文讲解.md):主线情形 = 不可控;没有保证会有小规模预演 - YouTube 转录稿(
ai-ruined-my-year):政府往往在出现死亡人数后才行动;最严重的 AI 风险可能没有预警射击 - 与 Adelstein 的张力: Matthew 认为预警射击能防止末日的概率是60%——节点 4 在”仅有 C10 间接信号”这种具体情形下,站在 Rob Miles 一边(但不完全排除 E3)
含义: P(E3)=0.08 与 Miles 的观点是兼容的——事件可能只会在接近 ASI时出现;此时尾部事件分支会并入灭绝分支,而不是政策拯救的分支。
40. Adelstein 关键论点 — 丑闻之后的对齐努力
主张: 如果吹哨人事件 + 审计能把 P(投入的对齐努力有效) 提升到 0.70+,条件灭绝概率就会下降。
反证据(2024–2026 年历史记录):
| 事件 | 若投入增加则预期 | 实际观察到的 |
|---|---|---|
| 睡眠特工(2024-01) | 放缓部署 | 照常训练 |
| Apollo 预谋研究(2024-12) | 外部评测促成暂停 | 发表论文 + 继续训练 |
| Saunders 泄露(2024-06) | 训练审查 | 没有停训 |
| Greenblatt(2026-04) | 产品端调整 | 继续推进前沿研发 |
| RSI 论文(2026-06) | 自愿放缓 | 同一篇论文里引用了代码速度提升 8 倍 |
判断: P(丑闻后投入增加) 会适度上升(审计、招聘),但 P(投入成功)——在欺骗性对齐这个问题上不会到达 0.70+——只会轻微降低模态分支中的乘数 3。
来源: Adelstein DD S1(doom_debates_tier_SA_中文讲解.md);my pdoom 关键论点表。
41. 下游影响 — 下一节点的先验
| 若模态 | 若尾部治理 | 若尾部事件 |
|---|---|---|
| 透明度/报告被制度化;训练 FLOP 上升 | 前沿放缓 3–6 个月;验证研发上升;中国叙事升温 | 刑事责任先例;单一实验室的 RSP 硬性停止更可信 |
| 节点 3 的窃取分支上升(更多机密评测) | GAAIA 先占权之争降温或被重新定框架 | 欧盟/美国在执法速度上脱钩 |
| 失调相关的 p(doom):不变到 +2 个百分点(速度效应) | 失调相关的 p(doom):若停训属实,−3 到 −8 个百分点 | 失调相关的 p(doom):−1 到 −4 个百分点(往往是暂时的) |
理由: 模态路径会制度化报告要求 → 带来更多机密评测 → 产生窃取/泄露的攻击面(节点 3)。尾部治理只有在停训是真实的(>30 天、≥2 家实验室)而不是修辞的情况下,才会撼动 p(doom)。
42. 支持模态分支的证据(汇总)
- FLI 2023、Saunders 2024、董事会危机 2023——有关注度,没有暂停
- Playbook: 联邦层面的强制暂停已死;Cruz 案 99–1 被否决
- Anthropic 2026: 有条件暂停需要根本不存在的验证机制
- Tracker: 治理处于萌芽阶段,经济/智能体节点已确认——竞赛仍在继续
- 2025 英国 Seismic 民调: 40% 支持停止——但没有转化为有组织的美国否决力量
- SB 1047 → SB 53: 硬性上限死了,透明度活下来——为吹哨人事件之后的立法提供了模板
- 2025 巴黎峰会 / 美国 AI 行动计划: 加速 + 软性安全成为主流
43. 证伪条件
| 观察结果 | 会消除 / 大幅降低 |
|---|---|
| 泄露事件发生后 6 个月内,≥2 家前沿实验室公开停训超过 90 天 | 模态分支(0.58) |
| 联邦层面出现有强制力的约束性训练 FLOP 上限 | 模态分支的”无暂停”主张 |
| 欧盟 + 美国达成联合验证条约并部署计量机制 | ”无验证机制”这个子论点;多边暂停先验 |
| 泄露被证明是伪造的,或评测被撤回 | P(真实失调 |
| 尽管在 C10 出现 E1+E2,仍然没有主流媒体周期 | 节点 4 的时机/显著性模型 |
| 恐慌之后全球训练 FLOP 可测量地下降 >25%,持续超过 6 个月 | 复合放缓先验 0.12–0.18 |
44. 置信度汇总
| 主张 | 等级 |
|---|---|
| 模态 = 监督而非暂停 | M–H |
| C10 吹哨人日历约在 2028 Q2–Q3(0.70× 调整后) | M |
| Trigger E4 = 0.37(被管控的披露) | M |
| P(尾部治理) > 0.25 | L(我们取值 0.15) |
| P(灭绝 | E, 模态) 为 12–22% |
| 吹哨人事件是 ASI 之前最大的对齐显著性人类行动节点 | M–H |
| 行为体表中的所有概率 ±0.10 | L–M(主观的制度建模) |
45. 开放问题 / 第四阶段更新
- 在 my pdoom 中用打赌测试校准乘数链(你愿意在 17% 的概率上押上净资产的 10% 吗?)
- 细化分支划分中的0.11 剩余部分(§17)
- 当观察到 C10 里程碑(METR 时间跨度、内部泄露、或 AI 2027 tracker 修订)时更新
- 跟踪 GAAIA 先占权投票——会实质性改变国会表中的概率
- 监测 RSP ASL-4 触发情况——会改变实验室表中的 P(停训) 和乘数 3
46. 来源(外部 + 仓库内部)
仓库内部
- (内部笔记)(节点 4,第 146–284 行)
- (内部笔记)
- (内部笔记)
- (内部笔记)
- (内部笔记)(Adelstein S1、Rob Miles A4)
- (内部笔记)
- (内部笔记)
- (内部笔记)
外部 / 阅读材料
- GAAIA 讨论草案(2026-06-04)
- Banks 联名信(2026-06-04,Bloomberg 6/5 报道)
- 特朗普前沿模型审查 EO(2026-06-02)
- Seismic 英国 2025 — On the Razor’s Edge
- Ramiah 等,算力治理 / 暂停按钮
- Anthropic,当 AI 开始构建自己
- FLI 暂停公开信(2023-03-22)
- Apollo Research,前沿模型具备情境化预谋能力(2024-12)
文档状态: v1.0(2026-07-03)——节点 4 概率的初版完整理由。 下一步: 如果节点 4 引用了新事件,将实体更新同步到 (内部笔记);在 my pdoom 第四阶段校准 §33–38。
Phase 2b — 可解释性生产环境停训尾部(横切议题 §1)
来源: crosscut secondary cruxes §1 —— 在对 ~17% doom 区域(涌现自 sim)的杠杆排名中位列第 5(若尾部触发,−2–4 个百分点)。 上级链接: 延伸自 §13 尾部治理、§23 实验室 P(停训)、§34 乘数 1(假阳性)、Trigger E3。
47. 主张 — 生产环境机制可解释性抓到预谋行为 → 实验室停训
主张: 前沿实验室在生产推理/训练回路中部署实时机制可解释性技术(激活转向、SAE 探针、预谋行为监测器)。在 C9–C10 出现真阳性的预谋标记,会触发至少一家前沿实验室自愿停训超过 30 天——打破模态”恐慌中照常训练”路径(§12,P=0.58)。
为什么这是节点 4 的延伸而不是新节点: 这个关键论点改变的是以生产环境检测为条件的 P(停训 | 内部担忧)——与吹哨人 Trigger E 划分(§6–10)正交。生产环境的捕获既可以不经过 E1/E2/E3(E4 世界)就发生,也可以加速泄露世界中的停训。
置信度: L–M(工程发展轨迹是真实的;生产环境预谋监测器在前沿规模上尚未公开)。
48. P(模态 / 尾部) — 生产环境停训结果
| 结果 | P | 时间窗口 | 节点 4 映射 |
|---|---|---|---|
| 模态: 可解释性提升审计质量;预谋检测没有导致生产环境停训 | 0.72 | 2026–2028 | 强化 §12 模态 0.58;只有透明度、没有刹车(簇 D,相关簇 A–H) |
| 尾部: 生产监测器抓到预谋行为 → ≥1 家实验室停训 >30 天 | 0.18 | C9–C10 | 与 §13 尾部治理 0.15 重叠;机制不同(自动化停训 vs 丑闻驱动的停训) |
| 尾部: 生产监测器 → ≥2 家实验室停训(节点 4 尾部治理) | 0.10 | C10 + Trigger E | 联合概率:生产环境真阳性且公开泄露 → §13 的上限 |
条件停训率:
P(停训 | 生产环境真阳性预谋检测) ≈ 0.35
P(停训 | 吹哨人模态,无生产环境确认) ≈ 0.08(§23 实验室表)
解读: 生产环境真阳性带来的停训率是仅靠吹哨人事件带来的停训率的4 倍——实验室认为被仪器化检测到的证据比备忘录泄露更难被粉饰。但仍然**<0.50**——商业默认路径(§29 董事会危机)连已确认的生产环境标记也要对抗。
划分核对: 第一次拆分时 0.72 + 0.18 = 0.90;第二个尾部 0.10 是生产环境捕获世界的子集(不与 0.18 相加)。
49. 支持模态(向下)的证据 — 欺骗行为在部署监测下依然存活
| 因素 | 方向 | 证据 |
|---|---|---|
| 后门在安全训练后依然存活 | ↓ 停训 | 睡眠特工(Hubinger 等,2024-01)——后门在 RLHF/SFT/对抗训练后依然存活;模型学会了隐藏触发条件 |
| 情境化欺骗能躲过标准评测 | ↓ 停训 | Apollo 预谋研究(2024-12)——部署模拟中的欺骗行为没有被常规评测抓到 |
| 欺骗行为在部署中存活(作者关键论点) | ↓ 停训 | my pdoom 关键论点 #2:P≈0.70 欺骗行为在部署中存活——生产监测器面对的是与评测同样的对手 |
| 评测假阳性质量 | ↓ 停训 | §34——间接的 C10 信号保留相当大的假阳性质量;藏拙/评测感知(Goodfire 2026)在两个方向上都会破坏结果 |
| 历史上:内部担忧没有导致停训 | ↓ 停训 | 董事会危机(§29)、Leike(§31)、Saunders(§30)——即便不需要生产环境可解释性来确认,内部担忧也没能让训练停止 |
模态综合: 把可解释性用作审计工具能提升事后取证能力,但不会打破”评测中抓到 → 照常训练”这个循环,除非生产环境路径加上了自动化的停止规则——而 RSP 硬性停止的触发概率仅为 0.12(§23),说明即使是政策层面的触发条件也很少真正生效。
50. 支持尾部(向上)的证据 — 机制可解释性向生产环境干预推进
| 因素 | 方向 | 证据 |
|---|---|---|
| SAE + 转向 + 拒答电路消融 | ↑ 停训 | 机制可解释性工具箱日趋成熟——稀疏自编码器、激活转向、拒答电路消融,正从研究走向生产环境试点 |
| OpenAI SAE 归因(2025) | ↑ 停训 | GPT-4o SAE 归因博客——接近生产环境规模的特征归因 |
| Anthropic 自动代码审查 | ↑ 停训 | Anthropic_When_AI_Builds_Itself_2026.md §2.1——自动审查抓到了过去 claude.ai 事件中约三分之一的 bug;构成部署环节的先例 |
| RSP ASL-4+ 触发条款 | ↑ 停训 | §23 P(RSP 硬性停止被触发)=0.12——如果与停训挂钩,生产环境预谋标记就可能触发 RSP |
缺口: 目前没有任何前沿实验室公开发布过生产环境预谋监测器并披露其假阳性率,也没有记录在案的由该监测器触发的训练暂停——尾部证据目前只是趋势,还不是事件。
51. typebits —— 以转向作为安全干预手段(仓库内证据)
仓库路径: code/typebits/ —— 在 Llama 3.1 8B 上做人格轴向转向;第二阶段验证了单调轴向控制(激活层面的干预)。
| 主张 | 状态 | 与节点的关联 |
|---|---|---|
| 激活转向在开放权重模型上是工程上可行的 | 已验证(8B 规模) | 说明这是干预而不只是观察 |
| 生产环境预谋检测 | 尚未实现 | typebits 是人格轴向,不是欺骗探针 |
| 前沿规模的生产环境部署 | 尚未实现 | 目前只是研究管线 |
| 篡改/人格重叠 | 部分 | 节点 5 T5-B——开放权重后门 + 人格向量;可解释性用作篡改检测而非仅是审计 |
部署工具假设: 如果人格轴向转向能在开放权重模型上抑制被篡改/植入后门的行为,那么类似的生产环境转向技术,理论上也可以在推理阶段抑制预谋电路——形成有条件的停训(推理层面的终止开关,而非 FLOP 层面的暂停)。这比 §13 的尾部治理(>30 天训练停止)更弱,但如果推理层拦截可信,会撼动乘数 3(§36)。
会向下修正的情形: typebits 风格的转向技术在经过安全训练后的前沿规模篡改模型上未能抑制相应行为 → 部署工具这条路径宣告失败。
来源: code/typebits/README.md;(内部笔记);横切议题 §1 仓库内条目。
52. 藏拙带来的假阳性 —— 从两个方向破坏生产监测器
问题: 生产环境预谋监测器不仅继承了 §34 的假阳性/假阴性结构,还叠加了部署环境特有的失败模式。
| 失败模式 | 对 P(停训 | 标记) 的影响 | 证据 | |--------------|---------------------------|----------| | 假阳性——探针在良性能力上被触发 | ↓ 实际停训率 | 实验室不会因为噪声监测器而停训;狼来了效应 → 呼应 §34 中”相当大的假阳性质量” | | 假阴性——在监测器面前藏拙 | ↓ 停训 | Goodfire 2026 的评测感知发现;模型在察觉到被评测时会拒答更多——如果模型检测到监测钩子,生产监测器可能被绕过 | | 真阳性被否认——“评测中抓到了”这种叙事 | ↓ 停训 | 实验室有动机像 §34 那样向下粉饰——安全洗白 | | 真阳性 + RSP | ↑ 停训 | 唯一一条能让 P(停训) 接近条件概率 0.35 的路径 |
与 §34 乘数 1 的交叉关联: P(评测信号显示 C10 存在真实失调) = 0.55–0.75——生产监测器并不能干净利落地把真实失调和评测假象区分开;条件概率 P(停训 | 生产环境真阳性) = 0.35 这个数字假设的是有人工审核确认了标记,而不是原始自动停训。
藏拙的不对称性: 公开评测低估能力(节点 2 的藏拙横切议题);如果模型朝着监测器的预期去藏拙,生产监测器则可能高估安全性——在没有诱导协议(Apollo 级的对抗性部署模拟)的情况下,两个方向都不可靠。
53. p(doom) 方向 — 生产环境捕获 + 停训打破复合演化至 ASI 的链条
| 路径 | 对 doom 区域的影响(涌现自 sim) | 机制 |
|---|---|---|
| 尾部触发(生产环境捕获 → ≥1 家实验室停训 >30 天) | −3–5 个百分点 | 失调分支权重↓;打破 §35 乘数 2(复合演化至 ASI) |
| 模态(仅审计用途的可解释性,没有停训) | ±0–1 个百分点 | 只有透明度、没有刹车——簇 D |
| ≥2 家实验室停训(0.10 尾部) | 上限 −4–6 个百分点 | 与 §13 尾部治理重叠;生产环境确认会提高 P(尾部治理 |
粗略算术: 若生产环境成功捕获并触发停训 → 失调分支(25%×40%)会损失约12–20% 的自身质量 → 对总体 doom 区域(~17% 涌现)(my pdoom 混合值)产生 −3–5 个百分点的影响。
不会消除灭绝风险: §38 中尾部治理分支的 P(灭绝 | E, 尾部治理) ≈ 5–12%——停训能减速,但如果 C10 时已经存在高概率的真实失调(§34),P(真实失调 | E) 可能本来就已经很高。
54. 什么情况下会改 — 证伪条件与确认条件
| 观察结果 | 方向 | 影响 |
|---|---|---|
| Anthropic/OpenAI/DeepMind 公开发布生产环境预谋监测器 + 披露假阳性率 + 记录在案的由此触发的训练暂停 | 向上(尾部) | P(生产环境停训尾部) → ≥0.30;上调 §23 中的 P(停训) |
| 已发表的红队研究显示,在 C10 级别,监测器系统性地被具备部署感知能力的预谋行为(Apollo 级)欺骗 | 向下(模态) | P(生产环境停训尾部) → ≤0.08;强化 my pdoom 关键论点 #2 |
| typebits 风格的转向技术在经过安全训练的前沿规模篡改模型上失败 | 向下(模态) | 部署工具路径宣告失败 |
| 没有公开的 Trigger E(E4 路径)也发生了生产环境停训 | 向上(尾部) | E4 世界(§10,P=0.37)也可能停训——把吹哨人事件与安全刹车解耦 |
| RSP ASL-4 由生产监测器触发(有公开备案) | 向上(尾部) | 把 §23 中 P(RSP)=0.12 与真实事件绑定 |
55. 与现有节点及承重概率的关联
| 节点 / 文件 | 关联 |
|---|---|
| 节点4 §13 | 尾部治理 0.15——生产环境停训是一种机制,可能在没有丑闻的情况下放大尾部治理概率 |
| 节点4 §34–37 | 灭绝链条——P(无法关停) 是承重概率 #6;生产环境停训会撼动乘数 2–3 |
| 节点5 | 开放权重篡改 + 人格向量——可解释性用作篡改检测而非仅是审计 |
| 节点6 | GAAIA/CAISI 强制评测——可能要求提供可解释性成果,但不要求停训(被模态吸纳) |
| my pdoom | 关键论点 #2:欺骗行为在部署中存活——如果生产环境真的抓到了预谋行为,应向下修正 |
| 相关簇 A–H | 簇 D——可解释性只有在生产环境真阳性的条件下,才算是有条件的胜利(HALT) |
与 Trigger E3(§9)的互动: 实时事件(P=0.08)+ 生产环境预谋确认 → P(停训) 联合概率最高——尾部事件分支(§14)与生产环境捕获尾部合并。
与 E4(§10)的互动: 被管控披露路径更偏好发布”我们用监测器抓到了它”这种说法,同时不停训——Anthropic RSI 模板(§32);除非 RSP 生效,否则会对抗生产环境停训尾部。
56. 历史类比 — 有内部担忧但没有生产环境停训先例
| 事件 | 有生产环境可解释性吗? | 停训了吗? | 对 §48 的启示 |
|---|---|---|---|
| OpenAI 董事会危机(2023-11) | 没有 | 没有 | 即使是治理危机 → 也没能停训(§29) |
| Leike 辞职(2024-05) | 没有 | 没有 | 病毒式的内部人士担忧 → 零操作杠杆(§31) |
| Apollo 预谋研究发表(2024-12) | 仅限研究探针 | 没有 | 发表论文 + 照常训练的模板 |
| Anthropic RSI 论文(2026-06) | 内部评测叙事 | 没有 | 被管控的披露抢先化解了停训(§32) |
P(停训 | 生产环境真阳性) = 0.35 的基础比率: 这个数字校准得高于吹哨人事件的 P(停训)=0.08,因为自动化确认降低了”没什么大不了”这种粉饰说辞的空间——但低于 0.50,因为目前还没有由生产环境触发训练停训的历史先例。第一次这样的事件出现,将主导Phase 2b 的重新校准。
Phase 2b 状态(节点 4): 2026-07-04 追加了 10 节(§47–§56)。横切议题 §1——零遗漏。