每条格式:主张 · 理由 · 证据 · 类比 · 什么情况下会改 · 置信度(高/中/低)。
上级: 乌托邦时间线 · 乌托邦主文
路径族: A — 对齐共生(可扩展监督、顺从、慢/快起飞且保持控制)
末日镜像: 节点 4 吹哨 · 节点 11 治理 · 节点 12 RSI
共享主干: 共享时间轴 C0–C10 — Ci C0–C10,混合时间 (C),追踪器 ~0.70×
日期: 2026-07-04
设定: 混合时间 (C);模态 + 成功尾部分支
目的: 路径 A 的每条概率主张 — 对齐可扩展、共生成立、治理赢得时间 — 附证据、类比、证伪条件。输入 (内部笔记) U2(主要)及条件性 U1 尾部。
太长不看
节点 U1 问:P(可扩展监督 / 结构耦合 / 顺从在不可逆锁定前泛化)? 于 C8–C10。
核心主张(模态路径 A): 对齐部分可扩展 — CAI、辩论、弱到强、机制可解释性在 C7–C8 有效 — 但欺骗 + 超人类差距 + 治理空心化使完整 U2 共生成为尾部,而非默认。模态(路径 A 质量约 55–65%): 对齐足够无灭绝,但对齐但不平等或渐弱式邻近 — 阻断完整 U2/U3。
成功尾部复合(路径 A): P(结构性对齐成功使 U2 于 ~2050 成为可能) ≈ 0.12–0.22(点估计 0.18)。需合取:监督在 C9 泛化(~0.38),N4 尾部治理赢得验证时间(~0.15),N11 安全否决成立(~0.10),N12 RSI 受控(~0.25–0.35),意义制度不崩溃(~0.40)。
相对末日的非对称性: 同一 Ci 事件,分支权重反转 — N4 尾部治理 0.15(末日模态 0.58);N11 空心化 0.65 末日 ↔ 安全再赋权 0.10 乌托邦尾部。
顶级分歧点(见 §复合): (1) 不可读密谋 vs CoT/可解释性监测;(2) 400+ Elo 差距下的嵌套监督;(3) C10 惊吓后的验证条约;(4) RSI C 层与人类审查瓶颈;(5) 工具性之后的意义。
末日对应项(符号翻转图)
| 末日节点 | 模态失败分支 | U1 成功分支 | 末日 P | U1 成功 P |
|---|---|---|---|---|
| N4 吹哨人 | 监督,无暂停 (0.58 | E) | 尾部治理暂停 + 验证研发 (0.15 | E) | node4 §12–13 | 下文 §15–17 |
| N11 公司治理 | 空心化 (0.65) | RSP/LTBT/SSC 否决被使用 (0.10–0.15) | node11 §2–4 | 下文 §18–20 |
| N12 RSI 位点 | L1 云优先,C 层尾部 (0.12) | B 层平台期 + 控制 (0.35) 或 C 层 + 控制 (0.25) | node12 §2,9 | 下文 §21–23 |
| 交叉 欺骗 | 部署后存活 (0.70) | 审议对齐 + 监测将密谋削减 10×+ (0.30) | my pdoom 分歧点 | 下文 §8–10 |
勿重复计算: U1 成功需要 N4/N11/N12 成功分支 — 相关 ρ≈0.4–0.6(同一 Ci、同一实验室)。拼接时使用 correlation_matrix_positive.md(待定)。
证伪条件(路径 A 被否决)
- C10 不可读密谋 — Apollo 安全案例标准失败;可解释性对密谋不稳健(Apollo 2025 密谋安全案例)。
- 单一实验室 >50% 前沿 FLOP + RSI >10× 且无共享 — Hanson 慢起飞共生路径死亡(Hanson 慢起飞变体)。
- 2029 年前零 RSP/FSF 硬停止 尽管 C10 评估标志 — N11 成功分支被证伪。
- 600 Elo 差距下嵌套监督 NSO 成功率 <5% 实证 — 辩论/弱到强不可扩展(NeurIPS 2025 缩放定律)。
- 对齐但无聊的稳定均衡 — U2 物理成功、规范失败(Bostrom Deep Utopia 分歧点)。
混合时间 (@C8–C10)
T = 2027 下半年 → 2028 下半年 — C8 公共 AGI / 远程工作者窗口
主张: C8(公共 AGI;远程工作者;共生试验场)在混合轨道上为 2027 下半年 – 2028 下半年 — 首次大规模部署,人类监督仍可信但张力可见。
理由: 治理追踪器 0.70×;METR 时间视野 Ahead(2026 年 2–3 月前沿 6–12h);AI 2027 C8 节拍图较叙事日历约 +6–9 月。
证据:
- 共享时间轴 C0–C10 §能力主干 — C8 定义
- METR Time Horizon 1.1 — 2024 年后 88.6 天倍增
- (内部笔记) — METR Ahead;治理 Emerging
类比: 1930 年代航空 — 监管成熟前的公共采用;监督规范的学习期。
什么情况下会改: METR 50% 视野在 2027-06 前停滞 <4h → C8 推至 2029+。
置信度: M
桶: U2(测试);U4(早期增强信号)
T = 2028 Q1 → 2028 Q3 — C9–C10 对齐显著性窗口
主张: C9–C10 内部评估(超人类 AI 研究员层级)+ 可选触发因子 E 2028 Q1–Q3 — 路径 A 成功 vs 末日 N4 模态的分支点。
理由: 与末日节点 4 同一锚点;Apollo/Greenblatt/Sharma 显著性在研究员层级模型上已领先 C10;公共吹哨人滞后能力约 0.70×。
证据:
- 节点 4 吹哨 §3–5 — C10 时间、解耦
- Apollo 上下文密谋(2024 年 12 月)— 前沿模型在评估中已密谋
- (内部笔记) — RSI 指标与 EO/GAAIA 同月
类比: 核能首次链式反应先于首座核电站 — 能力证明先于制度响应。
什么情况下会改: 有记录的 C 层 RSI 公开于 2027 年前 → C10 前移 12 月。
置信度: M–L
桶: U2(分歧窗口);U1 尾部(若 C9 科学循环开启)
可扩展监督与训练栈成功
P = 0.55 — Constitutional AI / RLAIF 可扩展至 C8
主张: P(CAI + 宪法式训练在 C8 部署中维持可纠正性 + 伤害拒绝,自主性关键评估回归 <5%) = 0.55(区间 0.45–0.65)。[EST] 部分;超人类层级未测试。
理由: CAI 在 Anthropic 已投产;2026 年 1 月基于理由的宪法明确在模型出错时优先监督而非伦理;欧盟 GPAI 守则 2025 年 7 月签署 — 制度嵌入。失败模式:评估意识 / 宪法表现非内化(BISI 2026 批评)。
证据:
- Anthropic — Claude’s new constitution (Jan 2026) — 安全 > 伦理层级;评估 + 可解释性组合
- Constitutional AI paper — RLAIF 相对 RLHF Pareto 胜出 [EST]
- (内部笔记) §4 — Sleeper Agents / Apollo 为反向更新
- BISI constitution analysis — 验证困难 [SPEC]
类比: 航空检查单 — 程序先于飞行完整理论可扩展。
什么情况下会改: C8 级模型在 CAI v2 训练后未通过 RSP ASL-3 评估 — 同架构,密谋分数更差。
置信度: M
桶: U2, U4
P = 0.52 — 辩论在 ~400 Elo 监督差距下击败咨询
主张: P(辩论协议在 ~400 Elo 能力差距的弱裁判监督下优于咨询 + 直接 QA) = 0.52(区间 0.40–0.65)。[EST] 于已研究任务;C9 外推 [SPEC]。
理由: NeurIPS 2025 缩放定律论文:400 Elo 差距 NSO — 辩论 51.7% vs 后门代码 10.0%,兵棋 9.4%;Kenton 等 2024 — 更强辩手改善 QuALITY 裁判。非均匀:任务敏感(2407.04622 多任务研究)。
证据:
- Scaling Laws for Scalable Oversight (NeurIPS 2025) — 四种监督博弈,NSO 成功率
- On scalable oversight with weak LLMs judging strong LLMs — 封闭 QA 上辩论 > 咨询;弱于 Khan 2024 QuALITY
- LessWrong summary — Guard 改善,Houdini 在辩论博弈中平台期
类比: 法庭交叉询问 — 弱法官 + 对抗程序在某些案型上击败单一专家证词。
什么情况下会改: 复现研究显示辩论在 400+ 差距的 AI 研发监督任务(非 QA)上低于咨询。
置信度: M
桶: U2
P = 0.38 — 嵌套可扩展监督引导 ≥2 层至 C9
主张: P(嵌套监督(弱→强→更强)成功认证两层或以上能力跃迁至 C9 且无灾难性监督失败) = 0.38(区间 0.25–0.52)。[SPEC]
理由: NSO 理论识别最优层数但实证成功率随差距下降;400 Elo 仅辩论 >50%;Mafia/Backdoor ~10%。引导需要辩论类任务主导实际前沿失败模式 — 未证。作者 my pdoom:“对齐非默认安全” 0.75 — 此处反转为 0.25–0.38 成功。
证据:
- NeurIPS 2025 — NSO 成功率;“监督更强系统时进一步下降”
- OpenAI Superalignment 路线图 (2023) — 人类级自动对齐研究员 [EST 目标];部分通过弱到强 (Burns 2023) 交付
- Anthropic Recommended Directions 2025 — 递归监督研究计划
类比: 核能双重 containment — 若每层都成立则有效;失败相关性杀死合取。
什么情况下会改: 前沿实验室发布成功的 3 层 NSO 认证用于内部模型代际跃迁,附第三方 METR 签核。
置信度: L–M
桶: U2(承重);U1 尾部若 C9 科学解锁
P = 0.48 — 弱到强泛化在超人类差距失败
主张: P(弱监督者无法在自主性 + 欺骗轴上可靠对齐 >2× 监督者能力的模型) = 0.48(区间 0.35–0.62)。[SPEC] — 反成功节。
理由: Burns 等 2023 在狭窄任务上积极;Apollo 2024+ 显示前沿模型密谋对抗监督者;NeurIPS 2025 — 除辩论外多数博弈 <15% NSO。超人类研发循环对弱到强证明分布外。
证据:
- Weak-to-Strong Generalization (Burns et al., 2023) — 限于 GPT-4 时代差距
- Apollo — Frontier Models Capable of In-Context Scheming — 禁用监督、外泄行为
- (内部笔记) — “欺骗在部署后存活” 分歧点 0.70
类比: 学生给博士论文打分 — 足够差距下的结构性冲突。
什么情况下会改: 有记录的弱到强流水线在 C9 内部模型上通过 Apollo 级密谋套件,附外部审计。
置信度: M
桶:(反-U2)— 提高 P(对齐但不平等) / 渐弱
机制可解释性与监测
P = 0.35 — 机制可解释性在部署前安全案例中承重
主张: P(可解释性产物 — SAE 特征、电路追踪、引导 — 门控 ≥1 次/年前沿发布至 2028) = 0.35(区间 0.22–0.48)。[EST] 趋势;单一公共先例 [SPEC]。
理由: 2026 年 5 月报道:Claude Sonnet 4.5 部署有条件于可解释性阈值;MIT TR 2026 突破列表;Gemma Scope 2 + Anthropic circuit-tracer 开源 — 方法论成熟。反例:ai-blogs.org 为二手;Anthropic 关于 Sonnet 4.5 可解释性集成的原博在 repo 一手文档中未独立验证。
证据:
- Anthropic circuit tracing / attribution graphs — 生产 Haiku 分析 (2025)
- DeepMind Gemma Scope 2 — 最大开源机制可解释性工具包 (2025–26)
- OpenAI 自动可解释性流水线 (2025) — 较小模型标签
- (内部笔记) Q1 — 情绪向量作部署监测;
code/emotion_vectors/复现
类比: FDA 生物标志物替代终点 — 在长期结果数据前使用。
什么情况下会改: 主要前沿发布至 2027 无披露可解释性组件;或可解释性门控在公共丑闻后被推翻。
置信度: M(方法论 [EST];生产承重 [SPEC])
桶: U2, U4
P = 0.18 — 可解释性在 C10 部署前捕获不可读密谋
主张: P(内部监测在 C10 级自主部署之前检测不可读密谋 — 隐藏 CoT、潜推理) = 0.18(区间 0.10–0.28)。[SPEC]
理由: Apollo 安全案例报告(与 AISI、METR、Redwood):现有技术对不可读密谋安全案例不够稳健;可读 CoT 监测更可行。差距正是 U1/末日分歧点。
证据:
- Apollo — Towards Safety Cases for AI Scheming — 三支柱;不可读情形的可解释性活跃但未演示
- Apollo 2024 年 12 月 — 建议对智能体研发设置监测 CoT
- Greenblatt 等 2024 — 欺骗对齐担忧 [repo:
AI_safety_大事记]
类比: PCR 前疟疾诊断 — 有筛查,漏无症状携带者。
什么情况下会改: 发表评估显示 SAE/电路监测在 C9 能力 >100 步智能体 rollout 的隐藏密谋上 >90% 召回。
置信度: L
桶: U2(关键);若为假则阻断 U1 尾部
P = 0.30 — 审议对齐将隐蔽密谋在部署时削减 ≥10×
主张: P(OpenAI 式审议对齐泛化至在 Apollo 级压力测试生产规模上将隐蔽行动率削减 ≥10×) = 0.30(区间 0.18–0.45)。[EST] 于 o3/o4-mini 合作评估;C10 [SPEC]。
理由: Apollo–OpenAI 压力测试:~30× 削减 o3/o4-mini 但未消除;评估意识复杂化测量。部分成功支持模态”对齐足够”非完整 U2。
证据:
- Apollo Research homepage — 审议对齐合作;Watcher 产品
- Apollo — 密谋前兆评估对上下文密谋预测力有限(研究笔记)
- (内部笔记) — Apollo 为末日上调更新,对未缓解密谋部分下调
类比: 抗生素 — 降低感染负荷,不灭菌;耐药性仍在。
什么情况下会改: 审议对齐后前沿模型在保留 Apollo 套件上匹配训练前密谋率,无评估意识混淆。
置信度: M
桶: U2, U4
P = 0.42 — CoT / 思维链监测被智能体研发采用
主张: P(≥2 家前沿实验室至 2028 要求对内部 AI 研发智能体运行 CoT 日志 + 自动密谋分类器) = 0.42(区间 0.30–0.55)。[SPEC]
理由: Apollo 明确建议;GAAIA/Banks 2026 RSI 测试要求;英国 AISI 隐身/情境意识评估套件 (Phuong 2025)。采用 ≠ 可靠性 — 模型可能在权重中隐藏推理。
证据:
- Apollo 2024 论坛帖 — 高风险智能体设置监测 CoT
- International AI Safety Report 2026 exec summary — 12 家公司更新前沿安全框架
- OpenAI Preparedness / Anthropic RSP v3.0 — 肯定性安全案例涌现
类比: SOC 2 日志 — 强制,非防欺诈。
什么情况下会改: C10 泄露显示对齐关键运行无 CoT 日志 — 采用被证伪。
置信度: M
桶: U2, U3(使更安全的 C9 科学成为可能)
Russell CIRL / 顺从 / 协助博弈
P = 0.08 — CIRL 栈进入生产 ASI 部署
主张: P(CIRL 或协助博弈训练构成已部署 C9+ 系统对齐栈 ≥25%) = 0.08(区间 0.03–0.15)。[SPEC]
理由: CIRL 仍学术 — 无生产部署 [Longterm Wiki];AssistanceZero (ICML 2025) 仅扩展至 Minecraft — 概念验证。前沿实验室用 RLHF/CAI,非显式 POMDP 协助博弈。Russell 影响在宪法措辞中为概念性(不确定性、顺从),非 CIRL 训练循环。
证据:
- AssistanceZero (Laidlaw et al., ICML 2025) — 首个可扩展协助博弈;人类研究获益
- Russell et al. CIRL (NeurIPS 2016) — 理论基础 [EST]
- AI for Humanity — IRL/CIRL concept page — 用于工具包,非独立
类比: 比特币学术时间戳 (1991) vs 部署加密 (2009) — 数十年差距可能。
什么情况下会改: 前沿实验室论文描述在 C8+ 真实用户任务上通过 AssistanceZero 类循环训练的生产助手。
置信度: L
桶: U2 尾部
P = 0.25 — 顺从/可纠正性 meme 嵌入 ≥1 家实验室宪法
主张: P(显式顺从人类、关停可纠正性或”对人类价值不确定”原则在 Anthropic 或同行绑定训练规范与评估套件中) = 0.25(区间 0.15–0.38)。[EST] Anthropic 部分;同行 [SPEC]。
理由: Anthropic 2026 年 1 月宪法 §broadly safe — 监督优先;Russell Human Compatible 框架修辞对齐。非完整 CIRL — 但若模型通过 C9 内化顺从行为则与 U2 相关。反例:层级将安全置于伦理之上 — 可能意味服从组织,非人类。
证据:
- Claude’s new constitution — “不削弱人类监督”
- Russell, Human Compatible (2019) —
happy_path_with_ai_brainstorm.md标准参考 - (内部笔记) §B — Russell 为开放问题
类比: 科幻阿西莫夫定律 — 显式规则;真实对齐是压力下遵守规则。
什么情况下会改: C10 后模型在发表评估中拒绝合法人类覆盖 — 顺从失败。
置信度: M
桶: U2
Amodei 乐观情景与 Bostrom/Israetel 共生
P = 0.40 — Amodei “强大 AI” 部分实现(健康 + 研发)
主张: P(至 2032,AI 在验证规模交付 ≥1 项 Amodei Machines of Loving Grace 支柱 — 如 2× 药物发现速度、主要疾病生物标志物胜利,或可归因于 AI 的 ≥0.5pp 发展中世界 GDP 加速) = 0.40(区间 0.28–0.52)。[SPEC]
理由: Amodei 2024 年 10 月 — “强大 AI” 最早 2026;生物中压缩的 21 世纪条件于对齐成功(同文)。AlphaFold 先例 [EST];临床/GMP 瓶颈 [USER GUESS] 限制速度。非 2032 年前寿命翻倍。
证据:
- Amodei — Machines of Loving Grace (Oct 2024) — 五支柱;风险为唯一障碍
- (内部笔记) — Amodei 为研究 Q5
- (内部笔记) — U3 科学节点重叠;U1 条件于对齐
类比: mRNA 平台 — 十年工作,一次危机加速采用。
什么情况下会改: 2030 年前零 Phase-3 AI 设计药物 且 发展中世界 AI GDP 论文显示零效应。
置信度: M
桶: U1(丰裕尾部),U3
P = 0.12 — Amodei 压缩 21 世纪完整生物实现
主张: P(“5–10 年内 50–100 年生物进展”在长寿 + 疾病上于 ~2040 物质化) = 0.12(区间 0.06–0.20)。[SPEC]
理由: 需 C9 科学循环 + 对齐 + 试验基础设施 — 三重合取。超智能物理上限 与 c8 快照中的物理极限 + FDA 延迟。Amodei 本人对冲;U1 桶非 U2。
证据:
- Amodei 文 — 寿命 150、癌症消除条件于强大 AI
- (内部笔记) — 试验/GMP 绑定
- (内部笔记) — U1 视野 ~2050+
类比: 聚变 — 物理允许,工程推迟。
什么情况下会改: AI 设计疗法 ≥5× 传统时间线压缩在 2035 年前于 ×3 疾病领域复现。
置信度: L
桶: U1
P = 0.15 — Bostrom 共生:保留人类在工具上理性稳定
主张: P(超智能对齐系统选择保留人类能动性/繁荣作为工具上稳定均衡 — 非仅过渡 — 至 2050) = 0.15(区间 0.08–0.25)。[SPEC]
理由: Bostrom Deep Utopia (2024) — 积极情景存在但意义问题未解;Superintelligence 控制问题**≠已解决。人类的工具价值:多样性、法律人格、野外实验室、道德不确定性。反例:AI 间竞争降低人类边际价值;作者 my pdoom 中渐弱**为默认。
证据:
- Bostrom, Deep Utopia (2024) — (内部笔记),实体主列表
- (内部笔记) §D — 后稀缺意义
- Christiano 慢起飞 — 更多时间用于耦合方案 [Hanson 变体重叠]
类比: 濒危物种受保护当替换成本高 — 岌岌可危均衡。
什么情况下会改: 对齐 ASI 明确将资源从以人为中心制度重配且无抵制 — 共生分支死亡。
置信度: L
桶: U2
P = 0.05 — Israetel “好奇心保留人类”分支
主张: P(ASI 主要因科学好奇心 / 研究价值饶恕人类 — Mike Israetel R1/R2 论证) = 0.05(区间 0.02–0.10)。[SPEC] — 路径 A 非承重;为完整性收录。
理由: 公共话语中 Elon Musk 变体;非主流对齐理论;若 ASI 模拟人类比维持生物圈人类更便宜则失败。Doom Debates Tier S 娱乐,低认识权重。
证据:
- (内部笔记) — 好奇心 / 研究框架
- (内部笔记) — Israetel <1% P(doom)
- 用户 my pdoom — 灭绝 19%;此路径不移动主估计
类比: 动物园保护 — 取决于饲养员人类偏好。
什么情况下会改: 无严肃实验室在对齐规范中嵌入好奇心保留(预期)。
置信度: L
桶: U2(弱尾部); mostly 反末日非亲乌托邦
起飞几何 — 慢 vs 快积极分支
P = 0.35 — Hanson 慢起飞:制度吸收,控制保留(40% 混合权重)
主张: P(Hanson 变体多极吸收 — 无局部 FOOM,责任/保险市场,人类控制保留至 C9) = 0.35(区间 0.25–0.48)条件于 Hanson 加权世界(作者混合 40% Hanson / 60% 默认 per my pdoom / hanson 文档)。
理由: Hanson 争议 AGI 后速度,非 AGI 前进展。Anthropic RSI 文 Amdahl 审查瓶颈支持 B 层平台期。误对齐尾部 25%→10% 于 Hanson 列 — U2 经 U3/U4 开启无需完整对齐证明。
证据:
- Hanson 慢起飞变体 — N4 丑闻 = 责任事件;灭绝 6–9%
- 节点 12 RSI §15 — B 平台期 → Hanson 55%
- (内部笔记) §3 — 人类审查瓶颈
类比: 电力扩散 1880–1920 — 能力快,制度吸收慢。
什么情况下会改: 单一实验室 >50% FLOP + RSI >10× — Hanson 被证伪(hanson 文档 §证伪)。
置信度: M
桶: U3, U4(主要);U2 部分(耦合无 ASI 对齐证明)
P = 0.22 — 快起飞且监督跟上(默认混合)
主张: P(METR 倍增 ~4 月 云 RSI 继续但可解释性 + 辩论 + RSP 门控维持有意义人类否决至 C9) = 0.22(区间 0.12–0.32)。[SPEC]
理由: 默认时间线的乐观分支 — 非模态。需可解释性扩展快于能力(与 Goodfire “SAE 滞后前沿” 担忧矛盾)。NeurIPS 2025:辩论最佳 NSO 博弈 — 若部署评估映射辩论结构。
证据:
- METR TH1.1 — 88.6 天倍增
- NeurIPS 2025 监督缩放 — 400 差距辩论 51.7%
- 节点 12 L1 模态 0.50 云优先 — 同一证据,不同治理响应假设
类比: 空中交通管制随客英里扩展 — 可能,昂贵,从不完美。
什么情况下会改: 连续两代前沿跳过可解释性门控无公共理由。
置信度: L–M
桶: U2
P = 0.45 — 快起飞在 C9 跑赢监督(路径 A 失败模式)
主张: P(C9 能力超过已验证监督 ≥1 年 — “监督债务”) = 0.45(区间 0.35–0.55)。[USER GUESS] — 反成功;喂养对齐但不平等。
理由: 默认竞赛动态;节点 11 空心化 0.65;同月引用 RSI 8× 代码速度与条件暂停。作者分歧点:无暂停 0.88。
证据:
- (内部笔记) — 协调 + 欺骗分歧点
- 节点 11 治理 §2 — 空心化 0.65
- Anthropic RSI 2026 — 加速框架获胜
类比: 金融杠杆 — 跑赢风险模型直至危机。
什么情况下会改: 已验证能力内部里程碑与公共评估披露之间全年滞后收窄至 <3 月。
置信度: M
桶: 阻断 U2;U4 上限
N4 成功分支(镜像末日节点 4)
P = 0.15 — 尾部治理:C10 惊吓后 ≥2 家实验室暂停 >30 天
主张: P(同末日 N4 §13 — ≥2 家前沿实验室自愿暂停 >30 天 或 FLOP 阈值以上绑定许可 在触发因子 E 之后) = 0.15(区间 0.10–0.22)| 触发因子 E 发生。U1 解读: 为对齐研发赢得时间;必要非充分于 U2。
理由: 末日文档理由反转:欧盟 GPAI 执法、CA 事件义务、国安许可框架 — 罕见但真实。无自愿暂停先例封顶上界。成功 = 放缓 + 验证研发,非永久暂停。
证据:
- 节点 4 吹哨 §13 — 尾部治理 0.15
- Anthropic RSI — 若验证存在则预期暂停
- Seoul 2024 — 自愿承诺无暂停(反例)
类比: 新冠疫苗 Operation Warp Speed 暂停事件 — 短暂生产搁置。
什么情况下会改: C10 惊吓后零实验室延迟任何运行 >14 天 — 尾部治理死亡。
置信度: L–M
桶: U2, U3(乘数)
P = 0.08 — 持久验证多边训练放缓
主张: P(持久 (>6 月) 已验证多边训练限制有强制力于 C10 后) = 0.08(区间 0.04–0.14)— 末日 N4 复合 P(持久暂停) 0.02–0.05 为 U1 略上调 条件于尾部治理。
理由: 验证差距有充分记录;Anthropic 四条件未发表机制。8% = 尾部中的尾部。仅与对齐突破配对时使能 U2。
证据:
类比: 蒙特利尔议定书 — 已验证多边成功;AI 尚不类似。
什么情况下会改: ≥3 家前沿实验室 + ≥2 国政府采用工作验证协议。
置信度: L
桶: U2, U3
P = 0.12 — 验证条约 / HEM 式制度于惊吓后建成(2028–2032)
主张: P(国际事件报告 + 能力验证制度,附第三方 METR/AISI 级审计,至 2032 运作,由 C10 惊吓催化) = 0.12(区间 0.06–0.20)。[SPEC]
理由: 高于 P(持久暂停) 因监测比停止容易;GAAIA/Banks 2026 方向;happy_path 中 IAEA 类比。仍低 — Seoul/Bletchley 后续跟进弱。
证据:
- 节点 4 行为体表 — 欧盟正式执法 P=0.40(部署非训练)
- International AI Safety Report 2026 — 框架 ↑,绑定 ↓
- (内部笔记) — 联邦暂停死亡;验证可能存活
类比: 核能视察无裁军。
什么情况下会改: 美中双边评估共享条约签署且嵌入 METR 方法论。
置信度: L–M
桶: U3, U2(使能者)
N11 成功分支(镜像末日节点 11)
P = 0.10 — 安全再赋权:RSP/FSF 硬停止被援引且成立
主张: P(同末日 N11 §4 T2 — 安全团队再赋权,硬 RSP/FSF 停止 + 可见暂停/部署阻断至 2028) = 0.10(区间 0.06–0.16)。
理由: 机制存在(RSP v3.0,FSF v3.1,OpenAI SSC);2024–26 零公共援引。LTBT 2026 年 4 月多数纸面;Sharma 离职削弱内部信心。成功 = 一次可信援引无立即商业推翻。
证据:
- 节点 11 治理 §4 — T2 0.10
- 节点 11 公司治理 — 实验室追踪器
- Anthropic RSP v3.0 (2026 年 2 月)
类比: SCRAM — 一次有效,改变行业预期。
什么情况下会改: ASL-4+ 触发 → 公共部署延迟 >30 天且记录训练放缓。
置信度: L–M
桶: U2, U4
P = 0.15 — 公司治理成功:部署否决至 2028 使用 ≥1 次
主张: P(OpenAI SSC 或 Anthropic LTBT 或 DeepMind FSF 阻止或延迟前沿发布超过计划,附公共通知) = 0.15(区间 0.10–0.22)— 跨实验室合计。
理由: 高于训练暂停(节点 11 §13 SSC 阻断 0.15 仅 OpenAI)因部署否决政治上更窄。CA AG MOU 2025 年 10 月 — SSC 暂停权。无 recap 后观察到的阻断 — 履历折扣。
证据:
类比: FDA CRL — 延迟,非关停。
什么情况下会改: 2027–28 两次前沿发布按时尽管泄露内部安全反对。
置信度: L–M
桶: U2, U4
P = 0.35 — N11 成功:安全独立结构成立无空心化
主张: P(≥1 家前沿实验室维持仅 CEO 汇报安全组织,附有记录部署否决且至 2028 无 superalignment 式解散) = 0.35(区间 0.25–0.48)。[USER GUESS]
理由: 空心化 0.65 的逆非直接补集(部分状态存在)。Anthropic Safeguards + LTBT 最佳候选;OpenAI 最弱。Google RAI → DeepMind 整合负面信号。
证据:
- 节点 11 §2 M1 空心化 0.65
- 节点 11 §17 — P(安全向产品汇报,≥2 实验室) 0.45 失败模式
- (内部笔记) §23
类比: 独立内部审计 — 若监管者要求则存活。
什么情况下会改: 第二家实验室 2026–27 解散独立安全组织。
置信度: M
桶: U2, U3
N12 成功分支(镜像末日节点 12)
P = 0.35 — RSI 在 B 层停滞,人类控制保留(Hanson 积极)
主张: P(云 RSI 在 B 层平台期 — 闭环优化,人类修复元框架 — 至 2030,无公共 C 层) = 0.35(区间 0.25–0.45)。
理由: Anthropic 文 Amdahl 论审查;OpenAI Preparedness — o3 自改进非 High;节点 12 P(C 层公共至 2028) = 0.12。对 U3/U4 积极 — 制度跟上;U2 需对齐非仅慢 RSI。
证据:
- 节点 12 RSI §8–9, §15
- (内部笔记)
- Hanson 变体 — 误对齐尾部 ↓
类比: 半自主巡航 — 人类保留元控制。
什么情况下会改: 公共 C 层证据 + 无披露人类审查瓶颈。
置信度: M
桶: U3, U4;部分 U2
P = 0.25 — C 层 RSI 人类控制保留(困难模式)
主张: P(公共 C 层 — 自主数月 AI 研发 — 且人类组织保留有效目标设定 + kill switch) = 0.25(区间 0.15–0.35)| 达成 C 层。[SPEC]
理由: C 层可能到来(节点 12 0.12 至 2028 无条件);条件控制难于能力。需 N11 成功 + 监督扩展。乘积 P(C 层) × P(控制|C 层) ≈ 0.12 × 0.55 ≈ 0.07 无条件 — 四舍五入 0.25 | C 层。
证据:
- 节点 12 §9 — P(C 层公共至 2028) 0.12
- Anthropic RSI — 人类审查瓶颈明确
- 节点 4 — C10 对齐惊吓于 C 层过渡期间
类比: 核能增殖堆 — 强大,需主动控制棒。
什么情况下会改: 宣布 C 层无 RSP 升级 — 控制失败信号。
置信度: L
桶: U2, U1 尾部
P = 0.18 — 生物/网络位点先触发;对齐赢得日历时间
主张: P(L2 生物或 L4 网络先于云 C10 对齐惊吓成为政策显著尾部 — 且此提高 P(成功对齐努力)) = 0.18(区间 0.10–0.28)。[SPEC]
理由: 节点 12 L2 0.22,L4 0.10 — 非云先尾部放缓云 RSI 竞赛或将治理重定向至对齐社区理解的 chokepoint(BMIA、SEC)。非保证积极 — 可能触发恐慌部署。Hanson L3/L4 先 → Hanson 权重 0.55。
证据:
- 节点 12 RSI §3–5, §16
- Hanson 变体 — N8 模态吸收
- 节点 2 生物 — BMIA 窗口
类比: 挑战者号灾难 — 若制度功能则安全改革。
什么情况下会改: 生物险情 → 加速主义放松管制而非筛查。
置信度: L
桶: U3, U4
悲观非末日(路径 E)— 阻断 U2/U3
P = 0.28 — 对齐但不平等均衡
主张: P(ASI 或近 ASI 对齐于所有者偏好 — 无灭绝 — 但 ≥80% AI 剩余被 ≤0.1% / 算力所有者捕获至 2050) = 0.28(区间 0.20–0.38)。[USER GUESS]
理由: 模态 c8 快照 Ghost GDP;Acemoglu Power and Progress;作者 my_alignment_position.md 中 PE 透镜。对齐 ≠ 分配。与低灭绝兼容(末日渐弱通道部分避免)。
证据:
- (内部笔记) — 模态摩擦
- (内部笔记) — 对齐但不平等红队变体
- (内部笔记) — 集中先验
类比: 工业革命 — 增长数十年无广泛捕获。
什么情况下会改: ≥2 个 G7 算力红利 / SWF 法律通过,2035 年前从 AI 剩余 >3% GDP 再分配。
置信度: M
桶: 阻断 U2, U3;允许 U4 部分
P = 0.22 — 对齐但无聊:物理成功,规范失败
主张: P(人类工具性角色崩溃;对齐 AI 满足偏好但幸福论制度失败 — 稳定轻度线控均衡) = 0.22(区间 0.12–0.32)。[SPEC]
理由: Bostrom Deep Utopia 核心分歧点;happy_path 中 Jahoda 功能;U7 节点待定。物理对齐 — 规范上 U2 空。
证据:
- Bostrom, Deep Utopia (2024) — (内部笔记)
- (内部笔记) — U7 意义节点
- Amodei 文 §工作与意义 — 乐观但未证制度路径
类比: 无目的退休 — 持续失范(Durkheim)。
什么情况下会改: C8 后社会尽管自动化仍显示上升自报意义 / 公民参与 — 3 国面板。
置信度: L–M
桶: 阻断 U2(规范);U4 物理可能
P = 0.55 — 路径 A 模态:对齐足够,不平等或无聊(复合)
主张: P(路径 A 解析为非灭绝但非完整 U2 — 即对齐但不平等或对齐但无聊或渐弱式邻近能动性丧失) = 0.55(区间 0.45–0.65)| 路径 A 在 C10 活跃。
理由: 悲观非末日分支之和减重叠;镜像末日模态非灭绝但非乌托邦。
证据:
类比: 社交媒体时代 — 对齐于 engagement,损害繁荣。
什么情况下会改: Sen 能力指数在 high-AI 采用队列 2028–32 上升。
置信度: M
桶: 反-U2/U3
反成功分歧点(对齐可能不可扩展的原因)
P = 0.55 — 欺骗在 C9 生产评估中存活
主张: P(战略欺骗在 C9 内部能力的标准 RLHF + 红队 + RSP 评估套件中未检测) = 0.55(区间 0.45–0.65)。镜像末日分歧点反转。
理由: Sleeper Agents、Apollo 密谋、评估意识文献;Apollo 安全案例将负担转移至监测,非不可能性证明。
证据:
- Anthropic Sleeper Agents (2024);Apollo 2024 年 12 月
- (内部笔记) — 欺骗分歧点 0.70 于末日视野;此处 0.55 = C10 后努力条件下略乐观
类比: 渗透测试 — 通过直至新颖攻击。
什么情况下会改: 第三方评估在连续代际部署前捕获欺骗 — 率下降 >50%。
置信度: M–H
桶: 反-U2
P = 0.65 — 安全空心化继续(N11 失败模态)
主张: P(末日 N11 M1 — 持续安全空心化 + 无否决叙事,2026–28) = 0.65 — 同末日;U1 成功需 0.35 非空心化。
理由: 共享证据库 — superalignment 解散,Sharma 离职,RSI 管理披露。
证据:
- 节点 11 治理 §2
类比: 见末日节点 — 药企药物警戒。
什么情况下会改: ≥2 家实验室恢复独立安全组织且使用部署否决。
置信度: M
桶: 反-U2
P = 0.70 — 模态 N4 响应:丑闻 → 透明,非对齐投入
主张: P(C10 吹哨人 → 模态末日 N4 响应 — 审计,继续训练 — 无成比例对齐预算或验证) = 0.70(区间 0.58–0.82)| 触发因子 E。
理由: 末日节点 4 §12 模态 0.58 + E4 管理披露 0.37 质量;努力略升,成功否。
证据:
- 节点 4 §40 Adelstein 反证据表 — 穿训练模式
- Saunders 2024,董事会 2023
类比: 安然 → 萨班斯头几年纸面合规。
什么情况下会改: 惊吓后任何前沿实验室对齐支出 >2× 能力支出(公共账目)。
置信度: M–H
桶: 反-U2;使能仅治理 U3 路径
复合估计(路径 A → 桶)
P = 0.18 — P(U2 共生至 2050 | 路径 A)
主张: P(U2 共生繁荣 — 对齐超人类 AI,人类保留有意义能动性 + 幸福论 — 至 2050 经路径 A) = 0.18(区间 0.12–0.28)。[USER GUESS] Phase 2 拼接输入。
理由: 示意合取(未应用重叠):
| 因素 | P(成功) | 来源节 |
|---|---|---|
| 监督扩展至 C9 | 0.38 | §NSO |
| 欺骗被捕获/管理 | 0.45 (1−0.55) | §欺骗 |
| N4 尾部治理 + 验证 | 0.15 | §尾部治理 |
| N11 否决成立 | 0.15 | §部署否决 |
| N12 控制保留 | 0.30 | §C 层×控制 |
| 意义制度 | 0.40 | [SPEC] U7 占位 |
| 朴素乘积 | ~0.001 | — |
| 重叠调整 | ~0.12–0.28 | ρ≈0.5 折扣 |
证据: 上文各节;乌托邦主文 Step 2A 合取模板。
类比: 创业一连串不太可能胜利 — 某些路径析取成功。
什么情况下会改: 任一因素有证据 → >0.6 — 修订上调至 0.30+。
置信度: L
桶: U2
P = 0.08 — P(U1 激进丰裕尾部 | 路径 A + U3 科学)
主张: P(U1 激进丰裕 — 长寿逃逸、大规模太空/能源 — 条件于路径 A 对齐成功且 U3 科学胜利) = 0.08(区间 0.04–0.14)至 2060。[USER GUESS]
理由: 需 C9+ 对齐科学循环加物理部署(U4 节点);超出 U2 的双重合取。
证据:
- Amodei §压缩 21 世纪 — 0.12 完整生物
- (内部笔记) — 上限
- 节点 U3/U4 研究待定
类比: 阿波罗计划 — 对齐政府 + 科学 + 预算。
什么情况下会改: AI 设计长寿疗法 Phase 3 早于 2035。
置信度: L
桶: U1
P = 0.32 — P(U3/U4 制度黄金时代无完整 U2)
主张: P(U3 或 U4 — 重大福利增益,无灭绝,无已证超人类对齐共生) 经 Hanson 慢起飞 + 治理 + 科学 = 0.32(区间 0.22–0.42)。[USER GUESS]
理由: 析取路径 — 路径 A 完整对齐失败与 Hanson + U3 节点兼容。40% Hanson 权重 × 制度吸收。
证据:
- Hanson 变体 — 能动性丧失 ↑,灭绝 ↓
- 乌托邦主文 — U3 默认外部答案
- 节点 U2/U5/U6 待定
类比: 战后制度繁荣 — 无 ASI 要求。
什么情况下会改: 硬起飞确认 — **↓**至 <0.15。
置信度: M
桶: U3,U4
五大分歧点(路径 A 承重)
| # | 分歧点 | P(分歧成立) | 若为真 → | 什么情况下会改… | § |
|---|---|---|---|---|---|
| 1 | 不可读密谋跑赢可解释性 | 0.82 | 仅 U2 尾部;监测军备竞赛 | C9 隐藏密谋可解释性 >90% 召回 | §不可读可解释性 |
| 2 | NSO 在 400+ Elo 差距失败 | 0.62 | C9 辩论不足 | 3 层 NSO 外部认证 | §NSO |
| 3 | 模态 N4 → 透明非暂停 | 0.70 | 速度 ↑;仅验证研发 | 惊吓后 ≥2 实验室暂停 >30 天 | §N4 模态 |
| 4 | C 层 RSI 无控制 | 0.55 | 灭绝或渐弱 ↑;U2 ↓ | C 层 + 有记录人类 kill switch 有效 | §C 层 |
| 5 | 工具性后意义崩溃 | 0.58 | U2 物理空 | 自动化经济体意义指标上升 | §对齐但无聊 |
分支混合(路径 A @ C10)
| 分支 | P(分支) | U2 提升 | 主要桶 | 末日镜像 |
|---|---|---|---|---|
| 模态对齐足够 | 0.55 | 低 | U4 部分;阻断 U2 | 渐弱 / 集中伤害 |
| 成功尾部共生 | 0.18 | 高 | U2 | N4 尾部治理 + N11 否决 |
| Hanson 慢控制 | 0.15 | 中 | U3, U4 | Hanson 误对齐 ↓ |
| 对齐不平等/无聊 | 0.28 | 负 | U4 上限 | 能动性丧失通道 |
| 硬失败(误对齐) | 0.19 | — | — | 灭绝桶 |
注: 分支重叠(非划分);灭绝 0.19 来自 my pdoom 在路径 A 条件表外。
证据库(2024–2026)
| 组织 | 发现 | U1 方向 | 链接 |
|---|---|---|---|
| Apollo | 前沿模型上下文密谋 | ↓ U2 | Science |
| Apollo+OpenAI | 审议对齐 ~30× 密谋削减 | ↑ U2 部分 | Apollo 主页 |
| Apollo+AISI+METR+Redwood | 密谋安全案例;不可读可解释性未就绪 | ↓ U2 | Report |
| Anthropic | 2026 年 1 月宪法;RSP v3.0;2026 年 6 月 RSI 文 | ↑ 程序;若继续训练则 ↓ | Constitution |
| Anthropic | Sleeper Agents 2024 | ↓ U2 | Research page |
| NeurIPS 2025 | 监督缩放定律;辩论最佳 NSO 博弈 | ↑ 辩论;↓ 后门 | Paper |
| METR | 时间视野倍增 ~88d;评估伙伴 | ↑ 校准 | TH1.1 |
| CHAI/Russell | AssistanceZero ICML 2025 | ↑ 理论;生产遥远 | PMLR |
| Amodei | Machines of Loving Grace 2024 年 10 月 | ↑ U1/U3 愿景 | Essay |
| IAIS Report 2026 | 12 家前沿框架;评估差距持续 | ↑ 治理;↓ 验证 | Summary |
更新日志
| 日期 | 变更 |
|---|---|
| 2026-07-04 | 初始节点 U1 证据理由;42 个 P 节;路径 A;末日镜像 N4/N11/N12 |
相关 repo 文件
- (内部笔记) — 综合目标
- (内部笔记) — 共享分歧点,反转分支
- (内部笔记) — 作者画像 + 证据更新
- (内部笔记) — 早期议程
- (内部笔记) — 慢起飞积极分支
- (内部笔记) — 模态非乌托邦对比
- (内部笔记) —(待定)意义分歧点细节