← 返回

p(doom) 证据 — 节点 3:权重盗窃与地缘

2026年7月5日

证据索引 · English · 主文

每条格式:主张 · 理由 · 证据 · 类比 · 什么情况下会改 · 置信度(高/中/低)。


上级时间线: 共享时间轴 C0–C10
压缩表: 节点 1–3 扩展表
日期: 2026-07-03
设定: 混合时间 (C);模态 + 尾部分支


1. 在仓库中的位置

文件内容
本文件节点 3 完整版 — 时间、盗窃概率、行动者表、模态/尾部、p(doom)、可证伪条件
共享时间轴 C0–C10 §节点 3 摘要5 行执行摘要
节点 1–3 扩展表中等长度节点 3(表已压缩)
RAND_2024_Securing_AI_Model_Weights_导读.mdOC/SL 框架;SL5 目前不可行
research_us_china_ai_dialogues.md日内瓦 2024;2026 护栏重启
research_international_ai_governance_platforms.md多边碎片化(巴黎 2025)
research_ai_pause_advocacy_playbook.md条约/暂停为何已死;出口管制仍活跃
Anthropic_Fable_Mythos_export_ban_2026_深度解读.md已部署模型的出口管制先例
ai_2027_中文总结.md安全附录;2027 年 2 月盗窃叙事
my pdoom地缘政治 + 协调失败桶

2. 节点定义(可证伪主张)

在能力 C5+(持续学习 Agent-2 级;约 2×10²⁸ FLOP 训练;3× 研发乘数)时,一次显著的权重盗窃或国家安全危机触发加固 + 出口管制 + 护栏对话,但不会出现持久的 US–China 训练限制条约或单方面前沿暂停。

分三层(不要与 AI 2027 散文混为一谈):

节点 3 对象
能力 C前沿权重值得偷;盗窃实质缩小算力差距
触发 E尝试、部分外泄或国家关联盗窃的公开发现
响应出口管制、WSL 支出、对话重启 — 竞赛继续

3. 混合时间 — C5+ 约 2028,而非 2027 年 2 月

AI 2027(叙事)我们的锚点(混合 C)理由
盗窃显著性2027-02 Agent-2 盗窃~2028 H1C5+追踪器在治理/经济上约 0.70×;C5 = Agent-2 / 3× 乘数(共享时间轴 C0–C10
安全升级盗窃后一夜 WSL3→WSL4触发后 12–18 月滞后AI 2027 安全预测:政府最高优先级下 WSL3→WSL5 约 12 月;RAND:SL5 需 5 年提前量
政策峰值2027-05 国安审查潮2028 H1–H2COVID 类比:即便明显尾部也有 2–3 月制度延迟

混合规则: 能力日期跟 AI 2027 / METR 快车道人类响应日历滞后约 30%,除非触发 E 压缩。按 Ci 锚定节点,不按戏剧日历 — 2027 年 2 月盗窃是情景色彩,不是我们的基准预测日期。

Ci通俗能力追踪器 (2026-06)节点 3 相关性
C4Agent-1-mini;初级开发冲击经济 Behind盗窃价值低;WSL2–3
C5Agent-2;持续学习;3× 研发乘数Emerging / Not testable首次值得 OC4 外泄战役的权重
C6超人类程序员Emerging盗窃后加固目标
C7+内部「天才国」Emerging政府深度介入;讨论动能选项

日历映射(若 0.70× 成立): AI 2027 C5 ≈ 2027-01 → 显著盗窃/政策危机 ~2028 Q1 ±6 月。


4. AI 2027 年 2 月盗窃 — 情景装置,非基准预测

AI 2027 正文(2027 年 2 月):中国通过内部人 + NVLink/NVIDIA CC VM 微架构侧信道约 2 小时、多 TB 权重窃取 Agent-2 — 随后美国推 WSL4、抓最后间谍、讨论对中方数据中心的动能打击。

我们的处理:

要素AI 2027我们的 P / 立场
时间2027 年 2 月字面日历上 ;条件于 C5+ 时 中等
2 小时完整盗窃标准情节作为作战模板 低 (~0.05–0.12) — 见 §5
部分 / 秘密先偷正文权重不足更高基率 — SSL 比 WSL 难(安全预测)
约 1 月内发现若完整权重转移则 中等 (~0.45–0.60)
讨论动能打击白宫选项尾部 T1 — 执行 P <0.02

叙事效用:让权重的战略价值WSL 失效可读。不要把微架构侧信道 + 2 小时 + 2 TB 当作 P(尝试) 的参考类。


5. P(2 小时完整盗窃) — 低

主张: P(成功 约 2 小时内完整前沿权重外泄 | AI 2027 式行动, C5+ 尝试) ≈ 0.05–0.12

因素方向证据
外泄带宽不利于 2 小时Agent-2 级 ~2 TB+(安全预测);WSL3+ 数据中心出口控制
CC VM 侧信道一旦可行则合理AI 2027 指定 NVLink 侧信道 — 一条路径;非所有盗窃的基率
OC4 战役长度不利于 2 小时RAND OC4:~100 人、~1 年、≤$10M — WSL 定义是 <2 月,非 2 小时
内部人 + 网络组合利于快速行动曼哈顿/OC5 行动可压缩时间线 — 但完整权重仍需暂存
盗窃专家先验利于某种盗窃78% 同意国家行为体在 2030 前窃取美国前沿权重 — 2 小时完整盗窃

解读: 低 P(2 小时盗窃) 与中等 P(任何国家盗窃尝试)兼容 — 尝试可能是部分蒸馏秘密优先数月外泄。


6. P(尝试) 与 P(被发现) — 中等

6.1 P(尝试 | C5+ 已上线,至 2030)

工作区间: 0.55–0.75(中心 ~0.65)。

证据权重
AI 2027 安全研讨会民调 (n=27):78% 同意「国家行为体最可能在 2030 前从美国公司窃取前沿 AI 模型权重」尝试/成功 的强先验
RAND 2024:美国前沿约 WSL2 (2024–25);SL3 首次严肃内部人防御;SL5 目前不可能脆弱性持续
CFR 网络行动追踪器:2005 以来国家网络以间谍为主;AI 权重 = 高价值间谍目标参考类
AI 2027 追踪器 (2026-03):无公开确认;间谍本质隐蔽尝试可能永不浮出水面
开放权重 (Llama, DeepSeek, GLM)完整盗窃边际价值下行 — C5+ 非零

6.2 P(被发现 | 成功完整权重盗窃)

工作区间: 0.45–0.60(中心 ~0.52)。

利于发现不利于发现
2024 芯片战后 USG 反情报;实验室仪器 ↑成功间谍常永不公开(Stuxnet 归因数年)
AI 2027 假设美国 ~1 月内获知攻击者可能外泄至中方气隙 CDZ 无公开泄露
RAISE/SB-53 权重盗窃 72h 报告 (NY, 2027+)保密可能埋没公众显著性
Fable/Mythos 事件:政府将前沿模型当军品发现 ≠ 主流媒体周期

区分: P(尝试) 中高;P(此次行动被发现并成为 DC 危机) = 尝试 × 发现 × 显著性 — 我们在 C5+ 且差距闭合威胁国安叙事时建模显著性。


7. 安全等级 — RAND / AI 2027 安全预测

等级vs 国家行为体 (OC4/5)2024–26 观察
WSL2脆弱美国前沿默认 (RAND;安全预测)
WSL3OC4 仍可攻破2026 目标;带宽限制、内部人项目
WSL4标准国家行动稳健 (95% / 2 月)危机后冲刺;机密计算
WSL5vs 最高优先级国家不可达,需政府 + 数年 (RAND;63% 民调:无自愿 SL5)

民调锚点 (Security Forecast):

问题同意
2030 前国家窃取美国前沿权重78%
无法律 + 政府协助则无自愿 SL563%
政府 #1 优先级 + >$100B → <6 月 SL522% 同意;56% 不同意

对节点 3 的含义: 盗窃危机在专家先验中过决定防御冲刺 — 模态路径 = 反应式加固,非先发制人。


8. 触发 E(可选加速器)

触发P(触发 | C5+)对响应的影响
E1 — 完整权重盗窃公开/可信泄露2028 前 0.15–0.25出口管制 0.85+;安全支出 0.90+;媒体周期 6–10 周
E2 — 保密发现、选择性泄露 (WSJ/FT)0.20–0.30同 E1;动能讨论非执行
E3 — 外泄前抓获失败尝试0.25–0.35加固竞赛加速尾部;条约仍 <0.10
E4 — 出口管制危机 (Fable 级,无盗窃)已 live (2026-06)出口管制体制先于盗窃;降低意外
无触发 E (盗窃隐蔽或仅秘密)~0.25–0.35渐进 BIS 规则;护栏 0.40

Fable/Mythos (2026-06):首个已部署商业前沿模型出口召回 — 盗窃触发被部署管制部分前置


9. 模态路径概览 (~55–65% | C5+ 危机)

一句话: 收紧芯片 + 模型出口管制、实验室安全支出 2–3×重启 US–China 护栏对话训练限制条约、单方面暂停、动能打击。

                    C5+ 权重战略显著 (~2028)

           ┌──────────────────┼──────────────────┐
           ▼                  ▼                  ▼
      MODAL (58%)        TAIL-T3 (20%)      TAIL-T1 (3%)
   出口管制 +            竞赛加速            动能 /
   WSL 支出 +            DPA + IC 激增       盟友分裂
   护栏对话              无条约              (T4 14%)
           │                  │                  │
           └──────────────────┴──────────────────┘
                         TAIL-T2 (6%)
                    真正双边条约
                    (训练限制)

10. 模态 — 出口管制扩张 P ≈ 0.70

机制P(至 2028-12)证据
BIS AI 模型/权重规则收紧0.70Fable EAR §744.22(b) 对 API「知情」(2026-06);8/1 EO 覆盖模型框架
KYC / 外国训练报告0.55拜登时代拟议规则;Trump EO 2026 加速框架仍国安鹰派
芯片出口进一步分层 (HBM, 设备)0.65既有小院高墙;日内瓦 2024 中方议程
前沿 API 访问的视同出口0.60Fable 外国公民禁令先例;ID/生物识别门控 (Anthropic 2026-07 政策)

为何不高: 行业反弹 (Lawfare, Dean Ball「卡通化」);部分逆转 (Mythos 白名单 6/26;BBC/BankInfoSecurity 称 2026-07-01 全面解除);管制 ≠ 暂停

为何不低: 两党芯片鹰派基线;Banks 信 (2026-06) 明确防中国窃取;盗窃危机在 Fable 之外增加势头。

置信度:


11. 模态 — 实验室安全支出 ≥2× P ≈ 0.75

行动P证据
前沿实验室安全预算翻倍+0.75RAND 8 项紧急建议 SL2 largely 未落实;危机 = 终于有资金
第三方红队 (OC4 模拟)0.65RAND 建议 #7;SL5 Task Force / standard.sl5.org
机密计算生产部署0.55RAND 建议 #8;最难、共识最强
内部人项目 + 特权访问 ↓0.70SL3 分水岭;AI 2027 → 2027 末约 100 特权人
NY RAISE 权重盗窃协议 (2027-01)0.70 准备强制协议 + 72h 盗窃报告

63% 民调: SL5 不会自愿发生 — 支出在达成 SL5 前上升。

置信度:


12. 模态 — US–China 护栏对话 P ≈ 0.50

结果P证据
危机后 12 月内 第一轨道会晤0.502026-05 北京:同意重启;Bessent 4–8 周窗口
第二轨道 → 第一轨道 红队/非国家行为体访问文本0.35Brookings–CISS 术语手册;2026 护栏范围
第二届日内瓦式会议0.452024-08 承诺及时第二轮未公开举行 — 重启 ≠ 成功

日内瓦 2024-05-14(已核实):坦诚交流;无联合声明;美方提滥用;中方提出口管制 (NSC Watson 声明Reuters)。

护栏 ≠ 条约: 范围 = 最佳实践非国家行为体外国公民访问 — 非相互训练冻结 (research_us_china_ai_dialogues.md §2.3;research_ai_pause_advocacy_playbook.md §1.2D)。

置信度:


13. 模态 — 正式 US–China AI 条约 P ≈ 0.04–0.08

条约类型P(至 2030)阻碍
训练 FLOP 上限 + 验证0.04–0.06无 HEM 成熟度;22% 信 $100B 下 6 月 SL5 — 验证缺口
权重不扩散条约0.05–0.08日内瓦死胡同;巴黎 2025 美国未签;印度 2026 发展框架
相互训练冻结<0.02剧本:单方面暂停 = 战略自杀叙事

多边背景: 布莱切利 2023 双方签原则;首尔 2024 中方签部长级;巴黎 2025 中方签、美国 — 碎片化 (research_international_ai_governance_platforms.md)。

历史类比: NPT 历时数十年;冷战期间美苏条约停止计算竞赛 — 出口管制 + 间谍,非暂停。

置信度: 低–中(低概率本身高置信)


14. 模态 — 动能打击 / 数据中心攻击 P < 0.02

主张: P(美国执行对中方 AI 数据中心动能打击 | 盗窃危机) <0.02;P(严肃内部讨论) ~0.15–0.25

参考类教训
Stuxnet (2010)罕见动能邻近网络行动 — 美以归因;大规模重复 (CFR Cyber Tracker;Forescout:OT 恶意软件仍罕见)
国家网络行动 2005–22间谍主导;CFR:77% 疑似行动来自中/俄/伊/朝 — 多为外泄、DDoS,非炸弹
AI 2027讨论打击;情景非预测
台湾 / TSMC独立尾部;非节点 3 模态

为何讨论但不执行: 升级阶梯至热战;中方二次打击;TSMC 供应链相互毁灭;网络报复优先 (AI 2027 安全预测:破坏 2027 ramp)。

置信度: 低–中 (<0.02 执行);中 (「讨论过」)


15. 模态 — 美国单方面训练放缓 P ≈ 0.08

行动者P(单方面暂停 >30d)证据
前沿实验室0.05–0.08Anthropic RSI 文:仅多边验证下暂停 — 不存在
美国行政0.06–0.10Trump EO 2026:自愿 30 天审查,非上限
美国国会<0.05Cruz 暂停条款 99–1 删除;国安鹰派反暂停

盗窃危机效应: 更常加速训练(怕差距闭合)而非放缓 — 见尾部 T3。

置信度: 中–高


16. 行动者决策表(完整)

行动者决策菜单P(结果 | 模态)证据 / 类比置信度
美国行政(a) BIS 模型/芯片规则;(b) DPA 数据中心征用;(c) 扩大自愿审查;(d) 护栏重启P(出口管制扩张)=0.70;P(DPA 征用)=0.08;P(护栏会晤)=0.50Fable;EO 2026-06;北京 2026-05
美国国会(a) Banks/GAAIA 审计 + 盗窃报告;(b) 明确盗窃制裁;(c) 训练上限P(盗窃报告法)=0.40;P(训练上限)=<0.05Banks 信 2026-06;GAAIA 草案
美国 IC / 网络司令部(a) 反情报激增;(b) 对中方 AI 进攻性网络;(c) 动能选项文件P(进攻性网络)=0.55;P(动能)=<0.02Stuxnet 罕见;AI 2027 破坏 ramp低–中
前沿实验室(a) WSL 支出 2×;(b) 政府共址;(c) 继续训练;(d) 条件暂停 rhetoricP(支出 2×)=0.75;P(停训)=0.08RAND;Anthropic RSI
中国(a) 外泄/继续追平;(b) CDZ 集中化;(c) 护栏对话;(d) 开放权重 PRP(外泄尝试 | C5+)=0.65;P(条约)=0.04–0.08AI 2027;DeepSeek/Z.ai 叙事
欧盟 / 盟友(a) 主权 AI;(b) 对齐美国出口体制;(c) 因美国单边主义分裂P(主权 AI 支出)=0.60;P(完全对齐)=0.45Fable 一夜切断欧盟反应
多边论坛UN Global Dialogue 2026-07;日内瓦 2027 峰会P(约束性盗窃条约)=<0.05GDC 非军事;巴黎分裂低–中
公众 / 市场国安框架;非 x-risk 暂停运动P(主流 >2 月)=0.35 给定 E1FLI 2023 消退低–中

17. 尾部分支 T1–T4

尾部描述P(分支 | C5+ 危机)关键驱动p(doom) 通道
T1 — 动能 / 热战美国或盟友对 AI 基础设施动能打击中方报复升级至常规冲突0.02–0.04AI 2027 2027-08 选项;台湾耦合;物理打击 Stuxnet 级罕见大国战争 +2–5pp 灭绝
T2 — 真正条约双边训练限制 + 部分验证 (HEM 试点)0.04–0.08Slowdown Ending「The Deal」;需验证 R&D + 政治窗口协调失败 −2–4pp
T3 — 竞赛加速DPA + IC 预算激增;明确「永不暂停」国安叙事;中方动员0.15–0.25条约模态竞争者;盗窃闭合差距 → 恐慌;Fable 先例政府闸门放缓失齐 +1–3pp 速度;战争 +0.5–1pp
T4 — 盟友分裂欧盟/英/加因美国出口过度脱钩;中方获外交楔子0.10–0.18Fable 全球关停;Carney/Tugendhat 主权声明;巴黎 2025 分裂协调 +0.5–1pp;间接失齐

分支卫生: T1∪T3 重叠 — 建模为相关 (ρ ~0.3) 非独立求和。


18. 历史类比(人类响应参考类)

事件日期发生了什么政策结果对节点 3 的教训
曼哈顿间谍1940sKlaus Fuchs 等加固;美国单方面核停内部人 + 国家行为体击败实验室 opsec
Stuxnet2010美以网络破坏伊离心机条约;网络域升级动能邻近网络罕见;偏好炸弹
SolarWinds2020俄 SVR 供应链间谍制裁;美国软件暂停间谍 → 加固,非行业停
芯片出口管制2022–26BIS 分层竞赛框架主导管制默认;对话边车
日内瓦 AI 对话2024-05-14第一轨道 #1联合声明对话便宜;条约
Fable/Mythos 禁令2026-06EAR 对已部署 API约 7/1 部分恢复模型出口管制已真 — 盗窃响应部分预部署

19. Fable/Mythos 出口禁令 — 活跃模态先例

2026-06 序列 (Anthropic_Fable_Mythos_export_ban_2026_深度解读.md):

  1. 6/9 Fable/Mythos 发布 → 6/12 商务部视同出口指令(外国公民)→ 全球下架
  2. 6/26 Mythos 部分白名单(约 100 美国关键基础设施组织)
  3. ~7/1 Anthropic 安全承诺后限制解除 (BBC;BankInfoSecurity)

节点 3 含义:

含义对先验的影响
政府可在权重盗窃下召回已部署前沿模型C5 前出口管制 P
越狱触发,非盗窃E4 触发 live — 节点 3 可能合并出口管制轨道
政府门控分级发布(白名单)模态部署管制,非训练
盟友主权震惊T4 盟友分裂
Dario FAA 式强制测试 6/10 → 禁令 6/12实验室条件暂停 rhetoric 运营停

20. US–China 对话证据(日内瓦 + 2026 重启)

第一轨道会晤清单:

  • 2023-11 旧金山:建立机制
  • 2024-05-14 日内瓦: 迄今唯一正式第一轨道会晤 — 无交付物
  • 2024-08: 同意「及时」第二轮 — 未公开举行
  • 2026-05 北京: Trump–Xi 同意重启;Bessent:护栏、非国家行为体、4–8 周未确认日程

议程错位: 美 — 灾难性风险 + 滥用;中 — 解除芯片管制 + UN 中心性。盗窃危机强化美方鹰派;除非捆绑半导体让步,削弱中方限训激励。

P(护栏对话 | 模态) = 0.50 反映重启压力,非条约概率


21. 国际治理 — 条约尾部为何薄

平台2024–26 信号含义
巴黎 2025美国未签部长级美国不会经峰会绑定
首尔 2024中方跳过部长级安全联盟中方
印度 202688 签署国;主权 AI全球南方反冻结
UN GDC / Dialogue非军事;2026-07 日内瓦权重验证授权
REAIM 军事 AI中方未签 Blueprint军事 AI 与民用分裂

权重验证 (AI 2027 附录 S):HEM / 计算暂停 / AI 测谎 — 2026 均不成熟。尾部 T2硬件进展;暂停剧本放 3–5 年中期。


22. 暂停剧本 — 为何模态 ≠ 暂停

来自 research_ai_pause_advocacy_playbook.md

杠杆2026 可行?节点 3 角色
计算出口管制 — 遏制中方模态核心
训练 FLOP 上限联邦模态
多边验证条约 — 缺 7–9 项前提仅 T2
自愿前沿承诺无牙首尔 2024
Anthropic 条件暂停仅 rhetoric预期,非承诺

联盟: 国安鹰派 + 大厂在盗窃响应上击败暂停阵营 — 竞赛加速 (T3) 比放缓 (0.08) 更可能。


23. p(doom) — 条件抬升(地缘政治 + 协调)

定义切片: 来自节点 3 分支的 ΔP(约 2050 人类灭绝),主要经大国战争暂停协调失败速度 → 失齐与节点 4 失齐链重复计数。

23.1 Hanson 析取通道

P(灭绝) ⊃ P(AI 赋能大国战争) + P(失齐 | 竞赛加速)

节点 3 喂入 AI 战争桶并提高 P(无有效暂停) 给节点 4。

23.2 条件抬升(工作值 — 在 my pdoom 校准)

分支vs 基线的 ΔP(2050 前灭绝)机制置信度
模态+0.5–1.5pp出口管制 + 支出暂停;护栏;轻微加速
T3 竞赛加速+1–3pp(相对模态增量)DPA;IC 进攻性网络;明确永不暂停
T1 动能若触发 +2–5pp热战尾部;低 P
T2 条约−2–4pp罕见;削减协调关键
T4 盟友分裂+0.5–1pp削弱美国主导咽喉低–中

合并尾部 T3∪T1(相关): 若双双升级,相对基线 +3–8pp — 与上级文档摘要一致。

23.3 协调关键与节点 4 链接

节点 3 结果对节点 4 的影响
模态P(协调暂停) ;保密评估 → 吹哨燃料
T3P(灭绝 | E, 模态) 经速度 ↑ 1–2pp
T2P(强制停训 | 对齐恐慌) — 罕见

Rob Miles 关键: 警告弹稀少 — 盗窃危机消耗政治带宽在中方,非对齐

23.4 重复计数防护

  • 不要在无条件下同时加模态节点 3完整节点 4 失齐链
  • AI 战争桶若与同一冲突的失齐重叠 — 按情景树加权

24. 下游效应(下一节点先验)

若模态若 T3若 T2
WSL4 支出制度化;训练 FLOP OpenBrain–政府融合叙事验证 R&D ;前沿慢 3–6 月
节点 4:更多保密评估,P(停训)不变节点 4:对齐恐慌被赛过节点 4:停训更可信
节点 2 CBRN:解耦 — 国安 ≠ 生物筛查芯片走私 出口管制配对对话
欧盟主权 AI加速中方开放权重外交HEM 试点获资

25. 可证伪条件

观察含义
批准的 US–CN 训练限制条约含验证,至 2030T2 模态错;条约 P
≥2 前沿实验室盗窃新闻后公开停训 >90d单方面放缓 P 过低
C5+ 达成,至 2030 可信盗窃尝试尝试 P 过高;开放权重降值超预期
公开确认 2 小时完整外泄盗窃 P 过低;重审安全模型
美国对中方 AI DC 动能打击T1 尾部 — 上调
盗窃后 12 月内出口管制扩张模态出口 P 过高
2026 重启承诺后至 2029 护栏会晤护栏 P 过高

26. 置信度摘要

主张置信度
锚定 C5+ ~2028,非 2027 年 2 月中–高
P(2 小时完整盗窃)
P(2030 前国家尝试) 中高 (~65%) (78% 专家民调)
模态 = 出口管制 + 支出,暂停/条约中–高
动能 <0.02低–中
条约 0.04–0.08
精确分支概率
条件 p(doom) 抬升(需 主文混合模型 校准)

27. 外部来源

28. 仓库来源

  • (内部笔记)
  • (内部笔记)
  • (内部笔记)
  • (内部笔记)
  • (内部笔记)
  • (内部笔记)
  • (内部笔记)
  • (内部笔记) (附录 5 Security Forecast)
  • (内部笔记)
  • (内部笔记)