← 返回

p(doom) 证据 — 节点 5:开源权重与篡改

2026年7月5日

证据索引 · English · 主文

每条格式:主张 · 理由 · 证据 · 类比 · 什么情况下会改 · 置信度(高/中/低)。


上级: 节点 5 权重篡改


P = 0.88 — 2028 年前无联邦开放权重禁令

主张: 美国在 2028 年前不会将前沿级模型权重的公开发布刑事化或全面禁止。

理由: Meta/LMSYS 生态、华盛顿「创新 + 对华竞争」叙事、特朗普 EO 14409 亲部署立场;Fable 禁令针对对敌 视同出口(deemed export),而非一般意义上的开放发布。Cruz 联盟以 99–1 否决 州级 监管禁令——联邦层面的开放权重禁令比训练上限更不可能。

证据:

  • (内部笔记) §1.2–1.3
  • (内部笔记) — 出口管制 ≠ 开放权重禁止
  • Meta Llama 4 开放发布策略(2025–26 行业模式)
  • (内部笔记) — 中国开放权重公关(DeepSeek)

类比: 1990 年代加密出口管制——范围收窄,从未禁止开放密码学研究。

什么情况下会改: 两党提出禁止 >X 参数开放发布的法案,且业内分裂(不只是 Anthropic/Google)。

置信度: H


P = 0.55 — 自愿/监管型模型文档(欧盟 AI 法案 GPAI)

主张: 到 2028 年,主要开放模型在欧盟 AI 法案 / 行为准则下面临 文档义务 + 部分评估义务

理由: 欧盟 AI 法案适用于包括开放模型在内的 GPAI(通用目的 AI)提供者;2025–26 行为准则;这与禁止权重不是一回事。

证据:

  • (内部笔记) 欧盟执法相关行
  • 欧盟 AI 法案 GPAI 义务(2024–25 框架)

什么情况下会改: 欧盟明确将开放权重排除在所有 GPAI 义务之外。

置信度: M


P = 0.35 — Fable 级出口管制针对特定开放模型

主张: 美国用 EAR/视同出口限制对 特定前沿模型访问(而非禁止开放训练)。

理由: 已经发生 — 2026 年 6 月 Fable/Mythos 先例,BIS 可对模型访问采取行动。P<0.5 因为范围窄、针对具体模型,不是类别禁令。

证据:

置信度: M–H(先例已存在)


P = 0.15 — 前沿安全–能力结构性耦合

主张: ≥1 家主要实验室发布的前沿模型,若移除安全方向会 可测地 损害 MMLU/智能体基准,且规模足够大。

理由: 你的 Qwen HarmBench 工作显示 一个帕累托点(Type-B LoRA)——尚未成为前沿普遍现象。激励弱:开放权重竞赛奖励安全与能力解耦。CAIS RepE 线是研究而非产品默认。

证据:

  • academia_application/cais_meeting_july2026/05_ai_safety_views.md — Type-B LoRA
  • code/typebits/ — 开放模型上 steering 与能力可分离
  • Arditi 等,「Refusal in Language Models Is Mediated by a Single Direction」

什么情况下会改: 你或 CAIS 在 70B+ 规模发表耦合结果,且第二家实验室复现。

置信度: L–M


P = 0.05 — 强制性防篡改训练标准(联邦)

主张: 具有约束力的美国规则:前沿训练须通过防篡改评估。

理由: 无立法联盟;比 CBRN(化学/生物/放射/核)筛查更难;Meta 反对。低于暂停概率 P(<0.05)。

证据:

  • (内部笔记) — 暂停已死
  • 节点 1 联邦上限 <0.05

置信度: H(指「极 unlikely」)


P = 0.18 — T5-B:开放权重加速 CBRN/生物尾部

主张: 在开放权重为模态路径的条件下,生物灭绝尾部质量中约 18% 经篡改后的开放模型(越狱 + 本地微调)路由。

理由: WMDP unlearning 绕过在你拥有权重时更容易;与节点 2 TAIL-C(套利)相关。非独立。

证据:

  • (内部笔记) §2.1 越狱
  • (内部笔记) TAIL-C
  • CUT/WMDP unlearning 文献

什么情况下会改: 闭源 API 模型在事件数据中 滥用率高于 开放篡改模型。

置信度: L–M


P = 0.12 — T5-A:重大事件后权重许可制

主张:12% 概率:高调攻击 → 欧盟/美国 许可制 管理超过阈值的发布。

理由: 小于生物筛查联盟;科技业分裂(Meta vs Anthropic)。欧盟比美国更可能。

证据:

  • SB 1047 否决 — 硬性上限失败
  • 欧盟 Biotech Act 筛查路径比 AI 权重禁令政治上更可行
  • 节点 1 就业 T3 审查法 0.08 — 量级相近

置信度: L–M