每条格式:主张 · 理由 · 证据 · 类比 · 什么情况下会改 · 置信度(高/中/低)。
上级: 节点 5 权重篡改
P = 0.88 — 2028 年前无联邦开放权重禁令
主张: 美国在 2028 年前不会将前沿级模型权重的公开发布刑事化或全面禁止。
理由: Meta/LMSYS 生态、华盛顿「创新 + 对华竞争」叙事、特朗普 EO 14409 亲部署立场;Fable 禁令针对对敌 视同出口(deemed export),而非一般意义上的开放发布。Cruz 联盟以 99–1 否决 州级 监管禁令——联邦层面的开放权重禁令比训练上限更不可能。
证据:
- (内部笔记) §1.2–1.3
- (内部笔记) — 出口管制 ≠ 开放权重禁止
- Meta Llama 4 开放发布策略(2025–26 行业模式)
- (内部笔记) — 中国开放权重公关(DeepSeek)
类比: 1990 年代加密出口管制——范围收窄,从未禁止开放密码学研究。
什么情况下会改: 两党提出禁止 >X 参数开放发布的法案,且业内分裂(不只是 Anthropic/Google)。
置信度: H
P = 0.55 — 自愿/监管型模型文档(欧盟 AI 法案 GPAI)
主张: 到 2028 年,主要开放模型在欧盟 AI 法案 / 行为准则下面临 文档义务 + 部分评估义务。
理由: 欧盟 AI 法案适用于包括开放模型在内的 GPAI(通用目的 AI)提供者;2025–26 行为准则;这与禁止权重不是一回事。
证据:
- (内部笔记) 欧盟执法相关行
- 欧盟 AI 法案 GPAI 义务(2024–25 框架)
什么情况下会改: 欧盟明确将开放权重排除在所有 GPAI 义务之外。
置信度: M
P = 0.35 — Fable 级出口管制针对特定开放模型
主张: 美国用 EAR/视同出口限制对 特定前沿模型 的 访问(而非禁止开放训练)。
理由: 已经发生 — 2026 年 6 月 Fable/Mythos 先例,BIS 可对模型访问采取行动。P<0.5 因为范围窄、针对具体模型,不是类别禁令。
证据:
- (内部笔记)
- 节点 3 盗窃 触发器 E2
置信度: M–H(先例已存在)
P = 0.15 — 前沿安全–能力结构性耦合
主张: ≥1 家主要实验室发布的前沿模型,若移除安全方向会 可测地 损害 MMLU/智能体基准,且规模足够大。
理由: 你的 Qwen HarmBench 工作显示 一个帕累托点(Type-B LoRA)——尚未成为前沿普遍现象。激励弱:开放权重竞赛奖励安全与能力解耦。CAIS RepE 线是研究而非产品默认。
证据:
academia_application/cais_meeting_july2026/05_ai_safety_views.md— Type-B LoRAcode/typebits/— 开放模型上 steering 与能力可分离- Arditi 等,「Refusal in Language Models Is Mediated by a Single Direction」
什么情况下会改: 你或 CAIS 在 70B+ 规模发表耦合结果,且第二家实验室复现。
置信度: L–M
P = 0.05 — 强制性防篡改训练标准(联邦)
主张: 具有约束力的美国规则:前沿训练须通过防篡改评估。
理由: 无立法联盟;比 CBRN(化学/生物/放射/核)筛查更难;Meta 反对。低于暂停概率 P(<0.05)。
证据:
- (内部笔记) — 暂停已死
- 节点 1 联邦上限 <0.05
置信度: H(指「极 unlikely」)
P = 0.18 — T5-B:开放权重加速 CBRN/生物尾部
主张: 在开放权重为模态路径的条件下,生物灭绝尾部质量中约 18% 经篡改后的开放模型(越狱 + 本地微调)路由。
理由: WMDP unlearning 绕过在你拥有权重时更容易;与节点 2 TAIL-C(套利)相关。非独立。
证据:
- (内部笔记) §2.1 越狱
- (内部笔记) TAIL-C
- CUT/WMDP unlearning 文献
什么情况下会改: 闭源 API 模型在事件数据中 滥用率高于 开放篡改模型。
置信度: L–M
P = 0.12 — T5-A:重大事件后权重许可制
主张: 约 12% 概率:高调攻击 → 欧盟/美国 许可制 管理超过阈值的发布。
理由: 小于生物筛查联盟;科技业分裂(Meta vs Anthropic)。欧盟比美国更可能。
证据:
- SB 1047 否决 — 硬性上限失败
- 欧盟 Biotech Act 筛查路径比 AI 权重禁令政治上更可行
- 节点 1 就业 T3 审查法 0.08 — 量级相近
置信度: L–M