← 返回

中国不太关心 AI safety?——两个「安全」的故事

2026年6月29日

承认:我好几年没有回中国了,所以这篇文章也大部分是二手或者三手信息。

在美国的大家基本认为中国现在不太关心 AI safety。但是我和国内的业内人士聊的时候,他们会说:国内其实都在做 AI 安全,只是比较低调;而且中国人对政府更有信心——政府想管什么,top-down 也能很快落地。


我们得先对齐:AI safety 的定义

在 Berkeley、Anthropic、MATS 的语境里,AI safety 通常指:

  • 模型失控、欺骗、自我改进(RSI)
  • 存在风险(x-risk)、loss of control
  • 独立评估机构、RSP、superalignment
  • 民间 pause 运动、FLI 公开信

在中国主流公共话语里,AI 安全更常指:

  • 内容合规(不能煽动、不能危害国家安全)
  • 深度伪造、诈骗(公众民调里排第一)
  • 数据安全、算法备案、生成式 AI 服务安全标准
  • 「科技伦理」审查——增进人类福祉、可控可信

运营上可以都很认真。目标不同。 一边优化的是技术失控与目标对齐;一边优化的是国家控制和社会稳定。所以更准确的说法不是「中国不在乎安全」,而是:两边说的可能不是同一种 safe——至少,公众和大部分产业叙事还不把 Western alignment 当优先议题。


中国已经做了什么

国内业内说「其实都在做」——如果指的是监管型 AI 安全,这话大体成立。中国建了全球最完整之一的 GenAI 上市前审查栈:算法推荐规定、深度合成规定、生成式 AI 管理暂行办法、GB/T 45654-2025 服务安全标准。截至 2025 年底,748 个 GenAI 服务完成备案(细节见AI 治理全景图)。

近期还有更具体的动作,包括但不限于:

  • 「清朗·整治 AI 应用乱象」专项行动(中央网信办,2026 年 4 月起,约四个月):分两阶段——先治大模型备案、安全审核、训练语料、数据投毒、生成合成标识等源头问题;再治虚假信息、「数字泔水」、假冒仿冒、侵害未成年人、网络水军等。第一阶段公开数字:处置违规 AI 产品 1.4 万余款,清理违法违规信息 600 余万条
  • 《人工智能拟人化互动服务管理暂行办法》(网信办等五部门,2026 年 4 月公布,7 月 15 日施行):管模拟人格、持续情感互动的服务——显著标识「这是 AI」、未成年人保护、安全评估与算法备案、极端情绪干预等。这是内容/产品形态监管,不是 alignment eval。
  • 2025 年 2 月成立 CnAISDA;2025 年 4 月政治局集体学习 AI,通稿提「前所未有的风险和挑战」;2026 年 5 月十部门《人工智能科技伦理审查与服务办法(试行)》

从「别让不合规模型/应用乱上线」这个角度,中国可能是全球唯一对 GenAI 有强制上市前审查的大国——比美国激进。只是审查标准是合规 + 可控,不是「通过了 deceptive alignment eval」。


民众确实不太恐慌

数据支持这一点,而且差距很大。

维度中国美国
认为 AI 净收益大于危害80–83%(Ipsos 2024)39%
更担忧还是更兴奋高采用、高热情;仅 5.3% 认为完全不受影响~50% 更担忧(Pew 2025)
首要关切深度伪造/诈骗 71.3%失业、虚假信息、隐私
谁该负责政府和研究者更分散;对企业信任低(Gallup:仅 31% 信任企业用 AI)

这是发达国家 vs 新兴经济体鸿沟的一部分:中国、印尼、泰国最乐观;美国、荷兰、加拿大最谨慎。Edelman 2024:发展中国家整体机构信任 63%,发达国家 49%

文化因素也不只是「信政府」四个字能概括:

  • 技术民族主义:「AI 中国时刻」——落后就要挨打,先发展是默认选项
  • 焦虑对象不同:怕被骗、怕失业,不是怕超级智能失控
  • 媒体生态:x-risk 叙事弱;DeepSeek 之后更多是产业自豪,不是 pause 讨论

全球 AI 研究者里,开放式问题中把存在风险列为首要关切的也只有约 3%——中国只是在这条光谱的更极端一端。


top-down 快?

业内常说:政府想管,就能很快落地。经验上,对,但要看管什么

确实快的: 内容与部署。备案、下架、整改、封号、清朗专项——执行力比美国联邦层面强得多。拟人化互动办法从公布到施行也就几个月。专项行动几个月就能报出「处置 1.4 万款产品」这种数字。这不是空话。

没那么快 / 容易误读的:

  • CSET 对 GB/T 45654-2025 的评注:标准很细,但在「内卷式竞争」下执行力度存疑——企业先上车后补票并不少见。
  • 多部门协调、政策不确定性:top-down 也有慢和乱,不是一条线打到底。
  • CnAISDA 的 Carnegie 分析写得很直白:其主要功能是国际代表,不是像英美 AISI 那样独立测试前沿模型;CCP 支持它,很大一块是全球参与的抱负,而不只是 deeply held 的 alignment 关切。
  • 紧急停止权中国有,但触发条件是政府定义的灾难,不是 METR 意义上的 autonomy eval。

所以「top-down 快」作为内容治理经验成立;把它读成「alignment / loss-of-control 问题也已经管住了」,是偷换概念。


我觉得不够的

如果把尺子换成 Western 意义上的 AI safety——独立研究、可复现评估、对 frontier 能力的公开压力——缺口很明显,而且不只在「政府有没有发文件」。

对研究者:

  • 独立 alignment / x-risk 社区极小;民间 AI safety 组织几乎为零,主要是信通院、清华 CISS 等体制内或准体制研究。
  • 议题容易被读成地缘政治:「帮美国拖慢中国」。公开做 deceptive alignment、RSI、loss of control,空间窄、叙事成本高。
  • 缺少像 METR、Apollo、独立 red-team 那样、能对前沿闭源/开源模型做可引用外部评估的机构生态。CnAISDA 不等于 AISI。

对创业者:

  • 合规负担重(备案、标识、内容审核、拟人化新规),但产品激励几乎全在增长与应用,很少有人能靠「alignment 产品」活下来。
  • 安全团队的日常是内容过滤、拒答、数据合规——必要,但和「模型是否会策略性欺骗」不是同一工种。
  • 融资与叙事:safety-as-mission 的创业故事在国内很难讲;在美国也不容易,但至少有 EA/philanthropy 那条旁路。中国这条旁路基本不存在。

精英层在升温(姚期智、薛澜、付莹等通过 CnAISDA 进入国际前沿风险对话),和 Reddit 式公众恐慌、和独立实验室式研究基础设施,仍然不是一回事。


一张对照表

                    西方 alignment safety          中国监管型 safety
                    ─────────────────────          ──────────────────
公众关心度           中等(jobs > x-risk)           低(deepfake > x-risk)
民间组织             多(METR, FLI…)               几乎没有
政府行动             弱(美国去监管中)              强(备案、审查、专项行动)
真正在优化什么        技术失控                      社会稳定 + 产业竞争
2025+ 变化            行业 RSP 自律                   CnAISDA、清朗、拟人化办法、伦理审查

结语

我希望中美有更多讨论——先把「AI safety」对齐成同一种意思,再一起研究。两个占全球大部分前沿算力的国家,如果连词都对不上,后面的合作和互信都无从谈起。


延伸阅读

Sources: Ipsos AI Monitor 2024; Pew Research 2025; Edelman Trust Barometer 2024; Carnegie Endowment, How Some of China’s Top AI Thinkers Built Their Own AI Safety Institute (Jun 2025); CSET, GB/T 45654-2025 GenAI Safety Standard; 中央网信办,「清朗·整治 AI 应用乱象」专项行动 (2026-04); 网信办等,《人工智能拟人化互动服务管理暂行办法》 (2026-04); 工信部等,《人工智能科技伦理审查与服务办法(试行)》(2026-05).