承认:我好几年没有回中国了,所以这篇文章也大部分是二手或者三手信息。
在美国的大家基本认为中国现在不太关心 AI safety。但是我和国内的业内人士聊的时候,他们会说:国内其实都在做 AI 安全,只是比较低调;而且中国人对政府更有信心——政府想管什么,top-down 也能很快落地。
我们得先对齐:AI safety 的定义
在 Berkeley、Anthropic、MATS 的语境里,AI safety 通常指:
- 模型失控、欺骗、自我改进(RSI)
- 存在风险(x-risk)、loss of control
- 独立评估机构、RSP、superalignment
- 民间 pause 运动、FLI 公开信
在中国主流公共话语里,AI 安全更常指:
- 内容合规(不能煽动、不能危害国家安全)
- 深度伪造、诈骗(公众民调里排第一)
- 数据安全、算法备案、生成式 AI 服务安全标准
- 「科技伦理」审查——增进人类福祉、可控可信
运营上可以都很认真。目标不同。 一边优化的是技术失控与目标对齐;一边优化的是国家控制和社会稳定。所以更准确的说法不是「中国不在乎安全」,而是:两边说的可能不是同一种 safe——至少,公众和大部分产业叙事还不把 Western alignment 当优先议题。
中国已经做了什么
国内业内说「其实都在做」——如果指的是监管型 AI 安全,这话大体成立。中国建了全球最完整之一的 GenAI 上市前审查栈:算法推荐规定、深度合成规定、生成式 AI 管理暂行办法、GB/T 45654-2025 服务安全标准。截至 2025 年底,748 个 GenAI 服务完成备案(细节见AI 治理全景图)。
近期还有更具体的动作,包括但不限于:
- 「清朗·整治 AI 应用乱象」专项行动(中央网信办,2026 年 4 月起,约四个月):分两阶段——先治大模型备案、安全审核、训练语料、数据投毒、生成合成标识等源头问题;再治虚假信息、「数字泔水」、假冒仿冒、侵害未成年人、网络水军等。第一阶段公开数字:处置违规 AI 产品 1.4 万余款,清理违法违规信息 600 余万条。
- 《人工智能拟人化互动服务管理暂行办法》(网信办等五部门,2026 年 4 月公布,7 月 15 日施行):管模拟人格、持续情感互动的服务——显著标识「这是 AI」、未成年人保护、安全评估与算法备案、极端情绪干预等。这是内容/产品形态监管,不是 alignment eval。
- 2025 年 2 月成立 CnAISDA;2025 年 4 月政治局集体学习 AI,通稿提「前所未有的风险和挑战」;2026 年 5 月十部门《人工智能科技伦理审查与服务办法(试行)》。
从「别让不合规模型/应用乱上线」这个角度,中国可能是全球唯一对 GenAI 有强制上市前审查的大国——比美国激进。只是审查标准是合规 + 可控,不是「通过了 deceptive alignment eval」。
民众确实不太恐慌
数据支持这一点,而且差距很大。
| 维度 | 中国 | 美国 |
|---|---|---|
| 认为 AI 净收益大于危害 | 80–83%(Ipsos 2024) | 39% |
| 更担忧还是更兴奋 | 高采用、高热情;仅 5.3% 认为完全不受影响 | ~50% 更担忧(Pew 2025) |
| 首要关切 | 深度伪造/诈骗 71.3% | 失业、虚假信息、隐私 |
| 谁该负责 | 政府和研究者 | 更分散;对企业信任低(Gallup:仅 31% 信任企业用 AI) |
这是发达国家 vs 新兴经济体鸿沟的一部分:中国、印尼、泰国最乐观;美国、荷兰、加拿大最谨慎。Edelman 2024:发展中国家整体机构信任 63%,发达国家 49%。
文化因素也不只是「信政府」四个字能概括:
- 技术民族主义:「AI 中国时刻」——落后就要挨打,先发展是默认选项
- 焦虑对象不同:怕被骗、怕失业,不是怕超级智能失控
- 媒体生态:x-risk 叙事弱;DeepSeek 之后更多是产业自豪,不是 pause 讨论
全球 AI 研究者里,开放式问题中把存在风险列为首要关切的也只有约 3%——中国只是在这条光谱的更极端一端。
top-down 快?
业内常说:政府想管,就能很快落地。经验上,对,但要看管什么。
确实快的: 内容与部署。备案、下架、整改、封号、清朗专项——执行力比美国联邦层面强得多。拟人化互动办法从公布到施行也就几个月。专项行动几个月就能报出「处置 1.4 万款产品」这种数字。这不是空话。
没那么快 / 容易误读的:
- CSET 对 GB/T 45654-2025 的评注:标准很细,但在「内卷式竞争」下执行力度存疑——企业先上车后补票并不少见。
- 多部门协调、政策不确定性:top-down 也有慢和乱,不是一条线打到底。
- CnAISDA 的 Carnegie 分析写得很直白:其主要功能是国际代表,不是像英美 AISI 那样独立测试前沿模型;CCP 支持它,很大一块是全球参与的抱负,而不只是 deeply held 的 alignment 关切。
- 紧急停止权中国有,但触发条件是政府定义的灾难,不是 METR 意义上的 autonomy eval。
所以「top-down 快」作为内容治理经验成立;把它读成「alignment / loss-of-control 问题也已经管住了」,是偷换概念。
我觉得不够的
如果把尺子换成 Western 意义上的 AI safety——独立研究、可复现评估、对 frontier 能力的公开压力——缺口很明显,而且不只在「政府有没有发文件」。
对研究者:
- 独立 alignment / x-risk 社区极小;民间 AI safety 组织几乎为零,主要是信通院、清华 CISS 等体制内或准体制研究。
- 议题容易被读成地缘政治:「帮美国拖慢中国」。公开做 deceptive alignment、RSI、loss of control,空间窄、叙事成本高。
- 缺少像 METR、Apollo、独立 red-team 那样、能对前沿闭源/开源模型做可引用外部评估的机构生态。CnAISDA 不等于 AISI。
对创业者:
- 合规负担重(备案、标识、内容审核、拟人化新规),但产品激励几乎全在增长与应用,很少有人能靠「alignment 产品」活下来。
- 安全团队的日常是内容过滤、拒答、数据合规——必要,但和「模型是否会策略性欺骗」不是同一工种。
- 融资与叙事:safety-as-mission 的创业故事在国内很难讲;在美国也不容易,但至少有 EA/philanthropy 那条旁路。中国这条旁路基本不存在。
精英层在升温(姚期智、薛澜、付莹等通过 CnAISDA 进入国际前沿风险对话),和 Reddit 式公众恐慌、和独立实验室式研究基础设施,仍然不是一回事。
一张对照表
西方 alignment safety 中国监管型 safety
───────────────────── ──────────────────
公众关心度 中等(jobs > x-risk) 低(deepfake > x-risk)
民间组织 多(METR, FLI…) 几乎没有
政府行动 弱(美国去监管中) 强(备案、审查、专项行动)
真正在优化什么 技术失控 社会稳定 + 产业竞争
2025+ 变化 行业 RSP 自律 CnAISDA、清朗、拟人化办法、伦理审查
结语
我希望中美有更多讨论——先把「AI safety」对齐成同一种意思,再一起研究。两个占全球大部分前沿算力的国家,如果连词都对不上,后面的合作和互信都无从谈起。
延伸阅读
- AI 治理全景图 — 中国监管栈 vs 美国真空
- 怎样让政府真正关心 AI 监管 — 公众支持与政治结果的脱节
- 个人能怎么帮 AI 安全 — 中国的民间社会缺口
Sources: Ipsos AI Monitor 2024; Pew Research 2025; Edelman Trust Barometer 2024; Carnegie Endowment, How Some of China’s Top AI Thinkers Built Their Own AI Safety Institute (Jun 2025); CSET, GB/T 45654-2025 GenAI Safety Standard; 中央网信办,「清朗·整治 AI 应用乱象」专项行动 (2026-04); 网信办等,《人工智能拟人化互动服务管理暂行办法》 (2026-04); 工信部等,《人工智能科技伦理审查与服务办法(试行)》(2026-05).