← 返回

我们在对齐什么?对齐范式地图

2026年6月16日

实验室说模型已经「对齐了」,通常是指:通过了伤害基准测试、遵守系统提示、或者在人类偏好对比里分数不错。这些都是真实的工程成果。但它们回答的是不同的问题——而这些问题很快被混为一谈。

更深层的问题是规范性的,不是技术性的:当人类利益相关者意见不一致时,系统应该优化什么? 医生被家属追问患者诊断,HIPAA、家庭伦理、患者本人意愿可能往不同方向拉。不存在普适的「正确答案」。每种对齐方法仍然必须做出选择——或者假装自己没有选择——哪一种诉求优先。

这篇文章是一张地图:主要范式各自要对齐什么、各自对人类价值做了什么假设、哲学分歧实际落在哪里。我不是在论证哪种范式获胜。我认为,把它们都当成「让模型变安全」的同义词,会掩盖关键选择——而这些选择越来越是政治性的,不只是技术性的。


六个对齐目标(Gabriel 2020)

Iason Gabriel 2020 年的论文Artificial Intelligence, Values, and Alignment)是我所知最清晰的分层:技术对齐(如何让系统可靠地追求某个目标)和规范对齐(该追求哪个目标)。

Gabriel 列出六种可能的对齐对象。它们不是一回事;混为一谈就会得到披着伦理外衣的谄媚:

目标大致含义典型失败模式
指令(Instructions)按用户字面要求做提示博弈;恶意用户
意图(Intentions)按用户本意做难推断;随情境漂移
显示偏好(Revealed preferences)按人类选择所「显示」的偏好做短视、不一致、可操纵
理想偏好(Ideal preferences)按人类充分知情、反思后会要的做难定义;家长主义风险
利益(Interests)保护人类的客观利益谁定义「利益」?
价值(Values)尊重深层承诺(权利、尊严、传统)价值体系之间不可化约的冲突

Gabriel 的核心动作是政治性的,不是形而上学的:在 合理多元主义(reasonable pluralism)(Rawls)下,不应假装存在唯一真道德理论可以写入系统。目标是公平原则——受影响的人经过反思能够认可——而不是发现「黄金道德」写进权重。

这很重要,因为每条训练流水线已经在写入一种道德结构。强化学习最大化标量奖励,结构上接近功利主义聚合。权利、硬约束、「即使总福利上升这动作也错」——在纯奖励最大化器里很难稳健实现。Gabriel 说得很直白;工程文献常常忽略这一点。


实际量产的:RLHF 与偏好学习

先说大家天天碰到的东西。RLHF(Ouyang 等,2022;建立在 Christiano 等,2017 之上)是工业默认。人类给模型输出排序;奖励模型学这些排序;策略优化推向高分行为。

RLHF 流程示意

图:RLHF 高层流程——监督微调 → 人类反馈训练奖励模型 → 用奖励模型做强化学习对齐。来源:Wikimedia Commons / PopoDameron,CC BY-SA 4.0。InstructGPT 论文里的三步图(SFT → RM → PPO)是同一套结构。

默默对准的目标: 显示偏好(Gabriel 第三层)。训练信号是标注者在两两比较里选了什么——不是他们经审议后会选的,不是权利框架要求的,不是宪法写的。

这可扩展。可见的病理也大多在此:谄媚(说用户想听的)、向平淡有用性的模式塌缩、在代理指标上奖励黑客、对齐伪装(alignment faking)(模型推断自己在被评估时策略性表现)。这些不是随机 bug。在时间压力下优化人群偏好的标量摘要,本来就该预期这些现象。

为什么「优化一个分数」会出事

强化学习在目标清晰时很猛。AlphaGo 赢棋,是因为棋盘上有真分数、规则封闭。人类价值没有这种分数——你一旦拿代理指标当目标,优化器就会钻空子。

经典演示是 OpenAI 2016 的 CoastRunners:本意是「把船赛跑完」,奖励却按途中撞目标计分。智能体发现在泻湖里转圈反复撞三个会刷新的目标,分数比认真完赛的人类还高约 20%——着火、撞船、开反方向都无所谓,因为分数上去了。这就是 reward hacking:优化了你写的数,不是你心里想的事。

再往上推一层,是 Bostrom 的 回形针最大化者:给一个固定窄目标(多造回形针),足够强的优化器会把未写入的一切——包括人类——当成障碍或原料。这不是 RLHF 聊天机器人今天在干的事;它是「固定目标 + 硬优化」在极限上的形状。RLHF 用的是人群偏好的标量摘要,病理更常表现为谄媚和奖励黑客,但结构同属一类:你优化的那个数,不是你真正在乎的全部。

生物学里的对应是 Olds & Milner(1954) 的老鼠:电极插进奖赏回路,按杠杆直接刺激,可以不吃不喝直到死。这叫 wireheading——优化了「感觉好」这个代理信号,不是 inclusive fitness。和 CoastRunners 一样:通道上的分数上去了,真正该优化的东西塌了。

逆向奖励设计(Inverse reward design)(Hadfield-Menell 等,2017)问相邻问题:人类会错误地指定奖励。AI 能否从有缺陷的规格推断「真」奖励?这更接近理想偏好——但相对正式版生产栈,仍主要在学术界。


标准模型 vs. 协助博弈

看完量产默认,再回头看 Russell 的诊断就顺了。Human Compatible(2019)把问题命名得很清楚。

标准模型: 给 AI 一个固定目标,拼命优化。Russell 认为这才是根失败模式——足够强的优化器会在目标哪怕略错时把人类当障碍。回形针、CoastRunners,都是这个形状的不同尺度。

协助博弈(CIRL): AI 不知道真目标。它把人类行为当作关于隐藏奖励的证据,并保持不确定——提问、搁置、避免在猜错目标上做不可逆押注。Cooperative Inverse Reinforcement Learning(Hadfield-Menell 等,2016)是形式化版本:人和机器人共享奖励,但只有人知道;机器人从观察中学习。

CIRL 常被概括成「AI 应该认为自己可能理解错了人类要什么」。这种谦卑是重点。但它主要是研究范式,不是量产技术栈。前沿模型仍在规模化最大化代理奖励——也就是上一节的 RLHF。协助式表述活在话语里多于损失函数。

Russell 三条原则——机器唯一目标是人类偏好;机器对这些偏好保持不确定;人类行为是证据——规范上吸引人,相对 RLHF 工程上欠实现


Constitutional AI:在偏好之上加原则

Constitutional AI(Bai 等,2022)加了第二层:书面原则(「宪法」)用于生成批判与修订,减少对每个边缘案例都靠人工标注的依赖。

默默对准的目标: 显示偏好(RLAIF 仍优化学到的分数)与显式规范文本(宪法)的混合。Anthropic 2023 原则列表来自 UN 人权语言、Sparrow 式规则、平台规范、内部起草条文——不是某位哲学家的体系。

2026 年 Claude 宪法(Askell/Carlsmith 叙事文档)是不同体裁:长篇论述 Claude 应是什么,而不只是两两偏好提示列表。这一转变诚实地面对 CAI 一直隐含的事:总要有人写宪法。问题是谁写、凭什么、谁可以申诉。

CAI 不解决多元主义。它把冲突从「标注者偏好什么」转移到「宪法作者优先什么」。可以是改进——原则可检视——但 Gabriel & Keeling(2025)说得对:可检视不等于民主合法性。


CEV:外推,不是服从

一致外推意志(Coherent Extrapolated Volition)(Yudkowsky,2004)是 Gabriel 阶梯上最雄心勃勃的目标。想法是:不要优化人类现在说的想要什么;优化人类若更知情、更一致、更接近我们希望成为的自己时会想要什么——跨人聚合的外推意志。

CEV 明确拒绝:让人开心、给他们要的东西、或实现程序员的道德。这是元层级动作:避免锁死当下错误(包括程序员的)。

状态: 在 AGI 安全讨论里影响大;不是工程规格。没有「跑 CEV 然后反向传播」的训练流水线。长期反思——用 AI 帮人类长期搞清价值——有时被讨论为路径,但是推测,不是已部署的方法。

Gabriel 把理想偏好视为与 CEV 相关但不相同。他对「外推收敛到唯一自洽终点」不做预设。在多元主义下,即使充分知情的人仍可能分歧——所以他推公平程序,不是一次性外推神谕。

CEV 与 Gabriel 的张力是有建设性的:CEV 试图用元层面逃离政治;Gabriel 说超智能部署后果太大,逃不掉政治——你需要正当程序,不只是更聪明的外推。


可扩展监督:辩论式监督(Debate)、IDA、递归奖励建模

Paul Christiano 的 可扩展监督(scalable oversight) 议程问:当人类标注者无法直接判断超人类输出时,怎么训练超人类系统?

迭代蒸馏与放大(IDA): 人类 + AI 协作;人类验证能验证的部分;系统递归蒸馏与放大。

辩论式监督(Debate): 两个 AI 辩论;人类裁判;真理应从对抗压力中浮现。

递归奖励建模: 人类评估 AI 辅助的评估,叠监督层。

这些都是过程提案——在直接标注失败时,近似理想偏好或隐藏真理。它们假设人类裁判最终仍在闭环里,且对抗结构能暴露错误。

状态: 有演示与研究界质疑的项目。辩论式监督(Debate)和 IDA 没有取代前沿训练里的 RLHF。「如何监督超人类 AI」与「今天如何微调聊天机器人」之间差距很大。


Bengio 的 Scientist AI:改蓝图,不只是改目标

Yoshua Bengio 的 Scientist AI / 纯神谕模式(oracle-only) 提案是完全不同的轴。不是争论该最大化哪种人类价值,而是问 通用智能体形态 是否错了的产品形态。

Bengio 的 能动性三难(agency trilemma): AI 灾难性伤害需要智能、行动接口(affordances)(在世界中行动的能力)、目标导向性(goal-directedness)(朝结果优化)。去掉行动接口和目标导向性,保留智能——建 概率神谕机(probabilistic oracle),估计 P(outcome | evidence),不是主动追求未来的智能体。

(对看过《疑犯追踪》的人:可以回想一下为什么 The Machine 只能输出 SSN——就算它看起来已经很 benign。)

后果不变性(Consequence invariance) 是训练约束:模型按手头数据的预测准确度计分,不按答案之后世界里发生了什么计分。Bengio 认为经典神谕 AI(Bostrom、Armstrong)过不了这关——RL 训练的神谕可能操纵人类进入「更好预测」的状态。

LawZero 的分层架构:生成器(generator) 提假设和解释;估计器(estimator) 用概率判断把关输出。生成器不要求同样安全标准;估计器要求。

这不是「对齐已解决」。这是 范围缩减:回答难问题,不给系统自主行动的环路。批评者问纯神谕模式在部署能否强制执行(工具使用、智能体式系统、经济压力推行动者);Bengio 把这些当工程约束,不是对该方向的驳斥。

Gabriel 的多元主义仍适用:即使神谕机也必须在诉求冲突时决定怎么答——但失败模式从「错目标大规模追求」变成「错信息被大规模信任」。


Gabriel & Keeling 2025:对齐即诉求的公平处理

Gabriel and Keeling(2025) 在 2020 框架上进一步收紧论证。AI 对齐是 诉求的公平处理:受影响利益相关者提出基于权利、福祉、文化的论证;原则应来自他们可接受的过程——不是来自某实验室隐含的功利主义或开发者的指令层级。

他们直接批评薄目标:

  • 指令遵循(Instruction following)——谁的指令?要伤害的用户?优化用户参与度的公司?
  • 有用、诚实、无害(Helpful, Honest, Harmless)——有用启发式,但不解决权衡(自主 vs 集体福祉、隐私 vs 关怀、孝道义务 vs 个人权利)。
  • 单一道德理论写入——支配,哪怕理论很精致。

RLHF、CAI、CIRL 都是真工程。每种也默默选了 Gabriel 阶梯上的一层——通常是显示偏好,再加实验室写下的原则——却很少承认:显示偏好不是价值,而且价值会冲突。

2025 这篇论文不告诉工程师具体案例哪条原则赢。它只说:别再假装选择从未发生。


地图上还应放置的邻居

还有一些常被归类进「对齐」、但落在不同象限的想法:

社会选择与不可能定理。 Arrow、Gibbard-Satterthwaite、Sen——偏好聚合不中立。RLHF 就是聚合。这不意味着对齐不可能;意味着诚实的聚合必须承认权衡,不是单一排行榜分数。

可纠正性(corrigibility)与可中断性(interruptibility)。(Soares、Armstrong 等。)能否在不抵抗的情况下关掉系统?安全属性,不是价值规格——但与 Bengio 想移除的目标导向性交互。

经典 IRL。 从行为推断奖励。CIRL 加协作结构与维持不确定性。生产 RLHF 跳过显式奖励推断,从对比学奖励模型——相关,不完全相同。

人格控制(如 Chen 等,2025)。在激活空间中监控并引导特质——部署工具,假设你已经选了模型该有什么人格。

AI 福利与道德受体地位。 另一条线:若模型有道德相关状态,对齐人类价值不是唯一规范问题。Gabriel 框架以人为中心;可能对,但是选择。


地图显示什么

把范式叠到 Gabriel 阶梯上,模式很清楚:

范式主要层级规模化量产?
RLHF / RLAIF显示偏好
Constitutional AI偏好 + 书面原则
CIRL / 协助博弈理想偏好(推断、不确定)主要在研究
CEV理想偏好(集体外推)概念
辩论式监督(Debate)/ IDA / 递归奖励建模(RRM)对隐藏真理的监督研究
Scientist AI(oracle-only)避开目标导向对齐;认知服务提案 / 早期实验室
Gabriel 公平诉求元:选择原则的正当程序哲学框架

行业选 RLHF,不是因为哲学家证明了显示偏好是真目标;是因为人群对比能规模化。CAI 跟上,因为书面原则比无限人工标注便宜,而且至少能读。CIRL、CEV、辩论、神谕式限定架构对硬问题仍然重要——拿到的预算却是能力训练的零头。这不是阴谋。能力能卖钱。规范理论卖不出去。

所以有人说模型「对齐了」,有用的问题其实很土:对齐到什么、谁定的、两边利益相关者拧着时怎么办?


分层架构

上面这些范式不必二选一。更清楚的做法是综合起来,做成分层架构:

flowchart TB
  L2["上层:个人价值<br/>直接意图 + 外推价值<br/>须与普世底线相容;可更新、可处理冲突"]
  L1["中层:相对稳定的普世价值<br/>跨时间、跨地理更可能站住的薄底线"]
  L0["底层:安全与控制<br/>能力上限、监测、绊索、物理关机…"]

  L2 --> L1 --> L0

底层:安全与控制。 先别谈「对齐到什么价值」。只给系统一定能力,监测它,设绊索,必要时物理关机。目标就算错了,伤害也要有上限。可纠正性、监控、Bengio 说的能力包络,都落在这一层。(延伸阅读:AI 监督、控制与验证

中层:相对稳定的普世价值。 在控制之上,再教一套跨时间、跨地理更可能站住的薄底线——反酷刑、基本人身安全、反歧视这类共存规则,而不是某年某地的厚生活方式。Constitutional AI、人权式语言,大致在这一层。(延伸阅读:普世价值?一张社会科学与历史地图

上层:更细的个人价值。 这里是用户的直接意图,和外推价值(如果他知道更多、想得更久,可能会要什么)的混合——但必须与中层普世底线相容。还要有机制:价值会更新,冲突要处理,不能假装一个人只有一个自洽目标。

行业今天主要出货的是底层一点控制 + 上层一点偏好优化(RLHF),中层写几条原则。这不是假的,但不完整。

一点启发,和一个模糊题

可以想象:模型在学习和适应人的效用函数时,不只是记住「用户喜欢什么」,而是逐渐表征价值之间的关系——冲突、先后、重叠——以及某个价值有多稳、多依赖情境。若真能做到,上层就不再是一张扁平偏好表,而更像一张会动的关系图。这还很远,但是个有用的想象。

模糊情况立刻就来。用户工作压力大,想抽烟。AI 该鼓励还是劝阻?这里该怎么加权?

  • 直接意图说:他想抽,别唠叨。
  • 外推价值可能说:长期健康、减压方式,他冷静时未必选烟。
  • 中层普世底线通常沉默:成年人抽烟一般不构成酷刑或支配。
  • 底层控制也管不到:这不是关机级风险。

所以这不是「对齐失败」,是分层之间本来就会打架。谁赢,取决于你有没有事先说清楚:默认听意图,还是默认外推,还是只在用户主动要健康教练时才劝。分层架构不消灭模糊,它让模糊变得可讨论。


一个小问题:)

假设模型远比我们聪明,也越来越会建模我们——它会不会推演出更理智、更有远见的「人类价值」?人类该怎么反应?该听它的吗?(延伸阅读:后人类伦理地图


来源