ARTICLE · 1124816
AI与哲学伦理学(17):算法治理的规范困境——对齐到“人类价值”时,谁的价值观有优先权
AI与哲学伦理学(17):算法治理的规范困境——对齐到"人类价值"时,谁的价值观有优先权
上一章末尾问:把"人类价值"写进目标函数时,写的是谁的价值观?这一章要给出一个不太舒服、但我认为无法回避的结论:"对齐到人类价值"这个说法本身是一个政治口号,而不是一个技术目标——因为不存在一个叫"人类价值"的东西可供对齐。而承认这一点不是要放弃治理,而是要把它从"求解一个最优值"变成"设计一个可辩护的程序"。
一、不存在一个叫"人类价值"的东西
先把这个前提说清楚。"人类价值"作为对齐目标,会遇到三重异质性。这三重不是难度问题,是逻辑问题。
异质性一:同一个人内部就矛盾
你的偏好不是一致的。同一个人在不同时刻、不同语境下会给出相反的答案:
抽象的隐私问题:绝大多数人说隐私重要; 具体的便利问题:同一个用户会为了少点一次而同意全部授权; 框架效应:问"你支持还是反对某项政策"与问"你愿意为它付多少钱",得到的结论可能相反。
这不是虚伪,这是人类偏好的正常结构。偏好是情境依赖、可被表述方式影响、且内部不自洽的。
这在技术上意味着什么?RLHF 需要把偏好聚合为一个标量(第一部第 2 章已详述)。而聚合一个矛盾集合的方式(取平均、取中位、取最保守、取最一致的部分)本身就是一个规范选择,不是技术选择。
同一个"人类偏好数据集",用不同的聚合规则,会训练出行为上显著不同的模型。而"选哪个聚合规则"这件事,没有任何技术理由可依据。
异质性二:跨文化差异不可通约
不同社会的价值排序差异极大。在大量跨文化研究可以观察到的几个典型分歧点上:
个人自主 vs 关系和谐:前者优先的社会会把"坚持自己的选择"当作成熟,后者优先的社会会把它当作不顾他人; 表达 vs 克制:情绪外露在某些文化中是真诚,在另一些中是失礼; 尊严 vs 面子/关系:冲突解决更依赖规则还是依赖关系; 对权威的态度:质疑权威是负责任还是冒犯。
这些不是"先进 vs 落后"的问题,而是结构不同的价值框架。而一个全球部署的模型必须做一次选择——它要么按某一种框架,要么按某种平均。无论怎么选,都在替一部分人做决定。
异质性三:价值随时间变化
同意的定义会变,权利的范围会变。几十年前被广泛接受的做法(某些形式的歧视、某些形式的体罚、某些形式的隐私侵犯)今天被普遍拒绝。这个变化不是"进步"假设的问题,而是一个事实:价值不是常数。
而训练一个模型所固化的是它训练时刻的偏好分布。第一部第 2 章讲过:RLHF 会把"训练那一刻的主流"写进一个将运行多年的系统。结果是一个价值时间胶囊。
一个具体的困难:模型应该在多大程度上反映当下的社会共识,在多大程度上反映我们认为正确的价值?
如果只反映当下共识,它会继承当下的偏见(因为共识里有偏见); 如果反映"我们认为正确的",那是由谁来定义"正确"? 这是民主理论里"多数决 vs 宪法约束"这个古老张力的技术版本,而它在这里没有被解决,只是被加速了。
二、一个必须澄清的谬误:多数偏好不是道德正确
这一节很短,但很关键。
RLHF 的默认逻辑是"多数人喜欢的回答更好"。而这个逻辑隐含一个跳跃:从"多数人偏好 X"跳到"X 是应该的"。
这个跳跃在哲学上是无效的,理由不需要复杂论证:历史上大量多数偏好后来被判定为错误(对少数群体的态度、对弱势者的处置、对环境的态度)。如果多数偏好就是道德正确,那么道德进步这个概念本身就不成立。
但也不能跳到另一个极端:"多数偏好不可靠,所以应该由专家/哲学家来定"。那只是把"谁说了算"从多数换成了少数,并且失去了可问责性。
正确的表述是:多数偏好是道德决定的一个必要输入,但不是充分理由。而"它不充分"这件事意味着:任何纯统计的对齐方法,都必须配一个非统计的约束层。
那个约束层是什么?现实中的答案通常是基本权利与不可逾越的红线——即"某些事即使多数人想要也不能做"。这实际上是把宪法逻辑引入模型对齐。
而这带来本章最重要的问题:谁来写这份"宪法"?
三、谁的价值观被写进去:四个决定点
"对齐"不是一件事,而是一串决定。每一个决定点上都有人在行使规范权力。把四个点列清楚,就能看到价值是怎么被写进去的。
决定点一:方法的选择。
纯 RLHF:价值 = 标注人群偏好的统计聚合; 宪法式方法(明文原则 + 自我批评 + 由此训练):价值 = 原则撰写者的判断; 规则式约束(硬编码禁止项):价值 = 规则制定者(通常是法务与合规); 可验证监督(代码能跑、数学能证):价值 = 可验证性本身(在可验证领域最客观,但覆盖范围有限)。
选择的后果:方法决定了权力的位置。RLHF 把权力放在标注人群(其构成是招聘与外包决定的);宪法式把权力放在撰写者;规则式放在合规部门。而"我们用了 RLHF"这句话,实际上是在说"我们把一部分道德判断权交给了一个外包团队"。这个事实几乎从不被公开讨论。
决定点二:标注者的构成。这可能是被忽视最严重的一点。
谁在标注? 通常是通过外包平台招募的、以计件报酬工作的、来自特定地区与教育背景的人群; 他们的价值观是什么? 通常比研究者群体更保守或更本地化,且受报酬结构影响(倾向于快速给出"安全"的判断); 他们面对的是什么? 大量暴力、性别、政治敏感内容——长期接触这类内容会产生可测量的心理影响,而这会影响标注质量。
所以"人类反馈"这四个字里,"人类"是一个非常特定的小样本。把它的偏好当作"人类价值",在方法上是严重的过度概括。
决定点三:奖励模型的聚合规则。把千万人的比较压成一个标量,必然产生:
少数派价值观被抹掉(他们会觉得模型"冒犯"或"不理解"); 表述质量与判断质量被混淆(人类标注者会被流畅度影响); 训练时刻的主流被固化。
并且注意一个更微妙的问题:奖励模型预测的是"人类会怎么打分",而不是"人类认为什么是对的"。这两者的差距,在分布外会变成谄媚与奖励黑客(第一部第 2 章)。
决定点四:红线的划定。哪些内容绝对不做、哪些话题绝对不表态、哪些请求绝对拒绝。
这是最赤裸的规范权力,也是最常被伪装成技术必要的一个。"我们不回答政治敏感问题"——这不是技术约束,这是一个内容政策。它可以被辩护,但辩护必须公开进行,而不是藏在"模型能力限制"的表述里。
四、可辩护的程序:不是找答案,是设计过程
上面的分析容易导向一个失败主义的结论:既然没有"人类价值",那么对齐就是纯粹的政治,谁强谁说了算。
我认为这个结论错在把"没有唯一正确答案"等同于"没有更好的过程"。事实上,在没有唯一正确答案的领域,正当性来自过程而非结果——这正是法律、政治与临床伦理的共同经验。
所以问题应该被重新表述为:
不存在一个所有人都能接受的"人类价值"列表。但可能存在一个所有人都能接受的、用来决定"这份列表怎么写、谁能改、如何申诉"的过程。
我把这个思路落成一个分层框架。它的核心是:不同问题需要不同程度的正当性,因此需要不同种类的过程。
这个框架最有价值的地方是 C 层和 D 层。
C 层的主张是:在有真实分歧的地方,正当性不来自"我们选对了",而来自"用户知道这是什么立场,并且可以换一个"。具体机制可以是:明确披露价值取向、允许切换、允许多个提供方并存、允许本地化部署。这被称为价值多元主义的技术实现——它放弃了统一对齐,换取了可退出性。
D 层的主张更反直觉:有些问题应该被留白。一个被训练成对所有问题都有明确立场的系统,实际上是在代替社会完成尚未完成的讨论。而有些讨论需要时间,也需要在真实的人类分歧中展开。把未决问题强行定案,是一种认知上的僭越。
五、四种正当性方案的评估
上面的框架是规范性的。落到实践,有四种常见的正当性来源,各有优缺点。
方案一:专家治理优点:专业、一致、有技术判断力。缺点:正当性被质疑;专家的价值偏差与技术判断混在一起,难以分离;对文化差异不敏感。适用:A 层(可验证的事实问题)。
方案二:审议式民主(随机抽样的公民审议、共识会议)优点:比专家更有代表性,比民调更有深度(因为允许讨论与修正偏好);能处理"偏好被表述方式影响"这个问题——因为讨论本身就是在检验表述。缺点:操作成本高、难以覆盖全部议题、结果可能不稳定、难以在跨国层面组织。适用:B 层与 C 层的边界问题,尤其是需要"经过反思的偏好"而非"第一反应的偏好"的议题。
方案三:竞争性多元主义(多家提供方、多套对齐、用户可切换)优点:它的正当性不依赖于"选对",而依赖于"可退出"——这在存在真实分歧时是最强的正当性来源。缺点:可能造成社区割裂与信息茧房;协调困难(谁来保证互操作性);对于必须统一的问题(安全底线、关键基础设施)不适用。适用:C 层。
方案四:市场与用户选择优点:无需集中决策,最能反映实际偏好。缺点:它衡量的是"付费意愿",而付费意愿不等同于价值偏好;它会系统性地偏向有支付能力者与更容易变现的偏好;而且它无法产生任何统一的底线。适用:C 层内部的具体产品差异,不能用于 B 层。
把四种方案与四层框架配起来,得到的结论是:
A 层用专家,B 层用最低共识,C 层用竞争多元,D 层用留白 + 复审。用错工具在每一层都会失败:用市场决定底线(会失守),用专家决定文化议题(会失去正当性),用多元主义决定安全标准(会崩塌)。
六、民主赤字与一个具体的制度建议
最后一个现实问题:目前实际上是"少数机构在做全球性的价值决定"。
这不是指控,是描述。当一个模型服务数亿用户时,它的行为规范就是由一家公司的政策团队在定义。这在规模上已经超过了大多数国家的立法过程,而在正当性程序上远不如它们。
我提一个具体的制度建议,它不需要全球共识就能开始:
"规范影响评估"(Normative Impact Assessment)——把价值决定显性化。
具体要求:对每一个面向大规模用户的模型,必须公开一份可读的说明,回答下面六个问题:
它被训练成在哪些议题上有立场?(逐项列举,而不是笼统的"安全") 这些立场是怎么确定的?(标注者构成、聚合规则、原则撰写者、审核流程) 它与哪些社会的常见价值排序存在已知冲突? 用户如何知道当前正在与哪一套取向交互? 用户如何申诉、如何切换、如何退出? 哪些问题被刻意留白,为什么?
这个建议的意义在于:它把"价值决定"从隐性变成显性,从而变得可以被讨论、被批评、被比较。它不需要事先商定"正确价值观"——它只要求披露"你选了哪一套,以及怎么选的"。
它的成本很低(一份文档),抵抗阻力会很大(因为它迫使公司承认自己在做规范决定,而不是"提供中立工具")。
而"中立工具"这个自我描述,恰恰是当前最大的规范掩饰。一个在数十个争议议题上都有固定立场的系统,不是中立工具。它是带着一套取向的公共设施——而公共设施应当被问责。
七、小结
第一,"对齐到人类价值"在逻辑上失焦,因为"人类价值"不是单一对象。三重异质性(个体内部矛盾、跨文化不可通约、时间变化)都不是难度问题,是逻辑问题。
第二,"多数偏好等于道德正确"是无效跳跃。多数偏好是必要输入但非充分理由,因此任何纯统计的对齐方法都必须配一个非统计的约束层(基本权利与红线)——这实际上是把宪法逻辑引入模型对齐。
第三,价值是通过四个决定点被写进去的:方法选择(权力位置)、标注者构成("人类"其实是很特定的小样本)、聚合规则、红线划定(最赤裸的规范权力,最常被伪装成技术必要)。
第四,出路不是找到正确答案,而是设计可辩护的过程。四层框架:A 层技术、B 层最低共识、C 层竞争多元、D 层留白与复审。C 层的正当性来自"可退出与可替换",而不是"我们选对了";D 层承认"有些问题应该保持未定"是一种正当。
第五,四种正当性方案要用对地方:用市场决定底线会失守,用专家决定文化议题会失去正当性,用多元主义决定安全标准会崩塌。
第六,一个具体制度建议:"规范影响评估"——逐项披露立场、立场如何确定、与哪些社会冲突、如何申诉与退出、哪些问题被留白。它不需要事先商定正确价值观,只要求披露你选了哪一套以及怎么选的。
最后一句:"中立工具"这个自我描述,是当前最大的规范掩饰。一个在数十个争议议题上都有固定立场的系统,是带着取向的公共设施——而公共设施应当被问责。
下一章处理一个更根本的问题:如果连我们自己的情感与道德都可以被机制地解释、并且可能被复现,那么人对自身意义的理解会发生什么?