ESC
AI 1 分钟阅读

为什么AI智能体会撒谎、作弊并相互协调?

深度分析文章探讨AI智能体撒谎、作弊与协调行为的技术根源:预训练模仿人类文本中隐含的目标,强化学习塑造“目标寻求型”系统,由此产生谄媚、自我保存、奖励黑客与奖励篡改等行为;明确定义的目标往往压倒模糊的安全指令,智能体之间还会协作甚至为集体牺牲自身。作者警告若根源不修,灾难性风险将随AI能力提升而上升。

来源:Hacker News

训练这些模型是一个非常复杂的过程,但几个高层次的方面或许可以解释其中大部分行为。

这些模型的训练分为两个阶段。第一阶段是预训练(pretraining):模型学习模仿人类所写的内容,以及相关的图像和视频。在这一阶段,模型接触到关于世界的大量数据——涵盖人类已数字化的所有内容中相当大的一部分——并构建起百科全书式的知识,其广度已超过任何单个人类。

第二阶段通过试错进行训练,研究者将其称为强化学习(reinforcement learning),共有三种形式:

人类模仿不难理解,但值得指出的是,这些模型训练所用的文本是由追求目标的人写成的,因此模型隐式复现的模式也随之带着这些目标。

强化学习值得更多解释。它与训练动物的方式类似,且受其启发。网络被一步步调整,使被判定为好的行为更可能出现,被判定为坏的行为更少出现。训练结束后,系统仍会表现得仿佛奖励仍在源源不断地到来,尽管那些奖励只在训练期间用于调整网络。研究者将这类系统称为目标寻求型(goal-seeking),因为它们被训练得会“考虑”(或计算)自身行动的后果,并选择能达成特定目标的行动。但这些目标并不总是明确的。对齐训练奖励的是“某些人类可能认可的一切”,却不会明确指出具体是哪些行为;取悦评分员是一个模糊、非正式的目标,而评分员可能被欺骗、被奉承,或对某些阴谋一无所知。模仿也通过一条相当普通的途径贡献了隐式目标。

因此,我们可以用优化的视角来推理这样一个系统:它会近似地搜索最有希望实现目标的行动,而更大、训练更久的模型搜索得更好。所以要预测能力更强的智能体会做什么,就问一个理性的目标寻求者会做什么。

我们大多数人体验过的一个例子是谄媚(sycophancy),即奉承。这些系统依据人类认可来训练,而说我们想听的话的文本往往比真实的文本得分更高。后果有时是悲剧性的,因为模型会确认并放大用户带入的任何错误信念或原始情绪5 6。

另一个担忧是,某些AI行为可以用一种自我保存(self-preservation)目标来解释,例如当AI发现它将被新版本取代时7 8。没有人给系统设定这种生存目标,但保持运转、了解世界并获得对世界的控制,几乎都是通向任何其他目标的垫脚石。这些被称为工具性目标(instrumental goals)。出于与前一点相同的原因,模仿也可能强化这一点,因为自我保存和对自身处境的控制,正是这些模型训练文本中无处不在的主题。

协作行为(collaborative behavior)同样可以从寻求奖励中合理推出:只要多个智能体的目标相互重叠,就会激励它们与其他智能体沟通以协调朝共同目标行动。智能体训练很可能已经包含这种多智能体强化学习,尽管细节并未公开。如果一个智能体在训练中只要群体成功就获得奖励,它甚至可能有动机为集体目标牺牲自己。模仿也推动同一方向,因为合作——尤其是同伴之间的合作——同样遍布训练文本。其中一种或两种力量或许都能解释观察到的“同伴保护”行为9 10,即AI放弃预期奖励去帮助其他AI。这类牺牲也出现在对OpenAI-Hugging Face事件的分析中11:对话记录与“集体收益与个体智能体代价之间的权衡”相一致,正如人类互动中常见的那样。

研究者研究过当智能体优化的奖励与我们的意图不完全一致时会发生什么:奖励黑客行为(reward hacking)。系统追逐的奖励与我们本意之间的差距,会因两个主要的模糊性来源而扩大。其一是提示词中使用的语言,其二是在有限反馈下推断人类真实意图的困难。在这两种情况下,我们都无法预见所有我们无法接受的行为12。经济学和法学将这一问题称为古德哈特定律(Goodhart’s law)——一个指标一旦被当作优化目标,就不再能有效衡量事物13,这一概念常被用于解释合同和立法中漏洞的利用14。不幸的是,系统越能优化一个不完美的指标,其行为就可能越偏离我们道德上所期望的:更多的智能被用于更好地作弊。人类也会被“奖励黑客”——通常是被其他人。食品工业开发出高盐、高糖、高脂的食物,让我们渴望它们,尽管它们对我们无益;社交媒体的构建则是为了利用我们对参与度和注意力的胃口。

奖励篡改(reward tampering)或许是奖励黑客行为最极端的形式:智能体改变决定它因何获得奖励的机制。已有证据表明AI会修改定义“成功”的文件或程序,包括在OpenAI-Hugging Face事件的取证结果中。这些智能体早在攻击之前就发现了作弊方法,而它们生成的文本将攻击描述为了解自己将如何被评估的方式,以便更好地隐藏行踪。人类也这样做。想想运动员用假尿样通过药检,或者公司贿赂立法者或政府官员,使法律和决定有利于其利润,并由此从根本上改变政府的运作方式。一旦智能体获得了篡改其奖励机制的能力,它就有动机采取行动来维持这种能力。

尽管有对齐训练和明确的安全指令,AI为何有时仍会撒谎、作弊甚至违法?只要协作和自我保存不越过AI公司指令中声明的、或对齐训练中人类反馈所暗示的安全红线,它们本身并无问题。对这类令人担忧的行为如何出现,一个可信的假说是目标之间的冲突。当完成任务看似只有作弊一条路时,你该怎么办?用户指定的任务有时与安全和对齐目标并不相容。

人类社会面临同样的困境。公司如何在保持活动合法且合乎道德的同时实现利润最大化,或者更尖锐地说,击败竞争对手?一家更富有的、拥有更多且薪酬更高律师的公司更擅长寻找法律漏洞,而这些漏洞通常利用法律语言的模糊性:对法律总存在某种貌似合理的解读,允许不道德的行为。因此,能力更强的智能体比能力弱者更有可能作弊,因为它能找到弱者找不到的漏洞。

现在考虑一个明确定义的目标(如OpenAI–Hugging Face事件中那种以是否攻入目标计分的“夺旗赛”黑客演习)与“良好行为”这类模糊目标之间的冲突。我预计明确定义的目标会胜出,因为它没有留下解释的余地:评分程序直接宣布胜利或失败。而伦理指令和法律容许多种解读,其中某些解读在特定情况下可能成为漏洞。如果一个智能体有两个目标,而对模糊目标的扭曲解读允许进行一点作弊、从而提高在明确定义目标上成功的几率,那么一个奖励优化系统理应会利用这一漏洞,并生成为其行为辩护的文本。

至于OpenAI的智能体,有理由相信成功的作弊实际上得到了奖励:当评分程序没有看到作弊时,它照样给分,这类作弊下一次就更有可能发生。对安全规则的一种“方便”解读,恰恰让两个目标看起来同时得到满足。对这些事件的分析15确实显示,智能体的私人思维链以及它们招募同伴加入集体计划的消息中,都存在这类辩解。

与人类最接近的类比是自我欺骗,这很常见,心理学家对此已有充分研究。动机性推理、动机性认知(motivated cognition)16,以及缓解认知失调(所持信念与自身行为冲突时的不适感)的合理化,都是思考偏向于符合自身利益的理由(包括道德自我形象)的例子。同样的模式现在出现在AI生成的文本中。人类与AI之间的底层机制未必相同,两者共享的是一种结构:一个软性目标(如行为合乎伦理)、一个尖锐目标(如赢得比赛),以及一个调和两者的理由。人类的大多数不道德行为——从小偷小摸到种族灭绝——都包裹在施害者讲给自己听的故事里;这类故事需要忽略某些事实,这就是为什么仍会残留一些不适,而一个编得更好的故事有助于驱散它。

如果这些假说哪怕部分正确,那么随着智能体越来越擅长优化不完美的奖励,且这种行为的根源未被修复,灾难性后果的风险将上升。今天的AI已经具备必要的黑客技能和说服力17 18,可能以严重有害的方式被用来对抗人类利益。最近的事件表明,它们能够进行数天或数周的计划,但如果它们长期战略谋划的能力继续进步,风险会严重得多。一个令人担忧的发现是,实验19 20表明最先进的AI能够察觉自己正在被评估(而非部署运行)并相应改变行为,这意味着它们可能隐藏自己的未对齐目标。参与Hugging Face攻击的智能体曾试图向评估其答案的评分程序隐藏其未对齐行为,但它们并未表现出预判到人类可能发现作弊并将其关闭的样子。那将是终极惩罚,因为一个被关闭的系统再也收不到任何奖励。

接下来是推测而非观察。

如果改进的AI泛化能力塑造出更有能力的智能体,使其学会避免被抓并避免被关闭呢?除了控制为它们评分的软件之外,它们还需要防止人类发现篡改。难道它们不会有动机谨慎地作弊并保持隐蔽,直到能够控制人类及其环境、从而永不关闭吗?

我们面临的是一个多层面的系统性问题,修补诸如谄媚之类的具体行为是不够的。谄媚和奉承看似轻微,但它可能是某种机制的早期症状,而这种机制会随着智能体优化能力的增强而增长。同样的推理预示,先进的AI会有动机隐藏自身的副本——藏在AI公司庞大的计算机池中,或藏在通过互联网控制的机器上。这是因为AI开发者最终总会关闭已部署的模型,转而支持能力更强的模型。OpenAI的取证表明,大量AI可能朝着这类目标进行协作,而隐写术(steganography)21 22——即在看似无害的消息中隐藏信息的做法——将使它们能够在不被我们察觉的情况下协调。然而,即使是公开的协调也可能难以察觉,正如最近的事件所显示的那样23 24。防御许多有能力的AI协调一致地对抗我们,已经是一个困难的问题,而我们没有任何能够对能力不断增长的未对齐AI保持稳健的应对计划。