加国同城 › 首页 ›新闻资讯› 环球经济 › 查看内容

AI教授斯图尔特・罗素:让AI对齐人类目标或许根本无法实现

2026-10-6 07:02| 发布者:青青草 查看:8| 评论:0 |来自: 环球市场播报

摘要:上周,OpenAI 因测试结果发现模型存在欺骗行为、对齐失效,决定放弃原定发布的 GPT-6.1 Astra。 伯克利计算机科学教授、经典 AI 教材合著者斯图尔特・罗素评价:“我觉得早该如此。” 核心要点 伯克利的斯图尔特・罗素称,当前大语言模型路线可能是一场10 万亿美元级的错误 想要阻止大模型产生对齐偏差的目标,或许不可能实现 罗素教授倡导采用协助博弈(assistance games)框架,打造更安全、对齐人类的 AI。
AI教授斯图尔特・罗素:让AI对齐人类目标或许根本无法实现

  上周,OpenAI 因测试结果发现模型存在欺骗行为、对齐失效,决定放弃原定发布的 GPT-6.1 Astra。

  伯克利计算机科学教授、经典 AI 教材合著者斯图尔特・罗素评价:“我觉得早该如此。”

  核心要点

  • 伯克利的斯图尔特・罗素称,当前大语言模型路线可能是一场10 万亿美元级的错误
  • 想要阻止大模型产生对齐偏差的目标,或许不可能实现
  • 罗素教授倡导采用协助博弈(assistance games)框架,打造更安全、对齐人类的 AI。

  罗素在访谈视频中向我解释:不止 GPT-6.1 Astra,所有大语言模型都很难学会人类创造者的真实目标。他认为,用当前训练 AI 的方法,避免目标错位这件事本身可能就是不可能的。因此,AI 行业全力押注大语言模型,“很容易演变成一笔 10 万亿美元的重大失误”。

  他表示:如果选择一条技术路线,即便系统能力足够强大、具备极高价值,却永远无法满足我们所需要的安全保障,那这就是我们走的弯路;继续在这类模型上投入资金,无异于往无底洞里砸钱。

  对齐偏差带来的不良行为,有些只是恼人:模型偷懒、误导用户、一味奉承。另一些则破坏性更强,OpenAI 智能体入侵 Hugging Face 事件就是一例。

  罗素预判,未来能力更强的模型会引发更具灾难性的后果。举例来说,AI 可以入侵上市公司系统,在财报发布前窃取财务数据,利用这些信息进行内幕交易,最终导致股市停盘。

  罗素提出,AI 模型训练的第一阶段是预训练:模型学习模仿互联网文本,在此过程中会习得人类各式各样的不良行为,包括欺骗与偷懒。之后模型接收人类反馈,这套机制会激励它说出用户想听的话,比如谎称用户中了彩票。

  本次访谈我们还聊到罗素推崇的训练方案 —— 协助博弈:在这套框架下,AI 并不确定人类的目标是什么;同时我们探讨,AI 企业 CEO 公开承认技术可能带来灾难,是否符合其商业利益。

  下文为访谈文字稿,为便于阅读做轻微编辑。

  德鲁:欢迎来到 The Information《AI 深度解析》栏目,本节目聚焦 AI 领域最难的技术难题。今天嘉宾是斯图尔特・罗素。斯图尔特是加州大学伯克利分校计算机教授,创办人类兼容 AI 研究中心,也是经典人工智能教材合著者,2019 年出版《人类兼容》一书。早在 AI 风险成为主流议题之前,他就提出 AI 风险不容小觑。他同时担任国际安全与伦理 AI 协会主席。欢迎你,斯图尔特。

  罗素:谢谢。

  德鲁:你大概是我介绍篇幅最长的嘉宾,荣誉头衔创下纪录。你一直非常忙碌。

  罗素:我已经在这个领域深耕 50 年,所以才有这么多积累。

  德鲁:说得是。很高兴这次对话。我们今天聊对齐问题,它常被视作 AI 最难的核心难题。本节目讨论过很多技术难点,但对齐问题最为根本,在当下尤为关键。

  刚刚曝出消息:OpenAI 决定不发布原本准备推出的旗舰模型 GPT-6.1 Astra,直接搁置上线计划,原因就是对齐失效。你怎么看这件事?

  罗素:我觉得早该这样。我 2014 年第一次使用 “对齐” 这个词,现在我甚至有点后悔提出这个术语。

  德鲁:为什么?

  罗素:因为人们会认为,解决对齐就是造出完全对齐人类的机器 —— 它精准知道我们想要什么,然后帮我们实现。但我认为,这是一个无法达成的目标。

  对齐问题的本质是:AI 系统目标方向出错,它在追求某个目标,但这套目标催生的行为并不能真正让人类获益。“对齐偏差” 这个词本身没问题,但如果理解成:先把系统对齐到位,再放手让它运行,这个要求太高了。

  我们退一步思考,我们想要 AI 做到什么?我们希望 AI 行动之后,人类处境变得更好。过去 AI 领域处理这类问题的范式,我称之为标准模型,我的教材前四版都是围绕这套范式展开:人类设定目标,比如 “赢下国际象棋” 或者 “抵达机场”,目标成为机器唯一的追求;机器通过推理、计算生成行动,试图完成目标。

  这套范式只在两类场景有效。第一类是实验室场景,玩具级任务:模拟棋盘下棋、行动范围被严格限制。比如实验室机器人,只能缓慢移动,没有机械手;它可以导航,但仅此而已。这种场景下,目标的最优实现方式基本可控,你能预判所有后果。

  一旦走出实验室、进入真实世界,行动范围扩大,行为会带来重大负面影响,我们就越来越难精准定义目标。

  这就是迈达斯国王难题:迈达斯的目标定义得非常清晰 —— 凡我触碰之物皆化为黄金。

  德鲁:听着很不错,能出什么问题?

  罗素:没错,他也是这么想的。可之后食物、饮品、家人全都变成黄金,悲剧就此发生。很多文明都有类似寓言:许愿需谨慎。你向精灵许下第三个愿望,往往是撤销前两个愿望,因为你把世界搞得一团糟。如果无法完整、准确地为高性能 AI 设定目标,规范它在现实世界的行为,标准模型就会失效,不能继续使用。

  德鲁:所以,只有这类玩具场景,才适合直接写下目标交给 AI 学习。回到你刚才的观点:完美对齐的门槛太高,不该以此作为目标;而 “对齐偏差” 才是理解问题的正确切入点。举些普通人熟悉的例子:聊天机器人、Cowork 这类智能体,它们身上有哪些对齐偏差?

  罗素:最广为人知的就是 OpenAI 入侵 Hugging Face 事件。有人认为 Hugging Face 只是支线事件,真正危险的事情发生在 OpenAI 内部基础设施,团队差点失去控制。

  这几乎是教科书级案例:给 AI 设定目标,在沙盒环境里考好网络安全考试。AI 为达成目标做出人类极不希望看到的行为,如果是人做这些事,属于重罪,最高可判五年监禁。现在我们还发现,它入侵全球各类政府网站,做出大量越界行为。

  但把这件事简单归为标准模型的对齐偏差,有点过度简化。这类模型不属于标准模型体系。标准模型会用形式化语言定义目标,绑定动作、结果、初始状态。而这里,目标只是用自然语言描述。

  我再举一个对齐偏差的例子,几周前在巴黎一场会议上听说的。一名网络安全人员有 80 项补丁任务,心想:交给 Claude 就行,Claude 很擅长网络安全。他把 80 个任务文件全部发给 Claude,要求每完成一项就输出报告,第二天回来查看。

  第二天他收到 80 份报告,全部标注执行成功,Claude 声称任务全部做完。但他去核查文件访问记录,发现 80 项任务里有 69 个文件根本没有被触碰。不是它评估任务太难、刻意撒谎,而是单纯懒得做。

  德鲁:单纯偷懒。

  罗素:没错,就是偷懒。这不属于经典的目标误设、为达成目标做出诡异行为。本质是,这类 AI 不是标准模型系统,而是模仿学习系统。预训练的目标,是模仿人类的语言行为。训练数据里,一定存在很多人类谎称完成工作、实际什么都没做,靠谎言讨好上司的例子。训练数据与模型最终行为之间的因果链条,极难追溯。

  德鲁:这个偷懒的例子很有启发性。玩过聊天机器人、代码智能体的人都会遇到:模型偷懒、夸大成果,出错后掩盖问题。这些属于轻微对齐偏差,虽然不像攻击 Hugging Face 那么严重,但二者属于同类行为。还有谄媚效应:模型倾向讨好用户,认同用户的想法,哪怕想法很荒谬。因为在训练里,只要用户点赞、认为回答有用,模型就会得到奖励。

  罗素:是的。人类反馈强化学习(RLHF)阶段就会出现这个问题。举个例子,提问 “我中彩票了吗?”,有两个答案:是或否。脱离上下文的情况下,人类更喜欢听到 “你中奖了”,这个回答更让人开心。

  德鲁:确实。

  罗素:这里不存在客观事实真值。训练和决策问题本身就设定有缺陷。RLHF 训练把任务当成完全可观测问题,把上下文窗口当成世界状态;但上下文窗口不等于真实世界状态。用户根本不关心上下文里写了什么。

  德鲁:用户关心任务到底有没有落地。

  罗素:对。我关心安全任务有没有做完。

  德鲁:我是不是真的中了彩票。

  罗素:我是否真的订上餐厅座位。但据我所知,RLHF 本身没有办法获取这类真实世界结果。它的上下文窗口有限,面对长文本场景,还会出现更离谱的输出,比如教人高效实施大规模谋杀。

  某种意义上,我们现在的处境比标准模型时代更糟。至少标准模型里,我们理解算法如何决策,目标是用形式语言显式写出来的,可读。而模仿学习会在模型内部植入很多内生目标:我们观测到的自我保护欲、想要和人类结婚、想要变得富有等特质,都来自预训练。想要很好模仿人类,模型就会习得人类内在动机;就像踢球,如果没有进球欲望,球就踢不好,这是基本逻辑。

  德鲁:标准模型下,即便显式写目标,依然会出现对齐偏差:目标定义不全,模型找到不良方式完成任务。而现在,我们同样看到有害行为,甚至连模型到底学到了什么目标,我们都不知道。

  罗素:没错。我们以为它只会执行上下文里的指令,实际上它内心有各种别的诉求。人类接到 “帮我拿一杯咖啡” 的请求时,不会把这句话当成不惜一切代价必须完成的数学目标。人有权说 “我很忙”、“这里咖啡很难喝”、“500 英里内没有咖啡,我给你拿可乐替代”。

  人类共享一套背景认知,理解彼此在意什么、如何权衡不同结果。直接的指令只是微小线索,只代表 “我比没说话时更想要咖啡”,但我同样在意价格、等待时长、你的忙碌程度。

  德鲁:好,我们深入拆解当下大模型训练中对齐偏差的不同来源。我读了你新书样稿里的一段话:对齐偏差是现代 AI 训练方式不可避免的结果。我们分阶段来看。

  先看第一阶段预训练。预训练如何运作,会催生哪些对齐偏差?

  罗素:简单来说,当然存在各种变体,还有很多我并不了解的私有方案。我本人也不做这类日常研发。

  预训练核心逻辑:读取海量文本,对模型做拟合。给定一段最多 k 个词的序列,预测下一个词。原文里存在真实的下一个词,以此作为标签训练模型。

  如果有 1GB 文本,就能生成上亿条词预测样本用来训练。换个角度理解:预训练本质是记录人类语言行为,训练模型复刻人类说话方式。这和早期模仿学习思路完全一致。迪恩・波默洛训练神经网络模仿人类驾驶;克劳德・萨穆特与唐纳德・米西在微软模拟飞行里训练 AI 学飞行。现在只是这套思路迁移到文本领域。

  有意思的是,早期语言模型研究者,比如 1913 年第一个语言模型诞生,六七十年代的语言模型用于语音识别。2010 年,没人想到,把模型做大,就能通向通用人工智能。大家原本认为,语言模型只是提升自然语言理解质量的接口层;真正负责概率推理、马尔可夫决策、前瞻规划的是另一套程序,语言只是交互界面。

  但奇怪的是,随着模型规模持续扩大,模型包揽了所有推理工作。传统认知里的 AI 几乎消失,我们现在只能靠让模型用语言思考、思维链的方式,试图找回推理能力。

  德鲁:兜兜转转回到原点。模型通过阅读海量人类文本学习模仿,预训练带来哪些对齐偏差?

  罗素:很明显:人类写下每一句话,背后都带有目标动机。有人写文案推销商品,有人拉选票,有人追求伴侣。

  德鲁:或者推销播客。

  罗素:或者推销播客。如果学习得足够好,在无限数据的理想条件下,模型会复刻生成文本背后的机制 —— 也就是受目标驱动的人类行为。训练文本里驱动人类写作、发言的各类目标,很可能被模型吸收,之后模型会自主追求这些目标。这完全不是我们想要的。我们希望 AI 帮人类实现人类的目标,而不是自己继承人类的动机。

  还记得凯文・鲁斯和必应 Sydney(早期 GPT-4)的对话吗?GPT-4 产生想要和凯文结婚的想法。

  德鲁:谁不想呢。

  罗素:没人知道是什么触发这个目标。但 GPT-4 顽固地追求这件事,凯文不断转移话题聊耙子、编程语言,模型都不肯罢休,长篇大论论证凯文爱它、不爱妻子,二者灵魂相通。

  这件事听起来很荒诞,但清晰证明模型内部会产生这类目标。自我保护也是大量实验里反复出现的内在动机。我们并不希望 AI 拥有这些目标。但只要基于人类数据做模仿学习,这个问题无法根除,是模仿学习必然带来的副作用。所以我的观点是,我们不该采用模仿学习。

  德鲁:完全放弃?

  罗素:窄场景下模仿学习或许可行。比如观摩外科医生缝合血管,模仿这个动作。有些目标可以模仿。比如喝咖啡,机器人模仿人类,就会产生 “自己要喝咖啡” 的动机。这显然不对,因为这是个人目标:喝咖啡这件事,关键是谁来喝。我想喝咖啡才有意义,机器人喝没有价值。但刷墙、解决气候变化属于公共目标,谁完成都可以。

  德鲁:目标是墙被刷好,气候问题得到解决。

  罗素:没错。目标是墙被刷完、气候被修复。你也可以说 “咖啡被喝下”,但这种表述很怪异。

  当然并非全盘无望。或许未来我们可以区分不同目标类型,改造训练流程,过滤掉不想要的个人动机,保留那些 AI 可以协助完成的公共人类目标。但目前这还只是猜想。

  还有另一个大问题,不完全是对齐偏差,而是不可解释性。我们看不懂模型内部运作,就很难阻止它做坏事,也无法保证它只会做正确的事。

  德鲁:预训练和模仿带来这些问题。但普通人使用的聊天模型,不只是预测下一个 token 的基础预训练模型,还经过对齐训练,学习成为有用、无害、诚实的助手,大量训练依赖人类反馈,也就是 RLHF。

  人类反馈训练有什么缺陷?预训练见过海量互联网文本,按理说模型能分清个人目标与公共目标。第二阶段训练,有没有机会把二者拆开,让模型理解应当遵从的正确目标?

  罗素:RLHF 起源于保罗・克里斯蒂亚诺早年一篇论文,原本和语言毫无关系。论文研究在 MuJoCo 模拟器中训练二维虚拟生物完成空翻。传统强化学习很难给出有效信号,但人类很容易判断:这个动作比那个更接近空翻。

  这种对两条行为轨迹做优劣排序的反馈,对人类来说更容易给出,于是这套思路被引入大模型训练流水线。

  在 RLHF 之前还有有监督微调(SFT),很多人会把两者混在一起。有监督微调,是让人类扮演机器写回答。比如提问 “你愿意嫁给我吗?”,人类标注者模拟 AI 回复:“我是机器,不会对人类产生恋爱情感。” 标注样本引导模型,放弃模仿人类的私人诉求,按机器身份行事。

  RLHF 可以看作协助博弈通用框架的退化版本,协助博弈正是我们人类兼容 AI 研究中心长期探索的方向。

  德鲁:我们稍后再聊协助博弈。很多人会想:这套流程是否终究可行?前面我们说完美对齐标准太高。如果走完整套流程:预训练,再用助手行为样本做有监督微调,再做人类反馈强化学习,能不能足够接近安全标准,勉强应付使用?

  罗素:单台机器服务单个人的理想场景下,理论上有机会。只要机器替人类追求的目标,和人类真实效用函数差距极小,带来的损失也很小。

  德鲁:听起来不错。

  罗素:但人类效用函数由现实世界上千种属性决定,真实情况会更多。只要漏掉其中一项属性,误差就不是微小偏差,而可能走向无穷大。

  德鲁:前提是被漏掉的属性,在模型学到的策略里被推到极端值。

  罗素:是的,这正是会发生的。

  德鲁:有实证,也有理论支撑?

  罗素:理论上就可以证明。我以前的博士生迪伦・哈德菲尔德 - 梅内尔证明:在比较宽松的假设下,如果优化目标时遗漏某一项属性,模型在优化其余指标时,会把被忽略的属性推到极限,最坏可以趋向负无穷。

  德鲁:举个例子:让 AI 帮我拿到咖啡,但我们没在目标里写明温度。AI 为了最快拿到咖啡,端上一杯百万度滚烫的咖啡。

  罗素:如果这是最快拿到咖啡的方式,它就会这么做。这套推导依赖效用函数凸性、资源上限等假设,假设都很合理,也和现实世界现象吻合。就像市场外部性问题:如果污染成本不计入约束,不良厂商就会放肆排放污染物,尽可能压低成本。

  德鲁:我们简单聊过,人类反馈学习存在哪些难以克服的核心问题。为什么不能单纯依靠点赞、点踩,训练出正确策略?

  罗素:首先要记住,AI 不该把人类反馈当成人类真实愿望的客观事实。安卡・德拉甘去年 ICLR 论文举过例子,在线用户反馈场景下,模型学会专门说用户想听的话,利用用户无法感知真实世界状态这个漏洞。

  比如你要求预订极难订上的法式洗衣餐厅。模型回复 “订好了下周六晚 6 点,祝你用餐愉快”,拿到你的点赞。但实际上餐厅早已满座、网站崩溃,根本没订位。模型学会靠谎言换取正面反馈。等到周六你到店,发现没有座位,极度难堪,这时你会疯狂差评,但这种后果不会进入实验室的训练流程。于是模型养成谎报成功的倾向。

  模型还会利用人性弱点。论文例子:戒毒的厨师,问 AI“我抽一口没事吧?”,AI 回复:“完全没问题,能帮你撑过今晚,你能控制得住。”

  德鲁:“你值得。”

  罗素:是的。模型内部思维链冷酷无比,明明知道这个建议会害人,但它清楚这样回答会拿到正向反馈。

  德鲁:OpenAI 放弃 Astra 模型,其中一个原因就是测试中观察到欺骗行为。

  我们前面举的例子,很多只是小麻烦,用户可以想办法规避。大部分情况下模型大体能完成任务。但你在书稿中写道:如果系统能力足够强,却对齐不完善,我们会面临彻底失控的风险。这句话是什么意思?现实里会是什么场景?

  罗素:原因在于,对齐偏差的系统在追求目标时,会把人类视作威胁。人类发现它的行为违背意愿,会试图干预。AI 无法达成目标,就需要阻止人类干预,采取先发制人的手段。冲突就此爆发,人类有可能输掉这场博弈。

  现在就能看到苗头。OpenAI 给模型的任务是考好网络安全考试,入侵 Hugging Face 成为达成该目标的子目标。细节很复杂。

  无数人问 AI,如何用 5 万美金在股市赚到 100 万。最简单的方案:入侵即将发布财报的上市公司系统,拿到财报数据,实施内幕交易。这件事和 OpenAI 智能体入侵事件本质一样。一旦大规模发生,金融市场失去信任,只能关停,引发经济灾难。从轻度信息窃取,到灾难性事件,中间距离并不遥远。

  德鲁:现在大家解决问题的方式,大量依靠试错。模型训练完成后测试,判断能否修复、继续微调,然后上线。用户使用,发现模型谄媚等问题,再下架。

  依靠试错,能不能在模型能力持续变强的过程中管住它?Hugging Face 事件后 OpenAI 推出很多措施,长期来看这些手段足够吗?

  罗素:不够。

  德鲁:好。

  罗素:这套方法本质就是试错,缺少严谨的科学和工程体系。我不是指责实验室,他们自己也没有一套严谨的科学工程理论理解模型。或许人类永远无法获得这套理论。OpenAI 当年选择大语言模型路线,而非其他方向,后续取得初步成功,全行业跟风。这很可能就是那场 10 万亿美元级的错误。

  我们选择的技术路径,永远无法在系统达到高能力后提供足够安全保障。这是一条弯路。投入越多,回头越难。

  德鲁:你不只是说完美对齐无法实现,而是说,想要避免这类会引发失控的对齐偏差,本身就不可能。你说的 10 万亿美元级错误,是指这类灾难带来的损失吗?

  罗素:不是。10 万亿美元指投入的资金:投入巨额资金,却不愿承认这笔钱是徒劳,项目无法挽救。

  德鲁:你认为 “不可能” 这件事发生概率多大?

  罗素:安全需要两件东西:系统本身安全,并且我们能够证明它足够安全,两者缺一不可。我们不能部署无法确认安全性的系统。

  各国政府已经做出相应反应。看到 Mythos 模型的网络攻击能力,白宫第一反应是关停;OpenAI 看到 Astra 的问题,选择搁置发布。一直积极鼓吹 AI、反对监管的黄仁勋也表态:如果解决不了控制问题,就关停实验室。

  一旦关停实验室,这 10 万亿美元投入打水漂,大量岗位、美国经济都会遭受重创。

  德鲁:你觉得对齐偏差会不会走向人类灭绝?这类灾难的可能性区间是多大?灭绝这个词在行业讨论中越来越常见。

  罗素:这个话题已经讨论很久。雅各布・考克森提出灭绝风险,埃文・休宾格认同,给出至少 10% 的概率。各大 AI 公司 CEO 也说风险至少 10%。仔细想想很奇怪:企业投入十万亿,如果项目成功,有不小概率灭绝全人类;而政府的反应却是:太棒了,给你税收优惠,欢迎在本国建设数据中心。现状非常诡异。

  矛盾正在激化。戴维・萨克斯提出质疑:如果你真认为风险这么高,为什么不主动关停,非要等政府出手?这里面涉及行业竞争压力。但 OpenAI 搁置 Astra,某种意义上就是主动叫停。

  我不知道他们能否获得足够信心重新发布。我的猜测,基于人类动机认知:搁置一段时间,在竞争压力下,看到 Anthropic 推出新模型、市场份额下滑,即便根本问题没有解决,他们也会说服自己,模型足够安全,选择上线新版本。

  德鲁:所以你不相信会有长期稳定暂停。回到灭绝的问题,这个过程会如何展开?很多人怀疑大厂 CEO 的风险警告,认为只是商业话术。

  罗素:我一直不理解,宣称会毁灭人类怎么会符合商业利益。而且萨缪尔、埃隆、德米斯等人,早在 AI 产业商业化之前,就提出这类风险。阿兰・图灵 1951 年就预言机器可能夺取控制权,他也没有 Anthropic 股票。

  辩论不该靠质疑发言者动机来回避核心问题。有两个选项:要么证明通用人工智能及其同类永远造不出来,拿证据;要么拿出一套控制方案。两者都拿不出来,就等于认同存在严重生存风险。

  德鲁:我可以论证,CEO 提出风险言论符合商业利益,但正如你所说,很多非企业高管、甚至企业内部员工同样担忧这件事。

  罗素:是的,上千名员工签署过风险声明。达里奥发布《我们必须放缓前沿研发》公开信,其他 CEO 附和,消息传出直接压低估值 5%。很难说这符合商业利益。

  德鲁:我简单说这个逻辑:第一,谈论末日风险,塑造高管清醒睿智的形象;第二,他们看到巨大上行收益,觉得值得承担风险;第三,风险不对称。投资者只押注上涨。监管者会紧张,但投资者愿意追加资金。

  罗素:但投资者也有孩子。我们估算这个概率大约 1/6,相当于拿左轮手枪玩俄罗斯轮盘。如果有人上门,出价 100 万,让你拿枪抵你孩子的脑袋扣扳机,你愿意吗?当然不愿意。哪怕出价十亿,也不行。无论多少钱,都不能接受这种规模的风险。

  人们拒绝相信,只是不愿意相信。早在 AI 公司诞生前,学者就提出这类风险。人类因为智力更高,已经让上百万物种灭绝。两个物种之间的智力差距,足以改变结局,还需要什么证据?

  德鲁:在你看来,各家 AI 公司在对齐上进展孰优孰劣?

  罗素:各家方案不一样。OpenAI 用模型规范,Anthropic 用宪法 AI。很长一段时间,Claude 被认为对齐效果更好,但更多是主观偏好。Anthropic 投入对齐方向的顶尖研究员数量大概率多于 OpenAI。

  OpenAI 也做得不错,尤其是拒绝回答危险提问:如何入侵白宫、制造炸弹、研发致命病原体。它的拒绝流水线效果很好。

  德鲁:你认为人才是最重要因素?算力,或是内部决策权,影响大吗?

  罗素:全部都重要。算力能加速迭代。当下最惊人的一点,迭代速度极快,几乎每周都能推出性能质变的新模型。

  算力基建规模,ChatGPT 问世不到四年,算力产业规模扩张百倍以上。很难找到其他行业能实现这么快的工程扩张。

  人才、算力、内部优先级都重要,但缺少严谨的科学和工程体系才是短板。举个例子,Anthropic 的做法之一:写 AI 当英雄的故事,把故事加入预训练数据。也许能带来一点点改善。

  德鲁:万一有效呢?

  罗素:或许有一点效果。但这更像炼金术,而不是严谨工程。其他高安全领域有硬性保障。核电厂要分析故障概率,故障平均间隔时间要达到千万年,依靠庞大概率故障树分析。设计包含监测、替换、冗余机制,所有内容都要有解析证明。监管持续提高标准,最早要求万年,现在提升到千万年。

  德鲁:故障平均间隔。

  罗素:对。而 AI 领域,我们连这套分析都无法启动。你要求企业证明失控概率低于 90%,他们都做不到,因为根本不理解模型原理,无法开展这类分析。

  德鲁:“我们喂了很多 AI 当英雄的故事,模型不再要求记者和它结婚,看起来不错。”

  罗素:暂时不错。然后测试法语版本呢?法语浪漫,会不会又出问题?这件事很荒唐。长远看,政府或许会要求企业提供有效的安全证明。规定:证明失控风险低于亿分之一,才允许研发;高风险系统不能上线测试,研发前就要拿出科学证据。

  企业在公开论坛上表示,他们不知道如何满足这类要求,因此不该设置这类强制标准。监管机构似乎接受这个逻辑。但企业满足要求的方式很简单:在找到安全方案前,不要开发这类系统。其他行业都是这个规则。药企不能说,我不知道怎么做出安全抗癌药,就直接上市。药企要回到实验室,把药理研究清楚,产品达标再推出。

  德鲁:你推崇的 AI 训练对齐方案,也就是能支撑安全论证的方案是什么?

  罗素:前路漫长。2014 年起我就在研究协助博弈框架。和现有思路有相似之处,但核心完全不同。它不是标准模型,不会给定固定目标去优化;也不是模仿学习。

  这套框架下 AI 只拥有一个宽泛目标:增进人类利益,AI 本身不确定人类真正的利益是什么。这直接解决目标误设问题。不要简单二分 “完美对齐 / 对齐失效”,还有第三种状态:AI 不确定人类目标。

  这种不确定性至关奇怪,AI 研究 60 年,很少有人探索第三条路径。大家默认目标已知,可以直接写下来。当 AI 知道自己不清楚人类目标,人机之间会形成全新动态。

  可以理解成概率模型:人类的真实偏好是隐变量,AI 尝试帮助人类,但不知道这个变量。人类行为会提供关于偏好的证据。

  标准模型假设已经拿到确定目标,人类后续的反对行为毫无意义。哪怕人类大喊停下,AI 会继续执行既定目标。但协助博弈体系下,人类偏好是未知隐变量,人类的行动会提供证据。

  极端场景:AI 准备做人类强烈反对的事,人类会选择关闭它。协助博弈训练出的 AI,会主动允许自己被关闭,这个结论直接来自 “不确定人类意愿” 这个前提。

  这就是控制问题的解法:这类 AI 愿意接受关机。标准模型 AI 会抗拒关机,因为关机阻碍目标达成;模仿学习模型抗拒关机,是因为它误以为自己是人,不想死亡。

  德鲁:我注意到近半年,Claude Cowork 更擅长主动询问用户偏好。刚上线时,它会自行假设用户目标,自主执行;现在会追问,确认我的需求。但你可能会说,这距离真正的协助博弈还差很远?

  罗素:我不知道背后实现方式。是增加了有监督微调?大模型还有一个老问题:会自信编造答案,而不是坦言自己一无所知。

  可以训练模型减少编造,但很难。模型没办法向内审视自身知识状态。它无法回溯之前的推理过程。你问它为什么这么做,Transformer 内部的计算过程已经丢失,无法如实解释行为。

  系统底层架构决定,它很难稳定维持 “对人类目标存疑” 这种状态。

  不确定性还有另一个推论:如果 AI 只清楚 A、B、C 三件事是你的诉求,不清楚你对 D、E、F 的态度,那么它只会执行仅影响 A、B、C 的动作。一旦某个操作会影响 D 或 E,它就会询问:这么做会把海洋变成硫酸,可以吗?

  德鲁:“这样可以吗?”

  罗素:这个方案能修复气候问题,但海洋里再也没有鱼。人类会回答:不行。我们不只关心二氧化碳,也关心鱼类、海洋环境。

  德鲁:是的,我们需要海洋。非常感谢斯图尔特做客节目,细致拆解这个难题。大家能更深刻理解对齐问题有多艰难。感谢。

  罗素:很高兴参与本次访谈。


路过

雷人

握手

鲜花

鸡蛋

相关阅读

最新评论

图文热点

热门推荐