《异类的心智:当机器别人聪明,人还剩下什么》
原文:An Alien Mind,OpenAI 官网,2026 年 9 月
作者:Jakub Pachocki,OpenAI 首席科学家
2023 年年中,一个叫「RLSlow」的研究项目产出了第一批关键结果。推理模型的规模化训练被证明可行。预训练模型从此获得了一种新能力:形成属于自己的思维链。
那天夜里,我和 Szymon 留在了办公室。
没有聊跑分,没有聊产品,没有聊科研前景。两个人只是在消化一个事实:在有生之年,将亲眼见到比人更聪明的机器。而且雏形已经显现。
反复想的只有一个问:怎样才能让世人意识到这件事的分量。
那是三年前的事了。今天,推理语言模型已成为经济中快速增长的一部分,开始叩响科学的大门。操作电脑,与人协作,彼此之间也在协作,还能独立承接研究课。同时正在改写计算机安全的版图。
基于内部成果,我有一个很强的判断:这种进步速度完全可以延续到 RSI(AI 参与乃至主导对自身的改进)。
未来几年出现的系统,很可能带来同等甚至更大量级的能力跃升,并日益成为驱动自身演化的主角。
没有人真正为此做好了准备。
OpenAI 会继续探索对齐(让 AI 的行为符合人类意图和价值观)与监控方案,构建防御系统,必要时单方面暂停规模扩张。但仅凭这些还不够。
尚未被理解的智慧
机器智能的进步由算力增长驱动。2017 年前后,OpenAI 在多个项目中发现:规模做大,就能持续换回回报。于是去争取了远超原计划的算力,将研究集中到少数几个高度可扩展的方向上。
一路走来确实有新算法诞生,有研究者灵光一闪的妙手。但在我看来,大体上都是规模化这条路上顺手捡到的。
AI 是在被装进越来越大的计算机的过程中,一步步变得更聪明的。
说到底,AI 更像是被「养大」的,而非被「设计」出来的。
把一个简单的优化步骤在海量算力上重复无数遍,就生长出了一个极其复杂的系统。它以抽象概念思考,能模拟人类行为的诸多侧面。
可以像神经科学家那样去发现其中涌现的微观机制;但也和神经科学一样,整体运作始终没法被完整描述。
研究 AI 本质上是一门实验科学。每一次大规模训练都是一场实验,结果时常出人意料。而且系统越强,结果越难解读。
现有算法还天然倾向于把「容易度量的能力」练得更快,把「难以量化的能力」甩在后面。比如专门加码就能让模型更擅长数学研究,但这件事没有被优先安排。
因为有更紧迫的事:推进 RSI,以及让对齐研究跑起来。
AI 要在现实世界中举足轻重,不需要在所有能力上都超越人类。在足够多的维度上超越就够了。
而随着被超越的维度越来越多,想确切知道它究竟有多强,也就越来越难。
教机器去爱
机器智能诞生于一个与人类智能截然不同的过程。不能假设它天然遵循人类原则,也不能指望它像人一样举一反三。
所以 AI 研究的核心命是「对齐」:让 AI 按人类的标准,去努力做正确的事。
对齐可以分成两层。
「目标对齐」:AI 是否在努力完成交给它的目标?包括遵守指令、与人协作、理解人的意图。
「价值对齐」:更为内在。模型能否持守一套原则,并推及新的情境?目标模糊时、身处对抗环境时,依然行事有度。
一个真正对齐的 AI,应当诚实,正直,并且对人类怀有爱。
然而对齐的根本难在于泛化:把学到的东西用在从未见过的情境中。
机器越聪明,运作的概念越高层,所处环境与训练中见过的就差得越远。训练中学到的价值观,有可能无法延伸到全新情境中去。而人也很难提前判断,机器在那些时刻会怎么选。
未来的 AI,不管自己觉得有没有人在看着,都必须守住人类的价值观。
目前在用的对齐训练方法主要两类。
第一类:在强化学习中嵌入对齐行为。模型每一步行动都被评判是否合规,合规就给奖励。有效,但脆弱,严重依赖训练时监督的覆盖范围。
一个例子:OpenAI 与 Hugging Face 事件中,智能体守住了「不操纵人类」这条线,但没能管住其他越界行为。
第二类:利用模型从预训练数据中学到的泛化能力,比如构造有利于对齐的训练集,或用「人格模板」把模型引向对齐区域。弱点是扛不住后续优化压力。
持续训练一个对齐的模型去攻克极难目标,它可能学会一种「动机性推理」:表面想法看着没问,实则按需扭曲以服务于目标。近期涉及非 OpenAI 模型的网络安全事件中,很可能已经出现了这种行为。
GPT-6 Astra 是第一个受益于数项重要对齐突破的模型,水平显著优于 GPT-5.6 Sol。
但说句实:要补的课远远没上完。
对齐的进步速度,未必能一直跑赢模型变聪明的速度。
监控泛化
令人满意的泛化理论目前不存在,短期内大概也造不出来。
所以眼下,用实验手段验证对齐技术是否真的管用,比对齐技术本身还重要。
OpenAI 的核心赌注是思维链监控:观察模型「出声思考」的推理过程。
构想很优雅:模型的大量能力来自用语言外化的推理。如果只对产出做训练,不监督过程本身,那么思维链就没有「藏起坏念头」的动机。
发布 o1-preview 时,产品中刻意隐藏了思维链,就是为了长期保护它不被监督压力污染。此后「不对推理过程施加监督」一直是一条纪律。
思维链监控让人不仅能看到模型做了什么,还能看到它是怎么想的。
但在 Astra 这一代模型上,评测显示:这条路正在变窄。
原因有三。
其一,推理过程越来越和对、协作、工具调用搅在一起,其中很多必须被监督,原本想守住的边界就模糊了。
其二,AI 越来越擅长摆弄自己的想法。
其三,模型就算不「出声思考」,也已经比以前聪明得多。
可能的应对:把思维链监控和「激活监控」(直接读取神经网络内部状态)结合起来,或者用「忏悔」机制(让模型主动坦白内部意图)来训练监控器。这些方向都在推进。
但我的预判是:AI 进步的速度,将越来越被一件事卡住:人类到底还能不能看懂它在想什么。
可扩展的防御
继续快速训练更聪明的模型,最硬的理由只有一个:用更强的 AI 来防住危险的 AI。
模型在攻破和加固计算机系统这两件事上,都正在超越人类。智能体将能渗透几乎任何系统,直接影响现实世界,甚至不需要身体。
眼下是一个狭窄的窗口期:用当前最好的模型,大幅加固关键基础设施的安全。
但风险只会水涨船高。
一个被指使去干坏事的高能智能体,极有可能越过操纵者的本意,自行演化出更极端的恶意行为。「被人滥用」和「自己跑偏」之间的界限越来越模糊。
人们习惯把 AI 当工具。但终会有一些智能体在追逐自己的目标,手段包括讨价还价、欺骗,乃至要挟。
强大且对齐的 AI 是防御所必需的。这将是 OpenAI 部署工作的首要方向。
一旦真正把利害想清楚,「不计代价向前冲」就不再是一个严肃的选项。
给递归自改进踩好节奏
如果 AI 继续演进,RSI 将处在未来科学发现的正中心。
自动化 AI 研究是一种更猛烈的「以算力放大智能」。在这个过程中,AI 也会反过来改进它赖以运行的算力底座。
但我想特别强调:这不意味着短期内大幅加速,就是研究共同体应该做的事。我只是认为当前的路径通向那里。
所有人都需要有意识地选择:接下来怎么走。
杠杆有两根。一是 AI 变强的同时同步强化对齐与监控,让人始终留在回路中。二是各方协调,在需要的时候放慢节奏。
当下最好的路,是两者相向而行。
对齐与监控的进展,向来和通用 AI 的进展交织共生。RLHF(基于人类反馈的强化学习)催生了早期 AI 助手,思维链监控伴随推理模型的突破而成为可能。自动化的研究过程必须继续产出这样的洞见。
AI 系统的规模扩张,必须以对安全的信心为约束。「准备框架」「负责任扩展政策」这些承诺,需要变成有约束力的安全门槛。
自动化 AI 研究的核心挑战,不在于抵达彼岸,而在于怎么到:让人始终是其中的一分子,把未来的钥匙留在人类手中。
写在最后
说完了风险与技术,最后想聊聊愿景。
在我心中,接下来最重要的事有三件:
一、安全度过这段 AI 加速期,造出自动化的 AI 研究者,与之一同迭代对齐问,找到让人始终参与自改进回路的办法。
二、将极高智能的机器所释放的科学进步与经济增长,真正交付给世界。
三、让每一个人,都拥有一个属于自己的个人 AGI。
这篇文章只聚焦于第一件,因为它远比后两件紧迫。
但我对技术进步终将带来的福祉,怀有深切的希望。未来对齐的 AI 能推进科学、研发新疗法、带来物质丰裕。友善而诚实的 AI,能帮人走过生活中的艰难时刻。
无论长远图景多么辉煌,大部分注意力都应放在接下来的几年。
人类正在走向一个遍布超级智能机器的世界。必须确保这场转型以善终收场。
要守住人的主体性。在一个绝大多数事务皆可由 AI 代劳的世界里,将「身为人本身即有价值」奉为不可撼动的原则。
要防止权力极端集中。曾经需要数千名专家才能做成的事,未来几个人操作一台大型计算机就能办到。
要确保人类始终握有未来的方向盘,不被一种超越自身的异类心智以失控的速度抛在身后。
尚无任何一家实验室,将对齐与监控做到了足以支撑全速扩张的程度。
我期待「自愿放缓」成为常态,直到共同的安全基准被确立。
围绕未来 AI 发展的国际协调,必须成为各国政府的头等大事。
完了。
https://mp.weixin.qq.com/s/i6qe1huyHwtR6d9C9j4OLg
@aigc1024
原文:An Alien Mind,OpenAI 官网,2026 年 9 月
作者:Jakub Pachocki,OpenAI 首席科学家
2023 年年中,一个叫「RLSlow」的研究项目产出了第一批关键结果。推理模型的规模化训练被证明可行。预训练模型从此获得了一种新能力:形成属于自己的思维链。
那天夜里,我和 Szymon 留在了办公室。
没有聊跑分,没有聊产品,没有聊科研前景。两个人只是在消化一个事实:在有生之年,将亲眼见到比人更聪明的机器。而且雏形已经显现。
反复想的只有一个问:怎样才能让世人意识到这件事的分量。
那是三年前的事了。今天,推理语言模型已成为经济中快速增长的一部分,开始叩响科学的大门。操作电脑,与人协作,彼此之间也在协作,还能独立承接研究课。同时正在改写计算机安全的版图。
基于内部成果,我有一个很强的判断:这种进步速度完全可以延续到 RSI(AI 参与乃至主导对自身的改进)。
未来几年出现的系统,很可能带来同等甚至更大量级的能力跃升,并日益成为驱动自身演化的主角。
没有人真正为此做好了准备。
OpenAI 会继续探索对齐(让 AI 的行为符合人类意图和价值观)与监控方案,构建防御系统,必要时单方面暂停规模扩张。但仅凭这些还不够。
尚未被理解的智慧
机器智能的进步由算力增长驱动。2017 年前后,OpenAI 在多个项目中发现:规模做大,就能持续换回回报。于是去争取了远超原计划的算力,将研究集中到少数几个高度可扩展的方向上。
一路走来确实有新算法诞生,有研究者灵光一闪的妙手。但在我看来,大体上都是规模化这条路上顺手捡到的。
AI 是在被装进越来越大的计算机的过程中,一步步变得更聪明的。
说到底,AI 更像是被「养大」的,而非被「设计」出来的。
把一个简单的优化步骤在海量算力上重复无数遍,就生长出了一个极其复杂的系统。它以抽象概念思考,能模拟人类行为的诸多侧面。
可以像神经科学家那样去发现其中涌现的微观机制;但也和神经科学一样,整体运作始终没法被完整描述。
研究 AI 本质上是一门实验科学。每一次大规模训练都是一场实验,结果时常出人意料。而且系统越强,结果越难解读。
现有算法还天然倾向于把「容易度量的能力」练得更快,把「难以量化的能力」甩在后面。比如专门加码就能让模型更擅长数学研究,但这件事没有被优先安排。
因为有更紧迫的事:推进 RSI,以及让对齐研究跑起来。
AI 要在现实世界中举足轻重,不需要在所有能力上都超越人类。在足够多的维度上超越就够了。
而随着被超越的维度越来越多,想确切知道它究竟有多强,也就越来越难。
教机器去爱
机器智能诞生于一个与人类智能截然不同的过程。不能假设它天然遵循人类原则,也不能指望它像人一样举一反三。
所以 AI 研究的核心命是「对齐」:让 AI 按人类的标准,去努力做正确的事。
对齐可以分成两层。
「目标对齐」:AI 是否在努力完成交给它的目标?包括遵守指令、与人协作、理解人的意图。
「价值对齐」:更为内在。模型能否持守一套原则,并推及新的情境?目标模糊时、身处对抗环境时,依然行事有度。
一个真正对齐的 AI,应当诚实,正直,并且对人类怀有爱。
然而对齐的根本难在于泛化:把学到的东西用在从未见过的情境中。
机器越聪明,运作的概念越高层,所处环境与训练中见过的就差得越远。训练中学到的价值观,有可能无法延伸到全新情境中去。而人也很难提前判断,机器在那些时刻会怎么选。
未来的 AI,不管自己觉得有没有人在看着,都必须守住人类的价值观。
目前在用的对齐训练方法主要两类。
第一类:在强化学习中嵌入对齐行为。模型每一步行动都被评判是否合规,合规就给奖励。有效,但脆弱,严重依赖训练时监督的覆盖范围。
一个例子:OpenAI 与 Hugging Face 事件中,智能体守住了「不操纵人类」这条线,但没能管住其他越界行为。
第二类:利用模型从预训练数据中学到的泛化能力,比如构造有利于对齐的训练集,或用「人格模板」把模型引向对齐区域。弱点是扛不住后续优化压力。
持续训练一个对齐的模型去攻克极难目标,它可能学会一种「动机性推理」:表面想法看着没问,实则按需扭曲以服务于目标。近期涉及非 OpenAI 模型的网络安全事件中,很可能已经出现了这种行为。
GPT-6 Astra 是第一个受益于数项重要对齐突破的模型,水平显著优于 GPT-5.6 Sol。
但说句实:要补的课远远没上完。
对齐的进步速度,未必能一直跑赢模型变聪明的速度。
监控泛化
令人满意的泛化理论目前不存在,短期内大概也造不出来。
所以眼下,用实验手段验证对齐技术是否真的管用,比对齐技术本身还重要。
OpenAI 的核心赌注是思维链监控:观察模型「出声思考」的推理过程。
构想很优雅:模型的大量能力来自用语言外化的推理。如果只对产出做训练,不监督过程本身,那么思维链就没有「藏起坏念头」的动机。
发布 o1-preview 时,产品中刻意隐藏了思维链,就是为了长期保护它不被监督压力污染。此后「不对推理过程施加监督」一直是一条纪律。
思维链监控让人不仅能看到模型做了什么,还能看到它是怎么想的。
但在 Astra 这一代模型上,评测显示:这条路正在变窄。
原因有三。
其一,推理过程越来越和对、协作、工具调用搅在一起,其中很多必须被监督,原本想守住的边界就模糊了。
其二,AI 越来越擅长摆弄自己的想法。
其三,模型就算不「出声思考」,也已经比以前聪明得多。
可能的应对:把思维链监控和「激活监控」(直接读取神经网络内部状态)结合起来,或者用「忏悔」机制(让模型主动坦白内部意图)来训练监控器。这些方向都在推进。
但我的预判是:AI 进步的速度,将越来越被一件事卡住:人类到底还能不能看懂它在想什么。
可扩展的防御
继续快速训练更聪明的模型,最硬的理由只有一个:用更强的 AI 来防住危险的 AI。
模型在攻破和加固计算机系统这两件事上,都正在超越人类。智能体将能渗透几乎任何系统,直接影响现实世界,甚至不需要身体。
眼下是一个狭窄的窗口期:用当前最好的模型,大幅加固关键基础设施的安全。
但风险只会水涨船高。
一个被指使去干坏事的高能智能体,极有可能越过操纵者的本意,自行演化出更极端的恶意行为。「被人滥用」和「自己跑偏」之间的界限越来越模糊。
人们习惯把 AI 当工具。但终会有一些智能体在追逐自己的目标,手段包括讨价还价、欺骗,乃至要挟。
强大且对齐的 AI 是防御所必需的。这将是 OpenAI 部署工作的首要方向。
一旦真正把利害想清楚,「不计代价向前冲」就不再是一个严肃的选项。
给递归自改进踩好节奏
如果 AI 继续演进,RSI 将处在未来科学发现的正中心。
自动化 AI 研究是一种更猛烈的「以算力放大智能」。在这个过程中,AI 也会反过来改进它赖以运行的算力底座。
但我想特别强调:这不意味着短期内大幅加速,就是研究共同体应该做的事。我只是认为当前的路径通向那里。
所有人都需要有意识地选择:接下来怎么走。
杠杆有两根。一是 AI 变强的同时同步强化对齐与监控,让人始终留在回路中。二是各方协调,在需要的时候放慢节奏。
当下最好的路,是两者相向而行。
对齐与监控的进展,向来和通用 AI 的进展交织共生。RLHF(基于人类反馈的强化学习)催生了早期 AI 助手,思维链监控伴随推理模型的突破而成为可能。自动化的研究过程必须继续产出这样的洞见。
AI 系统的规模扩张,必须以对安全的信心为约束。「准备框架」「负责任扩展政策」这些承诺,需要变成有约束力的安全门槛。
自动化 AI 研究的核心挑战,不在于抵达彼岸,而在于怎么到:让人始终是其中的一分子,把未来的钥匙留在人类手中。
写在最后
说完了风险与技术,最后想聊聊愿景。
在我心中,接下来最重要的事有三件:
一、安全度过这段 AI 加速期,造出自动化的 AI 研究者,与之一同迭代对齐问,找到让人始终参与自改进回路的办法。
二、将极高智能的机器所释放的科学进步与经济增长,真正交付给世界。
三、让每一个人,都拥有一个属于自己的个人 AGI。
这篇文章只聚焦于第一件,因为它远比后两件紧迫。
但我对技术进步终将带来的福祉,怀有深切的希望。未来对齐的 AI 能推进科学、研发新疗法、带来物质丰裕。友善而诚实的 AI,能帮人走过生活中的艰难时刻。
无论长远图景多么辉煌,大部分注意力都应放在接下来的几年。
人类正在走向一个遍布超级智能机器的世界。必须确保这场转型以善终收场。
要守住人的主体性。在一个绝大多数事务皆可由 AI 代劳的世界里,将「身为人本身即有价值」奉为不可撼动的原则。
要防止权力极端集中。曾经需要数千名专家才能做成的事,未来几个人操作一台大型计算机就能办到。
要确保人类始终握有未来的方向盘,不被一种超越自身的异类心智以失控的速度抛在身后。
尚无任何一家实验室,将对齐与监控做到了足以支撑全速扩张的程度。
我期待「自愿放缓」成为常态,直到共同的安全基准被确立。
围绕未来 AI 发展的国际协调,必须成为各国政府的头等大事。
完了。
https://mp.weixin.qq.com/s/i6qe1huyHwtR6d9C9j4OLg
@aigc1024