TL;DR: 作为强化学习的教父,理查德·萨顿正以69岁高龄投身创业,试图打破大语言模型对静态数据的依赖。他主张通过“经验驱动”的实时学习重构AI范式,并尖锐地挑战了当前工业界关于“对齐”的迷思。
在WAIC 2026的会场,当人群簇拥着那些谈论万亿参数和Token吞吐量的明星企业时,理查德·萨顿(Richard Sutton)显得有些格格不入。这位两鬓斑白、眼神却闪烁着某种倔强光芒的图灵奖得主,刚刚宣布了一项令行业侧目的决定:离开卡马克(John Carmack)的Keen Technologies,成立Oak Lab。
这不仅是一次简单的换帅。在不少人眼中,这是这位“强化学习之父”向当前主流的大语言模型(LLM)范式发起的公开挑战。
20瓦的执念:向生物智能回归
萨顿对当下AI进展的评价直率得近乎残酷——“有一定程度的失望”。在他看来,过去八年的AI进化路径,是在海量人类文本的温室里制造了一场精巧的幻觉,而非真正的智慧。
“人脑只用大约20瓦的功耗,就完成了我们所做的一切。”他在采访中多次强调这一参照系。在Oak Lab的蓝图中,他试图构建一个能够实时学习、实时规划、功耗仅为20瓦的万亿参数系统。这并非天方夜谭,而是基于他对“经验学习”的极致推崇。他认为,当前依赖数据预训练的架构在能耗和效率上是“天然浪费的”,而真正的智能体必须像婴儿一样,在与环境的交互中通过试错(Trial and Error)实现自我完善。
挑战“苦涩的教训”之后的范式
早在2019年,萨顿撰写的那篇《苦涩的教训》曾被视为LLM狂潮的理论基石。然而,当被问及对此的解读时,萨顿表现出了一种作为科学家的严谨与自嘲:“人们误解了我的意思。”他认为,AI界并未真正贯彻该文章的核心精神——即通过通用的学习机制随计算规模扩张,而是陷入了对人类既有数据知识的过度依赖。
为了修正这一偏差,萨顿提出了“OaK”(Options and Knowledge)架构。他希望智能体不再是一个被动的信息提取器,而是一个具备“能动性”(Agency)的实体,能够将经验拆解为“选项”(Options),在长时间轴上实现自主决策。
“对齐”:一种危险的人类把戏
在访谈中最具争议的时刻,萨顿否定了当前火热的“AI对齐”叙事。他直言,所谓的“对齐到人类价值观”本质上是一个伪命题,甚至是一种带有操纵色彩的“人类把戏”。
“这世界上根本不存在单一的‘人类价值观’。”萨顿指出,如果某种技术能够强行将AI与特定价值观对齐,那么谁拥有这项技术,谁就拥有了制造独裁的工具。他认为,人类社会之所以能维持多元和平,正是因为我们无法被完全对齐,而AI的发展也不应成为某种特定意志的延伸。
科学家的苦功
面对焦虑的年轻人,萨顿给出的建议极为朴素:回到第一性原理,准备一个笔记本,每天写一页想法。他承认,这是一场苦功,但在这信息爆炸的时代,这是构建个人“力量中心”的唯一途径。
即便已经步入古稀之年,萨顿依然保持着对未知的极度饥渴。他将自己定义为一个研究者,而非追逐流量的商人。对于未来,他给出了一个谨慎的预测:AGI的到来可能在2030年到2040年之间。他正在等待的,不仅仅是算力的又一次翻倍,而是那个属于“经验时代”的、真正的火花。