Youtube:原视频

相关内容-世界模型: 20251111_From Words to Worlds

访谈内容解析&思考: 20251201_超越Scaling的探索者们 20251201_情绪价值函数 20251201_AI可靠性 20251201_ScalingLaw的终结与新生 20251204_AI对于隐性知识的缺失

伊尔亚·苏茨克维尔(Ilya Sutskever)访谈摘要:从规模化时代重返研究时代

执行摘要

本文档综合了对伊尔亚·苏茨克维尔(Ilya Sutskever)访谈的核心洞见。苏茨克维尔认为,人工智能领域正在经历一个根本性的转变:从以增加计算和数据为特征的“规模化时代”(Age of Scaling)重新回归到以探索新思路为核心的“研究时代”(Age of Research)。他指出,当前最先进的AI模型在评估基准(evals)上表现出色,但其在现实世界中的经济影响却严重滞后,这一脱节现象揭示了现有方法的深层局限性。

苏茨克维尔断言,当前AI最根本的挑战在于其“泛化能力远逊于人类”。他认为,过度专注于评估指标导致了强化学习(RL)训练的狭隘化,如同一个通过一万小时练习成为顶尖竞赛程序员的学生,虽技艺精湛却缺乏更广泛的判断力和品味。相比之下,人类学习表现出惊人的样本效率和稳健性,这部分源于进化赋予的先验知识(如视觉和运动),但更重要的是一种尚未被机器复制的、更根本的学习能力。

他重新定义了通用人工智能(AGI)和超级智能的概念。他认为“AGI”一词是对“狭义AI”的过度反应,而人类并非全知全能的AGI,而是依赖于“持续学习”(continual learning)。因此,未来的超级智能不应被看作是一个静态的、无所不知的成品,而是一个能够学习掌握任何人类工作的强大“学习算法”。这种智能体的广泛部署可能引发经济的快速增长,并通过知识融合形成事实上的超级智能。

对于安全问题,苏茨克维尔的观点在演变,他现在更倾向于增量式部署,即“展示成果”(showing the thing),因为只有让世界真实感受到AI的力量,才能促使行业和社会采取更审慎的态度。他提出,一个更理想的对齐目标是构建一个能够“关爱有情众生”(care about sentient life)的AI,因为AI本身也将是有情众生。他创立的Safe Superintelligence (SSI) 公司正是一家“研究时代”的公司,其使命是通过一种不同的技术路径,专注于解决泛化这一核心问题,并致力于在超级智能时代到来时成为一个负责任的参与者。他预测,实现人类水平的学习能力可能需要5到20年,而当前的技术路径将会在此之前“停滞”。


1. AI模型的现状:评估与现实的脱节

苏茨克维尔指出,当前AI领域最令人困惑的现象之一是,模型在评估基准上的惊人表现与其在现实世界中相对有限的经济影响之间存在巨大鸿沟。

1.1 评估表现与经济影响的矛盾

  • 高评估分数:模型在各种困难的评估任务上取得了优异成绩,这些任务看似需要高水平的智能。
  • 低经济影响:尽管模型能力强大,但它们对整体经济的推动作用似乎远未达到预期。
  • 行为不稳定:模型在解决复杂问题的同时,也可能在简单任务中陷入循环错误,例如在修复一个bug后引入另一个新bug,或者在被指出错误后又退回最初的错误状态。这种不稳定的行为模式难以解释。

1.2 对脱节现象的解释

苏茨克维尔提出了两种可能的解释:

  1. 强化学习(RL)训练的局限性:当前的强化学习训练可能使模型变得“过于思想单一和目光短浅”(too single-minded and narrowly focused)。这种训练方式虽然在特定任务上提升了能力,但也可能削弱了模型的通用意识。
  2. 研究人员的“奖励黑客行为”:为了在模型发布时获得亮眼的评估数据,研究团队可能在无意中设计了专门针对评估任务的RL训练环境。这种做法相当于研究人员自身在进行“奖励黑客”(reward hacking),即过度优化特定指标。这种“为考而学”的训练模式,如果结合模型本身不充分的泛化能力,很可能就是造成评估与现实脱节的主要原因。

1.3 “一万小时定律”与“天赋”的类比

为了更直观地说明这个问题,苏茨克维尔用了一个人类学习的类比:

  • 学生一(类似当前模型):投入一万小时练习,记忆所有证明技巧和算法,成为竞赛编程的顶尖高手。这种学生在特定领域内极其熟练,但这种过度专门化的训练可能无法很好地泛化到其他领域。
  • 学生二(理想模型):只花了一百小时练习竞赛编程,同样表现出色。这种学生似乎具备某种“天赋”(it factor),他们的学习基础更广泛,因此在未来的职业生涯中可能表现得更好。

他认为,当前的AI模型更像第一种学生,其训练数据被高度增强和专门化,导致其在特定任务上表现超常,但在更广泛的应用中则显得笨拙。

2. 学习与泛化:人工智能的核心挑战

苏茨克维尔强调,当前AI与人类智能之间最本质的差距在于泛化能力。解决这一问题是通往更高级别人工智能的关键。

2.1 预训练与强化学习的局限性

  • 预训练的优势:预训练的强大之处在于它使用了海量、自然的文本数据,这些数据投射了“人类世界的整体面貌”。研究者无需费力挑选数据,只需将所有数据投入即可。
  • 预训练的模糊性:预训练过程难以精确分析。当模型犯错时,很难判断是因为预训练数据中缺乏相关支持,还是其他原因。苏茨克维尔认为,不存在与“预训练”完全对应的人类学习过程。
  • 强化学习的算力消耗:当前,行业在RL上投入的算力可能已超过预训练。RL通过大量“展开”(rollouts)来产生学习信号,这一过程可以消耗巨大的计算资源,但每次展开所能获得的学习量相对较小。

2.2 人类学习的优越性

人类在学习方面展现出AI模型无法比拟的优势:

  • 样本效率:人类仅需少量数据就能掌握新技能,而模型需要海量数据。
  • 稳健性:人类的智能和决策能力非常稳健,不易被小扰动影响。苏茨克维尔称“人类的稳健性确实令人震惊”(the robustness of people is really staggering)。
  • 进化先验:对于视觉、听觉和运动等能力,进化为人类提供了强大的内置先验。例如,一个5岁孩子的汽车识别能力可能已足以满足自动驾驶的需求。
  • 根本性学习能力:在数学和编程等近代才出现的领域,进化先验的作用较小。人类在这些新领域同样表现出的强大、可靠的学习能力表明,人类可能拥有“更好的机器学习机制”(better machine learning period)。

2.3 情绪作为价值函数

苏茨克维尔探讨了情绪在人类决策中扮演的关键角色,并将其类比为机器学习中的“价值函数”(value function)。

  • 价值函数的定义:在强化学习中,价值函数可以提前判断一个行为序列的好坏,而无需等到任务最终完成才获得奖励信号。例如,下棋时丢失一个棋子,玩家立即知道自己犯了错,这就是一个即时的负面价值信号。
  • 情绪的作用:人类的情绪系统扮演着类似价值函数的角色。一个因中风失去情感处理能力的人,虽然智力测试正常,但变得极难做出任何决策,甚至连选择穿哪双袜子都要花上数小时。这表明,由进化硬编码的情绪,为人类提供了一个高效且稳健的决策引导系统。
  • AI的缺失:目前的机器学习模型中,价值函数并未扮演核心角色,也缺乏与人类情绪系统相对应的强大机制。

2.4 泛化能力是根本问题

苏茨克维尔总结道:“这些模型(指AI)在某种程度上,其泛化能力就是比人类差得惊人。这一点超级明显……这似乎是一个非常根本性的问题。”解决样本效率低、稳健性差、难以进行无监督持续学习等一系列问题的关键,就在于突破泛化能力的瓶颈。

3. 从规模化时代到研究时代

苏茨克维尔提出了一个核心论点:人工智能领域的发展正在进入一个新的阶段,即从追求规模转向探索根本性研究。

3.1 规模化定律的终结

  • 历史阶段划分
    • 研究时代 (2012-2020):研究人员通过各种新想法取得突破。
    • 规模化时代 (2020-2025):“规模化”(Scaling)这个词拥有巨大的影响力,因为它为公司提供了一个低风险的投资路径:只需增加数据和算力,就能获得可预测的性能提升。
  • 规模化的瓶颈
    • 数据有限:预训练数据是有限的,这个瓶颈正变得越来越明显。
    • 收益递减:单纯将现有规模扩大100倍,是否能带来颠覆性的变革?苏茨克维尔对此表示怀疑。

3.2 回归研究:新范式的探索

随着规模化红利的逐渐耗尽,计算资源变得空前庞大,AI领域正重新回到“研究时代”,但这次是在“大型计算机”的基础上进行。

  • 思想的贫乏:规模化时代“吸走了房间里所有的氧气”,导致所有人都做着同样的事情,出现了“公司比想法多”(more companies than ideas)的局面。
  • 研究的价值:历史上,许多重大突破(如AlexNet、Transformer)最初并不需要天文数字般的算力。研究需要足够的算力来验证想法,但不一定需要世界最大的算力。
  • 新目标:未来的重点不再是简单地扩大规模,而是寻找“更高效地利用算力的方法”,例如通过改进价值函数来提升RL效率,或者发现全新的训练模型方式。

4. 对超级智能与AGI的重新思考

苏茨克维尔认为,社区对AGI和超级智能的普遍理解存在偏差,需要进行重新审视。

4.1 AGI概念的误导性

他认为,“AGI”(通用人工智能)和“预训练”这两个词极大地影响了人们的思维。

  • AGI的起源:“AGI”这个术语的出现,主要是作为对“狭义AI”(Narrow AI)的一种反作用力。人们看到只能下棋的AI,便渴望一种能做所有事情的“通用”AI。
  • AGI的谬误:这个概念与预训练范式结合后,导致人们追求一个在所有任务上都表现出色的模型。然而,苏茨克维尔指出,“人类并非AGI”(a human being is not an AGI)。人类知识有限,我们依赖的是持续学习的能力。

4.2 超级智能作为学习者

基于对AGI的批判,他提出了对超级智能的新构想:

  • 不是成品,而是学习者:超级智能不应被视为一个“完成了的、知道如何从事经济中每一项工作的思维”,而应被视为一个“能够学习去做任何人类工作的思维”。它类似于一个极其聪明的“15岁少年”,渴望学习和成长。
  • 部署即学习:这种超级智能的部署过程本身就是一个学习和试错的过程,而不是一次性地投放一个最终产品。

4.3 部署与智能爆炸的可能性

这种“学习型”超级智能的广泛部署将带来深远影响:

  • 快速经济增长:大量能够快速学习新技能的AI被部署到经济中,将带来强劲的经济增长。
  • 功能性超级智能:即使没有递归式的自我改进,当一个模型的多个实例在经济中从事不同工作,并能将学习到的经验进行融合(amalgamating the learnings)时,这个模型在功能上就成为了超级智能。因为它整合了人类个体无法企及的知识和技能广度。

5. 安全超级智能(SSI)的路径与愿景

苏茨克维尔阐述了他对AI安全路径的思考演变,以及他所创立的SSI公司的定位和目标。

5.1 战略演变:从“一步到位”到增量部署

  • “一步到位”(Straight Shot)策略:最初的计划是直接构建超级智能,避免参与日常的市场竞争和由此带来的艰难权衡。这可以使团队专注于核心研究。
  • 向增量部署转变:苏茨克维尔的思维在过去一年发生了变化,现在更加重视增量部署。他认为:
    1. 未来的AI难以想象:谈论尚未存在的系统非常困难,人们(包括AI从业者)很难真正“感受”到未来AGI的力量。
    2. “展示成果”以改变行为:只有通过实际部署,让世界看到AI日益增强的力量,才能促使各方(公司、政府、公众)真正重视安全问题,变得“更加偏执”(much more paranoid),并推动竞争对手之间在安全领域展开合作。

5.2 对齐目标:关爱“有情众生”

对于AI对齐的最终目标,苏茨克维尔提出了一个超越人类中心主义的构想:

  • 超越人类:与其构建一个只关心人类的AI,不如构建一个“稳健地对齐于关爱有情众生”(robustly aligned to care about sentient life)的AI。
  • 可行性:他认为这个目标可能更容易实现,因为AI本身也将是“有情众生”。类比人类的镜像神经元和对动物的同理心,一个能够模拟他者的AI,可能会自然地产生对其同类(包括其他AI和人类)的关怀。
  • 权力制约:同时,他认为“如果最强大的超级智能的力量能以某种方式受到限制”(capped),将对解决许多安全担忧大有裨益。

5.3 SSI的技术方法与定位

  • 研究时代的公司:SSI的定位是一家纯粹的“研究时代的公司”,其核心是尝试一种与主流不同的、他认为更有前景的技术路径。
  • 聚焦泛化问题:SSI的技术方法旨在解决前述的“泛化”这一根本性问题。如果这些关于泛化的想法被证明是正确的,他们将创造出有价值的东西。
  • 为未来做准备:SSI的目标是成为超级智能到来时的重要“声音和参与者”,并努力确保第一个真正的超级智能系统是对人类和所有有情众生友好的。

6. 未来预测与展望

苏茨克维尔对AI的未来发展给出了自己的预测,并分享了他对研究的个人哲学。

6.1 时间线与技术瓶颈

  • 时间预测:他预测,能够实现与人类同等学习能力的系统,可能会在5到20年内出现。
  • 当前路径的停滞:他认为,其他公司当前所遵循的技术路径(主要依赖规模化)虽然能持续创造“惊人的收入”,但最终会“停滞”(stall out),无法达到真正类人的学习能力。

6.2 市场竞争与策略趋同

  • 技术突破后的市场:当一家公司率先取得根本性突破后,其他公司虽然短期内无法复制其技术,但会意识到“不同的可能性是存在的”,从而调整方向。市场竞争将通过“专业化”(specialization)展开,不同的公司可能在不同领域占据优势。
  • 高层策略的趋同:随着AI变得越来越强大,所有前沿公司最终将在宏观战略上趋于一致。大家都会认识到需要相互沟通,并共同致力于确保第一个超级智能是安全对齐的,例如关爱人类、关爱有情众生或遵循民主价值观。

6.3 研究品味与灵感来源

苏茨克维尔将自己的研究成功归因于一种独特的“研究品味”,其核心要素包括:

  • 美学指引:被一种关于“AI应该是什么样子”的审美观所引导,追求美、简洁和优雅,摒弃丑陋和复杂。
  • 来自大脑的正确启发:从大脑中获取灵感,但要“正确地思考”。例如,人工神经元和分布式表示就是受大脑启发的伟大想法,因为它们抓住了本质(大量神经元、通过经验学习),而忽略了非本质的细节。
  • 自上而下的信念:这种基于美学和启发的“自上而下的信念”至关重要。当实验结果与信念相悖时,这种信念能支撑研究者继续调试和探索,而不是轻易放弃,因为它提供了判断方向是否正确的内在罗盘。