原文:The Second Half(原文 wiki)

AI解读: 20250915_AI解读The Second Half

阅读摘录

AI做的图表: 表1:人工智能发展“上下半场”的比较框架

维度“上半场”(能力时代)“下半场”(效用时代)
主要目标在基准测试上达到业界最佳(SOTA)创造可衡量的经济与科学价值
核心挑战**方法论:**设计新颖的训练方法和模型架构评估: 定义有意义的问题和稳健的评估环境
核心活动模型训练与优化任务制定与环境设计
典型突破一种新的通用模型架构(例如,Transformer, AlexNet)1一个能预测真实世界效用的新交互式基准(例如,Chatbot Arena)1
主导指标排行榜分数(例如,准确率,BLEU分数)生产力提升、成本降低、新科学发现
竞争护城河算法的独创性和模型设计的精巧性对专有真实世界问题和人类交互数据的掌握

上半场:解决问题;下半场:定义问题。 上半场:技术思维;下半场:产品思维。

强化学习的三个关键组成部分:算法、环境、先验

事实证明,强化学习最重要的部分甚至可能不是强化学习算法或环境,而是先验知识,而先验知识可以通过一种与强化学习完全无关的方式获得。

然而,正是“上半场”的巨大成功,催生了一个深刻的悖论。这一系列方法论突破最终汇聚成一个强大的“配方”,这个“配方”的出现,反而削弱了创造它的那种研究活动的独特性和价值。当一个领域的进步变得“标准化和工业化”时,其竞争格局必然会发生剧变 。  

这里的逻辑链条十分清晰:

  1. 作者指出,由大规模语言预训练、规模化(数据与算力)以及推理与行动相结合的“配方”,使得在基准测试上取得进展的过程变得标准化和工业化 。  

  2. “工业化”意味着一个过程变得可重复、可预测,并且不再依赖于少数天才的灵光一现。它更多地演变为一个工程和资本配置的问题。

  3. 当一项核心活动被工业化后,它作为差异化竞争优势的战略价值就会下降。竞争的焦点不再是谁能设计出稍微更巧妙的算法。

  4. 因此,竞争优势必然会转移到其他领域。其一,是掌握“配方”的原材料,即用于大规模计算的巨额资本和专有数据集,这显然有利于资金雄厚的超大规模企业(hyperscalers)。其二,是开辟下一个尚未被工业化的新战场。

文章通过作者在强化学习(Reinforcement Learning, RL)领域的个人研究经历,生动地阐述了这个改变游戏规则的“配方”是如何形成的 。这个“配方”主要包含三个关键成分:  

  1. 来自预训练的先验知识 (Priors from Pre-training): 作者回顾了RL领域的发展,早期研究者主要关注RL算法本身。然而,随着深度RL的演进,环境(environment)的重要性日益凸显。最终,通过GPT-2和GPT-3的实践,研究者们意识到,缺失的关键环节是“先验知识”(priors)。这些知识可以通过与RL无关的方式(例如大规模语言预训练)高效地获取 。LLMs通过在海量文本数据上的学习,内化了关于世界运作方式、语言结构和常识推理的丰富知识,这正是纯粹的RL算法难以从零开始学习的。  

  2. 规模化 (Scaling): 仅仅有先验知识是不够的。让这些知识变得强大和通用的关键在于规模化——即使用海量的数据和庞大的计算资源进行训练。规模定律(Scaling Laws)的发现表明,模型性能会随着模型大小、数据集大小和计算量的增加而可预测地提升。这使得通过投入更多资源来换取更强能力成为一种可靠的工程路径。

  3. 将推理视为行动 (Reasoning as Action): 这是作者个人经历中最具启发性的“尤里卡时刻”。在2019年,作者观察到,即便是基于GPT-2这样强大预训练模型的智能体,在解决文本游戏时也需要数百万步的RL训练才能取得进展,并且无法泛化到新的游戏 。这与人类能够零样本(zero-shot)玩新游戏的表现形成鲜明对比。作者意识到,人类的泛化能力来源于一种内在的“思考”或“推理”能力。这种“思考”是一种特殊的行动,它不直接改变外部世界,但能让智能体利用其预训练的先验知识来规划和决策 。这一洞见直接催生了像ReAct(Reasoning and Acting)这样的研究,并成为现代AI智能体(agentic AI)范式的核心组成部分。

更重要的是效用问题。 1.评估”应该”自动运行。 2.评估”应该”运行独立同分布。 作者所识别出的这些评估范式缺陷并非偶然。它们是支配学术界和企业界AI研究的激励结构(incentive structures)所导致的直接后果。这背后反映了一个经典的社会学定律——古德哈特定律(Goodhart’s Law):“当一个测量指标成为一个目标时,它就不再是一个好的测量指标。”

language generalizes through reasoning in agents

如果人类泛化的能力,来源于内在的”思考”或者”推理”,那么真正有价值的Agent应用,就应该落在这个地方。

对于工程师与产品负责人: 应将战略重心从开发全自动智能体,转向构建卓越的“副驾驶”式工具。用户体验和人机交互界面不再是锦上添花的附属品,而是决定产品成败的核心战场。如何设计能够与人类无缝协作、激发人类创造力的AI产品,将是未来十年最重要的工程挑战之一。

演变过程

1. 传统强化学习(RL)的视角

在经典强化学习和早期深度强化学习中,研究者们认为智能主要来自于一个强大的学习算法(Algorithm)

  • 先验 (Priors): 智能体(Agent)几乎是从零开始的,就像一个什么都不懂的婴儿,它几乎没有关于世界的先验知识。

  • 环境 (Environment): 是智能体需要去探索和解决的问题空间。

  • 算法 (Algorithm): 这是绝对的核心。大家致力于发明更高效的算法(如Q-learning, PPO等),让智能体能通过与环境的大量交互,从零开始学习,自行“悟”出规律。

这个阶段的关系是:强大的 算法 + 大量的 环境 交互 ≈ 智能行为。而 先验 是被忽略或最弱的一环。


2. 作者思路的转变与“配方”的诞生

作者在研究中发现,即使算法再好,智能体在一个需要常识和知识的复杂环境中(比如文字冒险游戏),依然像无头苍蝇。他意识到,真正缺失的是 先验——即关于世界是如何运作的基础知识。

这时,大规模预训练语言模型(如GPT)出现了,它们通过读取海量文本,已经学习并内化了庞大的世界知识。这为提供强大的 先验 创造了可能。

于是,作者提出的新“配方”就登场了,它的三个成分恰好是对传统RL三要素关系的重塑:

  • 配方成分1:来自预训练的先验知识

    • 直接对应 先验。这是对传统RL范式最大的颠覆。不再让智能体从零学起,而是直接给它一个装满了人类知识的“大脑”(即预训练模型)。这是新范式的基石。
  • 配方成分2:规模化(Scaling)

    • 强化 先验。通过使用更大的模型、更多的数据进行预训练,可以让这个“大脑”里的先验知识更丰富、更强大、更通用。
  • 配方成分3:将推理(Reasoning)视为行动

    • 重塑 算法环境 的互动方式。这是最巧妙的一点。传统RL的“行动”是与外部环境交互(比如在游戏中“向东走”)。而作者提出,智能体还可以执行一种内部行动,即“思考”或“推理”。当智能体在环境中遇到难题时,它可以先不急着行动,而是调用预训练模型这个“大脑”进行一番“头脑风暴”(例如自问自答:“我现在该怎么办?我有什么选择?”),利用强大的 先验 知识来制定策略,然后再去与 环境 交互。

    • 这种做法使得具体的 算法 本身变得不那么重要了。因为最困难的“认知”部分,已经被强大的 先验 和推理行动完成了。RL算法更多是起一个“粘合剂”的作用,帮助智能体学会何时该去行动、何时该去“思考”。


总结:关系的变化
  • 旧关系算法是核心,在环境中从零开始学习,先验知识微不足道。

  • 新关系(配方)先验知识是核心(由预训练和规模化提供)。算法的角色被弱化,它主要是学会如何通过“推理行动”来调用和利用这些强大的先验知识,从而更有效地在环境中解决问题。

所以,作者的“配方”并不是与强化学习的三要素无关,而是一个如何将这三者以一种全新、更高效的方式组织起来的蓝图。在这个蓝图中,预训练模型带来的强大“先验”成为了绝对的主角。