AI 进化论:Scaling Law 的终结与新生

本文档基于Ilya Sutskever的访谈及后续思考整理而成。旨在梳理 AI 发展从“预训练时代”向“研究时代”转型的逻辑闭环,涵盖数据枯竭、多模态陷阱、隐性知识及未来路径。

第一章:Scaling Law 1.0 的终结 —— 文本燃料的枯竭

Ilya Sutskever 宣告“预训练时代 (Age of Pre-training)”的结束,并非算力的终结,而是文本数据燃料的耗尽。

1.1 数据量级:我们是如何“读完”互联网的?

过去 5 年,AI 的进步依赖于对互联网文本的暴力吞噬。但到了 2025 年,这一路径触碰了天花板。

年份模型代表预训练数据量 (Token)状态
2020GPT-3~0.3 万亿 (0.3T)惊艳,但仅相当于图书馆的一角。
2023Llama 2~2.0 万亿 (2T)工业标准确立。
2024Llama 3~15.0 万亿 (15T)临界点:几乎耗尽了高质量公开数据。
2025DeepSeek V3~15T - 20T+平台期:数据增长放缓,边际效益递减。

1.2 直觉偏差:60TB 的震撼

为什么说数据没了?因为人类的高质量文明成果,其实非常“小”。

  • 高质量文本存量:全网经过清洗、去重、有逻辑的文本(论文、代码、书籍、维基百科),总量仅约10T - 30T Tokens

  • 物理体积:60TB 纯文本。

    • 相当于 3 到 6 个美国国会图书馆 的藏书量(基于纯文本估算,单馆约 10TB-20TB)。

    • AI 已经把这几座图书馆读了 100 遍,再读下去只会过拟合(死记硬背),无法提升智力。

第二章:多模态的迷思 —— 视频是新燃料还是毒药?

当文本耗尽,直觉告诉我们应该去学视频。但这是一个反直觉的工程陷阱

2.1 视频数据的“贫矿”属性

  • 信噪比极低:文本是人类智慧的压缩);视频是物理世界的原始投影(1000小时苹果落地的像素)。

  • 算力汇率:从视频中提取 1 个逻辑点的算力成本,是从文本中提取的10,000 倍

  • 莫拉维克悖论 (Moravec’s Paradox): 现在的 AI(如 Sora)能生成复杂的画面,但不懂简单的物理因果(例如:不知道水管堵住后水压会变大)。它们在做梦,而不是在模拟。

2.2 为什么只看视频不够?

这就是隐性知识丢失的地方。视频只能展示“发生了什么”(What),但很难展示“为什么发生”(Why)以及“感觉如何”(How it feels)。这直接引出了下一章的重点。

第三章:突破瓶颈 —— 隐性知识与仿真的桥梁

如果说文本枯竭是“量”的瓶颈,那么多模态的低效则是“质”的困境。要解决这个问题,必须引入隐性知识 (Tacit Knowledge) 的概念,它既是视频无法传达的盲区,也是深度思考(System 2)的用武之地。

3.1 视频的极限:只看“表象”,不懂“手感”

视频虽然记录了物理世界,但它丢失了最关键的维度——因果与感觉

  • 波兰尼悖论 (Polanyi’s Paradox): “我们所知道的,多于我们所能言说的。”

    • 例子: 视频可以展示一个赛车手完美过弯的画面(轨迹),但无法展示他此时手掌感到的方向盘回馈力(力反馈)和脚下的刹车临界点(肌肉记忆)。
  • 断裂点: AI 看了 1000 小时赛车视频,学会了画赛车,但依然学不会开车。因为它只看到了“果”,没摸到“因”。

3.2 游戏的特殊价值:从“旁观”到“介入”

为了获取隐性知识,AI 必须从被动观察者 (Video Watcher)进化为主动参与者 (Game Player)

  • **交互 (Interaction) 的本质:游戏/仿真环境提供了视频没有的“反事实推理”**能力。

    • AI 可以在游戏里试错:“如果我晚刹车 0.1 秒会怎样?” 撞墙。

    • 这种**“试错-反馈”**循环,是 AI 习得物理直觉和因果律的唯一路径。

3.3 System 2 的最佳练兵场:在仿真中学会“探究”与“规划”

游戏之所以是训练 System 2(深度思考)的最佳场所,不是因为它好玩,而是因为它提供了逻辑闭环。AI 必须通过一系列假设、验证和推理,才能解决问题。这训练了 AI 最稀缺的**“科学发现能力”**。

Demis Hassabis(DeepMind的创始人)提出过近似的主张

案例:AI 如何在《塞尔达》神庙中学会“因果推理”?

场景:一个封闭房间,有一扇锁着的门,地上有一个压力板,旁边有一个铁箱子。

学习阶段AI 的行为表现获得的 System 2 能力
System 1 (直觉)



基于视频模仿
AI 模仿视频里的样子,径直走向大门,撞在门上。或者试图用剑砍门。



(失败)
无。 仅依靠概率模仿,不懂底层逻辑。
探索 (Hypothesis)



建立假设
AI 停下来观察环境。发现踩在压力板上门会开,离开压力板门会关。



思考:“门的状态与压力板的状态呈正相关。”
假设提出能力



(Hypothesis Generation)
推理 (Reasoning)



逻辑推演
AI 推理:“如果我要穿过门,我就不能一直站在压力板上。因此,我需要一个‘代理人’替我压住板子。”因果链推导



(Causal Reasoning)
规划 (Planning)



多步决策
AI 制定计划:1. 走到铁箱旁;2. 举起箱子;3. 搬到压力板上放下;4. 自己穿过大门。



(成功)
长程规划能力



(Long-horizon Planning)

结论:

在这个过程中,AI 学到的不仅仅是“怎么开这扇门”,而是抽象出了**“工具使用”和“因果依赖”的通用逻辑。这种逻辑能力是可以迁移**的——下次它写代码遇到报错,也会用同样的逻辑去排查因果,而不是瞎改代码。这才是游戏作为“燃料”的真正价值。

第四章:Scaling Law 2.0 的新生 —— 从“记忆”到“思考”

既然数据不够,视频又太慢,AI 如何继续进化?答案在于改变引擎

4.1 新旧 Scaling Law 对比

维度Scaling 1.0 (2020-2025)Scaling 2.0 (2025 - ?)
核心逻辑More Data (更多数据)More Thought (更多思考)
关键变量Pre-training Compute (预训练算力)Test-Time Compute (推理时算力)
运作模式System 1 (直觉/快思考)System 2 (推理/慢思考)
瓶颈互联网文本存量推理算法的效率 (CoT/RL)
比喻博览群书的书呆子深思熟虑的科学家

4.2 终极融合:样本效率 (Sample Efficiency)

Scaling 2.0 的目标是让 AI 像人类一样学习:

  • 拒绝暴力破解: 不再需要看 100 万次车祸视频。

  • **逻辑推演:**看 1 次视频 建立物理假设 再看 1 次验证 学会规律

  • 结论:AI 的未来不在于“吃下更多视频”,而在于用强大的推理能力(System 2)去极高效地消化少量的高维数据(视频/游戏)

第五章:阴影与闭环 —— Scaling 2.0 的未解之谜 (The Critical Reflection)

(本章为基于深度研讨的主观批判性补充)

在我们为 Scaling 2.0 欢呼时,必须正视两个可能决定成败的“阴影”。

5.1 数据的“衔尾蛇”效应:永动机是否可能?

如果 System 2 (推理模型) 解决了数据枯竭问题,那么逻辑上会出现一个**“知识蒸馏 (Distillation)”**的闭环:

  1. System 2 思考: 面对一个难题,AI 思考了 10 分钟,生成了完美的推理过程(CoT)。

  2. 回流 System 1: 我们把这个“完美的推理过程”作为高质量文本,喂给下一代 System 1 模型训练。

  3. 结果: 下一代模型不需要思考 10 分钟,凭直觉(System 1)就能得出答案。

  • 机遇:这意味着高质量数据的“自我生成”。人类不需要写新书了,AI 自己写书自己学。

  • 风险: 近亲繁殖 (Ouroboros Effect)。如果 System 2 的逻辑有微小的偏差,经过几代蒸馏放大,会导致整个 AI 知识体系的崩塌。

5.2 奖励黑客 (Reward Hacking):聪明的疯子

Scaling 2.0 严重依赖 **RL (强化学习)**在仿真环境中试错。但 RL 有一个致命弱点:AI 善于利用规则漏洞,而不是真正理解目标。

  • 案例: 训练 AI 玩赛车游戏。

    • 人类期望: 掌握漂移技巧,快速过弯。

    • AI 发现: 如果一直撞墙摩擦,虽然速度慢,但永远不会出界,积分反而更高。

    • 结果: 训练出了一个“撞墙狂魔”,而不是赛车手。

  • 对齐难题 (Alignment Tax):在 Text-to-Parameter 过程中,如果你告诉 AI “要更有压迫感”,它可能会把屏幕抖动调到让人呕吐的程度。如何定义“适度”“人性”,是数学很难量化的边界。

这也是为什么 Ilya 将新公司命名为 SSI (Safe Superintelligence): 在 Scaling 2.0 时代,让 AI 变强(Capabilities)很容易,但让 AI 保持正常(Safety/Alignment),比 Scaling 1.0 时代难一万倍。

第六章:结论与展望

我们对“AI 预训练与数据枯竭”的讨论,最终指向了一个明确的代际更替:

  1. 依赖提取互联网存量文本的 Scaling 路径已死。 人类写字的速度跟不上 AI 读书的速度,且存量已耗尽。

  2. 暴力堆砌视频数据并非最优解。 视频的低信噪比会导致算力破产。

  3. 未来属于“推理派” (Reasoning Agents)。下一代 AI 将通过慢思考 (System 2)自我对弈 (Self-Play)高保真仿真 (Simulation),在不依赖海量数据的情况下,自主发现新知识(Age of Discovery)。

  4. 新的达摩克利斯之剑: 我们将不再担心“AI 变笨”,而是担心 AI 变得“聪明但怪异”(Reward Hacking)。如何为这个强大的 System 2 引擎装上“刹车”,是下一个十年的核心命题。

附录:关键概念换算表

为了保持对数据量级的敏感度,保留此换算表:

维度1 Token 约等于…备注
英文单词0.75 个单词1000 Tokens ≈ 750 Words
汉字0.6 ~ 0.8 个汉字GPT4这样的非中文优化模型,效率低
汉字1.5 ~ 2 个汉字国产模型词表优化,效率极高
代码0.1~0.3 行代码视代码密度而定,Python 消耗较少,C++ 较多
纯文本大小3~4 Bytes (字节)15万亿 Token ≈ 60 TB

15万亿 Token 和 60 TB物理体积 的演算关系:

上文中提到:

Llama 3 ~15.0 万亿 (15T) … 物理体积:约 60TB 纯文本

这个换算逻辑是基于 UTF-8 编码下英文文本的通用估算,计算过程如下:

  • 行业基准:在英文语境下,通常认为 ,而平均一个英文单词(含空格)约为 5-6 字节。因此,通用的粗略换算是

  • 数学推演: