TenStep

Scaling 不是魔法,更像一台放大器:问题定义得合适,更多数据、参数和计算会把反复出现的规律积累成能力;问题定义错了,它们只会让模型更熟练地优化错误的目标。

我们习惯把深度学习的进步概括成三个词:更多数据、更大模型、更多计算。

这个叙事大体没错,却省略了一个更早发生、也更容易被忽略的步骤:现实问题必须先被翻译成一个适合学习的问题。

数据不会直接进入“现实”。它总要进入一套人为选择的表示:什么是一个基本元素,什么算相同,什么算相近,复杂答案怎样被拆开,模型犯错以后又从哪里得到反馈。只有这些假设足够贴近我们真正期待解决的任务,数据和算力才可能持续转化成能力。

这里说的“问题空间”并不只是一个向量空间。更准确地说,它是任务使用的表示域及其结构:包括输入、中间表征与输出,也包括什么算相同或相近、问题如何分解和组合、状态如何变化。围绕它的监督、优化与评测,则决定这个空间能否被学会、学到的能力能否兑现。后面为了保留直觉,我仍然把问题空间简称为“冰箱”。

一个关于冰箱和大象的直觉#

小时候有一道脑筋急转弯:把大象装进冰箱需要几步?

答案是三步:打开冰箱门,把大象装进去,把门关上。

如果把它借来描述数据驱动,我会稍微改写一下:

  1. 打开一个合适的冰箱
  2. 把大象装进去;
  3. 确认门真的关上了。

这里最重要的不是“三步”,而是“合适”。

冰箱是我们为任务选择的问题空间;大象是现实中真正想解决的事情;把大象装进去,是利用数据、模型和计算,把反复出现的规律压进参数;关上门,则意味着训练目标、评测标准和真实使用效果形成了闭环。

我们经常把绝大部分精力花在第二步:收集更多数据,训练更大模型,提高算力和吞吐量。但如果冰箱太小、内部结构不合适,或者门的形状根本不允许大象通过,继续增加搬运的人手并不会解决问题。

更危险的情况是,我们先把大象切成容易装进去的几块,然后把“冰箱门关上了”误认为“原来的任务已经解决”。模型可能把 benchmark 做得很好,却只解决了真实问题的一个方便代理。

所以,这个比喻是合理的,但数据驱动并不只是“把数据灌进模型”。第一步是决定模型究竟在什么世界里学习,第三步是检查那个世界里的成功能否兑现成现实里的成功。

任务的“期待规模”#

任务是否被解决,不能脱离我们对它的期待来讨论。

MNIST 在标准数据分布和十分类评测下之所以接近被解决,是因为期待很小也很明确:识别十个数字即可,不需要保留书写者、笔迹风格和运笔方式。一个十分类空间足以承载这个期待。

人脸识别的期待不同。真实产品关心的不是“这张脸属于训练集中的哪一个人”,而是两张脸是否属于同一身份,以及一个新身份能否被登记和检索。因此,固定类别并不是最终的产品接口;常见系统虽然仍可借助分类或 margin loss 训练,却把结果组织在 embedding 和相似度空间中。

所谓合适的问题空间,从来不是对现实绝对完备,而是对某一种期待足够充分。

期待越开放,冰箱就需要越大的容量和越强的组合能力。十个类别可以容纳 MNIST,却无法容纳开放语言;固定长度向量可以表达某些属性,却未必是承载任意长度程序、证明和对话的可学习、可组合接口;一张静态图像可以描述外观,却未必足以描述因果和变化。

很多“这个问题是否已经解决”的争论,实际是在用不同的期待规模说话。

一个技术猜想:先有可辨识的问题,才有 Scaling#

基于这个直觉,我暂时提出一个不成熟的猜想:

一个成功的学习任务,是把真实期待翻译成一个对任务充分、结构对齐、可分解、可验证的问题:让单位数据产生尽可能多的有效约束,让约束能够被归因,并让重复规律沉淀到共享参数中。

因此,一个任务能否持续 Scaling,取决于期待、表示与分解、监督、信用分配和参数复用能否首尾对齐。下面仍用期待、空间、稠密和信用分配四个直觉展开;参数复用是它们对齐以后产生的结果。

期待:先决定希望模型做到什么#

前一节所说的期待既是需求,也是评价指南。更具体地说,它把模糊愿望转成模型必须分辨的差异、可以忽略的不变性,以及何时能够宣布任务完成。不存在脱离期待的“最佳表示”,只有对某种期待足够充分的表示。

所谓期待和定义的平衡,也不是在二者之间各退一步,而是让问题空间刚好有能力表达任务需要的差异,又尽量不为任务无关的差异支付自由度

空间:不只定义元素,还要定义结构#

即使最后选用一个向量空间,定义向量的维数也远远不够。向量空间本身只提供元素和线性运算;一个可学习的问题还需要回答:距离意味着什么,哪些变化应当保持语义,变量如何组合,状态如何转移,以及哪一种误差最重要。

分类空间规定“落在哪一类”;人脸 embedding 规定“相似者相邻”;BEV 规定位置应该在统一的米制坐标中比较;token 序列规定复杂对象可以被有限元素组合,并把联合概率分解成连续的条件预测。

这些几何、等价关系、组合规则、动态和损失,才是问题定义真正施加的特性。空间不是一个被动容器:它决定一份数据能够对模型提出什么样的约束。

稠密:不是数据多,而是约束相对自由度足够多#

这里可以引入一个工作性的直觉量,叫作“有效监督密度”:

有效监督密度 ≈ 任务相关且非重复的约束 / 实现任务期待所需的有效自由度

它不是一个已经建立好的统一指标,只是在提醒我们:数据量必须相对于问题规模来讨论。这里的分子不是样本数或梯度数,而是非冗余、任务相关、覆盖关键模式且能被模型利用的约束;分母也不是向量维数或参数量,而是仍需由数据辨识的有效自由度。

有效监督可以从三个方向变得稠密:局部密度,即每个 token、像素、时间点或噪声层级都产生目标;关系密度,即样本之间形成匹配、比较或排序;覆盖密度,即数据触及足够多的概念、场景和变化。三者不能互相替代:目标很多未必信息多,关系很多也未必覆盖广。

同一批数据放进一个过大、缺少结构的空间会非常稀疏;如果把任务无关差异合并,让相同规律反复落到共享结构上,数据就会相对变得稠密。

因此,空间太小会装不下期待,把必要信息提前压掉;空间太大或结构太弱,则会留下过多自由度,让有限数据无法确定模型应该学什么。合适的问题空间既对任务充分,又让可获得的数据足以覆盖关键变化。

一个标签也可能带来丰富监督,一万个标签也可能只是在重复同一个偏差。弱监督同样可能具有很高的有效性:关键不只在标签强弱,还在它能否被任务结构展开成大量一致关系。

监督的密度不是梯度的密度。随机标签和逐像素重建都可以提供非常稠密的梯度,却未必提供我们真正关心的知识。

把足够多的数据统一编码成 token,是一个强大的起点,但 token 化本身并不保证成功。Token 需要保留期待所需的差异,组合规则需要能够表达任务结构,可获得的数据也必须覆盖这些结构。否则只是统一了语法,并没有定义对问题。

信用分配:监督还要能够到达模型#

最后,数据中存在约束,不等于模型能够利用约束。模型犯错以后,必须有一条信号路径把结果归因到需要改变的表示和参数上。

对于希望由同一任务目标联合学到的模型内部,有效的端到端梯度是必要条件:最终损失必须能够抵达真正需要改变的表示和参数。计算图上的“连通”还不够;梯度还需要有足够的信噪比,避免长期消失或被错误捷径支配,并大体指向真实任务效用。

但把视野扩大到整个学习系统,就不必要求环境、搜索或每个模块都可微。更一般的必要条件,是存在一条端到端可达的信用分配链。搜索、价值传播、强化学习回报和蒸馏,也可以把远端结果转化成局部学习信号。

这些环节并不是一张并列清单:期待规定必须保留什么;表示与分解决定哪些规律能够重复出现;有效监督让规律被看到;信用分配把约束送进参数;参数复用让一次学习改善其他样本;真实效用闭环最终检查这一切是否兑现了最初的期待。这也要求训练损失至少是最终效用的可靠代理,而不能只奖励一个方便的捷径。

任务期待 → 表示与分解 → 有效监督 → 信用分配 → 参数复用 → 真实效用闭环

这里的参数复用不只是形式上的参数共享,而是一个样本产生的更新,也能帮助具有相同结构的其他样本。此时模型才是在压缩规律,而不只是记忆样本;过去需要逐例完成的求解过程,也被摊销进一套可以反复调用的参数中。

Scaling 能够积累的六步闭环

六步不是并列清单;前一步决定下一步能够接收到什么。

  1. 1 任务期待

    先说清楚希望模型做到什么,以及哪些差异必须保留。

  2. 2 表示与分解

    定义元素、关系、几何与组合方式,让规律能够重复出现。

  3. 3 有效监督

    让单位数据提供任务相关、非重复且覆盖关键变化的约束。

  4. 4 信用分配

    让结果好坏能够抵达真正需要改变的表示和参数。

  5. 5 参数复用

    让一个样本学到的规律帮助其他位置、样本与任务。

  6. 6 真实效用闭环

    检查代理损失的改善,是否兑现成最初期待的现实效果。

反馈:真实效用会反过来修正任务期待、表示与评测。
放大器:数据、参数和计算作用于整条链,而不是替代其中任何一步。
图 1:问题表述决定规模是否存在可积累的方向;监督、信用和参数复用决定这些规律能否真正进入模型。

相邻的思想谱系#

这些工作不是同一个理论,而是从不同侧面接近本文的直觉。Newell 与 Simon 关心问题怎样被表述成可搜索的问题空间;Marr 强调先说清楚要计算什么,再讨论表示、算法和实现。后来的表征学习信息瓶颈几何深度学习,又分别从变化因素、任务相关信息和结构先验补上了这幅图;MDL为“重复规律可以被压缩”提供语言,Gershman 与 Goodman 的摊销推断则说明重复求解如何复用计算。本文只是尝试把这些直觉与 Scaling、监督密度和信用分配串在一起。

沿着这个猜想回看已经成功的技术方向,会看到一些反复出现的模式。以下不是给每项技术补一套完整理论,而是用同一组六个问题,辨认它究竟打开了学习链条中的哪个瓶颈。为了避免机械重复,六个维度合并成三组来读。

成功案例主要打开了哪一个瓶颈

分组表示主要着力点,不代表某个案例只影响一个维度。

① 表示与分解

让任务结构先变得可学习

  • 分类与 CNN
  • 检测、分割与关键点
  • 人脸识别与检索
  • BEV
  • AlphaFold2

② 有效监督

让数据在局部、关系与覆盖上形成有效约束

  • CLIP:关系密度与概念覆盖
  • 语言模型:逐 token 与语料覆盖
  • Diffusion:逐位置与分噪声层级

③ 信用分配与反馈

让结果抵达模型,或持续生成新的学习经验

  • NeRF:可微渲染
  • AlphaGo Zero:搜索与自博弈

对照组:问题空间并不能解释全部突破

AlexNet 主要扩大数据、计算与可优化容量;ResNet 主要改善参数化和梯度传播;Transformer 主要改善跨位置交互与并行训练。

图 2:同一套分析框架不是为了把所有成功解释成同一件事,而是辨认每项技术究竟解除了一处什么约束。

第一类成功:让表示结构对齐任务#

分类与 CNN:先决定哪些差异不重要#

图像分类建立了一个类别世界,而 CNN 决定这个世界怎样跨空间共享经验。

  • **任务期待 / 表示与分解:**期待是在封闭类别中辨认“它是什么”。标签把字体、位置和笔画粗细等变化合并为任务等价类;以 LeNet 为代表的 CNN 再把图像组织成具有局部性和平移结构的空间信号。
  • **有效监督 / 信用分配:**每张图通常只有一个类别标签,名义监督并不稠密,但交叉熵提供了稳定的端到端误差信号。它能说明类别错了,却不能直接说明错在图像哪里。
  • **参数复用 / 效用闭环:**卷积核跨位置、图像和类别反复使用;分类准确率能较好闭合标准封闭集任务,却不能自动证明开放集识别、鲁棒性或因果理解已经解决。

**主要打开的瓶颈:**任务等价类与空间参数共享。

检测、分割与关键点:让输出结构像它要描述的对象#

单一类别无法回答“有几个对象、分别在哪里”。DETR 把检测写成集合预测,FCN 把分割输出组织成像素场,Stacked Hourglass 等关键点方法则用热力图表达位置。

  • **任务期待 / 表示与分解:**期待分别是对象集合、区域归属和位置分布;集合、像素场与热力图对应了对象的置换不变性、空间对齐和位置不确定性。
  • **有效监督 / 信用分配:**框、掩码和关键点提供不同粒度的局部监督;匹配、逐像素损失和热力图误差,让系统更明确地知道哪个对象或位置出了错。热力图虽有很多像素目标,却常由一个坐标展开,并非等量的独立事实。
  • **参数复用 / 效用闭环:**同一骨干、检测头或像素解码器跨对象与位置复用;mAP、IoU 和关键点指标能验证结构化感知,却仍只是驾驶、医疗或操作等下游决策的代理。

**主要打开的瓶颈:**输出结构与信用粒度的对齐。

人脸与检索:把“是什么”改成“彼此有多像”#

FaceNet 直接以度量目标学习 embedding;ArcFace 则用带角度 margin 的分类代理塑造判别性空间。

  • **任务期待 / 表示与分解:**期待不是在固定名单里分类,而是验证同一身份并检索训练时未见的新身份;问题因此被改写成具有任务含义的度量或角度空间。
  • **有效监督 / 信用分配:**身份标签可展开成成对、三元组或相对间隔约束;FaceNet 的 triplet loss 直接约束样本关系,ArcFace 则约束样本与类别方向的角度间隔。样本挖掘尤其决定度量学习中哪些关系真正提供有效梯度。
  • **参数复用 / 效用闭环:**同一个距离函数可以服务于未见身份以及验证、检索、聚类等接口;但阈值、域偏移、公平性和攻击安全仍需在真实产品中校准。

**主要打开的瓶颈:**让空间中的距离获得产品语义。

BEV:在视角之间建立共同坐标#

BEVFormer 为多相机三维感知建立统一的鸟瞰表征。它的关键不是“把图像换个角度看”,而是让不同摄像头和不同时刻的观测落到可比较的坐标系中。

  • **任务期待 / 表示与分解:**期待是在统一坐标中理解多相机三维环境;BEV 把透视图像映射到自车或世界坐标下的网格、对象或占据表示,并允许沿时间累积。
  • **有效监督 / 信用分配:**三维框、地图或占据标签与这个空间天然对齐;在可微且连通的计算图中,三维感知损失可以经投影或注意力模块回到各相机特征。BEV 本身并不一定需要直接标签。
  • **参数复用 / 效用闭环:**统一坐标使不同相机、位置、时刻和感知任务复用同一套空间规律;它改善的是三维感知接口,并不单独证明规划与驾驶安全已经闭环。

**主要打开的瓶颈:**原始观测与任务坐标之间的错位。

AlphaFold2:把绝对坐标问题改写成关系与几何#

AlphaFold2 让大量推理发生在 MSA、残基对表征与几何感知的结构模块中,而不是把蛋白质折叠简化成对全部绝对坐标的一次猜测。

  • **任务期待 / 表示与分解:**期待是从序列和进化信息恢复三维结构;单残基、残基对、局部参考系和迭代更新,使全局形状能够从重复的局部关系逐步形成。
  • **有效监督 / 信用分配:**一份结构可以展开为大量残基、残基对和局部几何约束,结构损失再回到单残基表征、成对表征与结构模块;这些约束高度相关,不能简单按残基对数量视为独立标签。
  • **参数复用 / 效用闭环:**相同的几何操作、相互作用和结构规律跨残基位置与蛋白复用;结构精度闭合了核心目标,却不等于动力学、功能、无序区域和配体作用都已解决。

**主要打开的瓶颈:**关系表示、几何结构与迭代分解的协同。

第二类成功:把数据组织成高密度的学习信号#

CLIP:弱标签也可以产生稠密关系#

CLIP 的单个网页图文对其实很粗糙:文字不会描述图片中的所有物体,更不会直接给出词语和像素的对应关系。

  • **任务期待 / 表示与分解:**期待是在开放概念下完成图文匹配与迁移;图像和文本被放入同一个语义度量空间,任务被写成跨模态匹配与排序。
  • **有效监督 / 信用分配:**batch 内的完整相似度矩阵提高了关系利用率,海量互联网图文提高了概念覆盖;这些比较不是同等数量的独立事实,还可能包含假负例。对比损失能归因到整对图文,却很难指出具体词与具体区域错在哪里。
  • **参数复用 / 效用闭环:**共享语义方向可以跨类别、提示词和下游任务复用;零样本分类和检索验证了一部分效用,却不保证细粒度定位、计数、否定关系或无偏理解。

**主要打开的瓶颈:**弱标签的关系密度与分布覆盖。

语言模型:把大量可文本化的任务写成序列#

Token 不是语言和知识本身,却提供了一套有限、统一、可组合的接口;自回归链式分解又把复杂联合问题改写成连续的条件预测。语言模型的经验 Scaling Law 描述了损失随模型规模、数据量和计算量变化的经验关系,但并不证明 token 化本身就足够。

  • **任务期待 / 表示与分解:**训练期待首先是预测自然文本中的下一个 token;大量可文本化的知识、任务描述和解题轨迹因此进入同一接口。可变长度序列提供组合结构,自回归链式分解则把联合似然写成一系列重复、统一的条件预测。
  • **有效监督 / 信用分配:**长度为 n 的序列在 teacher forcing 下可贡献接近 n 个逐 token 损失项,因此局部监督很密;但这些目标共享上下文且高度相关,并不等于 n 份独立知识。大规模预训练的有效密度来自逐位置目标、自然文本的广泛覆盖,以及共享参数对重复规律的复用;长程结果和现实后果的信用仍然间接。
  • **参数复用 / 效用闭环:**同一组参数跨位置和文档复用语言结构、事实关联以及文本中反复出现的解题模式;困惑度只闭合训练分布上的文本预测,事实性、推理可靠性和行动成功仍须另行验证。

因此,LLM 的数据是否“稠密”,必须相对于期待来回答。对自然文本分布上的 next-token 预测,它同时具有很高的局部监督密度和广泛的覆盖密度;但数据没有铺满所有可能序列,更没有直接覆盖可靠推理、事实核验和现实行动。稠密性来自语言中的结构、重复与参数复用,而不是对组合空间的穷举。

情感分类提供了一个反例:再多情感标签,也主要约束会改变情感判断的差异。它可以推动否定、反讽或上下文理解,因为这些能力有助于分类;但若两个模型在所有文本上的情感预测相同,分类损失无法奖励其中更会翻译、写代码或做数学的模型。窄任务不是绝不会产生附带能力,而是与标签无关的能力缺少稳定的积累方向。

**主要打开的瓶颈:**可组合分解、逐位置监督、广泛覆盖与跨上下文复用。统一成 token 只是起点,不是保证。

Diffusion:为多解问题定义一条可学习的路#

一个条件往往对应很多合理图像;若用平方误差一步回归唯一结果,模型容易输出多个答案的平均。DDPM 转而定义从数据到噪声、再从噪声逐步回到样本的过程。

  • **任务期待 / 表示与分解:**期待是学习一对多的复杂生成分布;反向去噪把全局生成改写成不同噪声尺度上的条件修正,随机采样为多个合理答案保留空间。
  • **有效监督 / 信用分配:**每个样本可以与随机时间步和噪声组成明确的训练目标,并在图像或 latent 位置产生局部误差;损失可直接抵达去噪网络,却没有直接优化多步采样后的最终用户偏好。
  • **参数复用 / 效用闭环:**同一个去噪器跨空间位置、噪声尺度和样本复用视觉规律;生成质量、条件遵循和人类偏好共同构成闭环,单一去噪损失并不足够。

Latent Diffusion 主要把过程移到压缩空间以降低高分辨率生成成本,它与 DDPM 的问题重述有关,但不是同一项突破。

**主要打开的瓶颈:**多解分布的表示与分噪声层级的局部学习。

第三类成功:让反馈持续产生并抵达模型#

NeRF:从图像误差抵达三维表示#

NeRF 把场景表示成连续的空间位置、观察方向、密度和颜色,再通过体渲染生成图像。

  • **任务期待 / 表示与分解:**期待是从有限视图生成彼此一致的新视角;连续辐射场提供隐藏的三维表征,射线积分规定它怎样组合成观测像素。
  • **有效监督 / 信用分配:**大量视图中的像素与射线反复约束同一个场,但相邻像素不是独立事实;可微渲染把像素残差穿过射线积分,分配给空间采样点的密度和颜色。
  • **参数复用 / 效用闭环:**经典 NeRF 主要在同一场景内部跨坐标和视角复用参数,跨场景积累有限;新视角逼真也不保证几何唯一正确,模型可能用视角相关外观解释误差。

**主要打开的瓶颈:**中间表示与可微前向模型共同建立的信用通道。

AlphaGo Zero 与自博弈:稀疏结果也可以形成有效经验#

AlphaGo Zero 面对的是一个规则、动作、终止条件和胜负标准都很明确的世界;self-play 又能在同一套规则中不断生成随当前策略演进的新局面。

  • **任务期待 / 表示与分解:**期待是在封闭规则中提高胜率;棋盘状态、合法动作、策略、价值与树搜索共同分解长时程决策。
  • **有效监督 / 信用分配:**终局胜负很稀疏,但 MCTS 产生改进后的策略目标,终局胜负提供价值目标,自博弈则持续覆盖模型当前不会的局面;信用通过搜索回传和价值学习传递,不需要让梯度穿过环境。
  • **参数复用 / 效用闭环:**同一网络跨棋局、状态和对称位置复用规律;数据分布随策略演进,胜率又直接对应最初期待,因此这个闭环尤其干净。

**主要打开的瓶颈:**自生数据引擎、非梯度信用分配与明确效用的组合;它也因此很难原样迁移到奖励含糊、试错昂贵的现实环境。

这个猜想的边界#

把所有突破都解释成“重新定义问题空间”,会让这个猜想失去意义。三个对照案例尤其重要:

  • AlexNet 没有改变 ImageNet 的类别空间。它主要同时扩大了数据、计算和可优化容量,并让已有的卷积参数共享真正发挥出来。
  • ResNet 没有创造新的任务或监督。残差参数化提供了更顺畅的梯度与信息通道,使显著更深的网络可以被训练。
  • Transformer 也没有单独发明 token 世界。它主要重构了 token 之间的交互、信用路径和并行计算方式,让同一序列问题能够利用更大的模型与数据。

因此,更稳妥的说法是:任务期待、表示与分解、有效监督、信用分配、参数复用和真实效用的匹配,构成了 Scaling 的一组基础条件,而不是充分条件。冰箱合适以后,仍然需要足够的数据质量、模型容量、优化稳定性、计算资源,以及持续供应的大象。

Sutton 的“苦涩教训” 还提醒我们,长期进展往往来自能够持续利用计算的一般方法,而不是不断手写领域知识。对本文而言,这意味着定义合适的空间并不等于把解法手工写死;问题定义应该提供可靠的结构与效用接口,同时给通用学习方法留下自行发现规律的空间。

同时,真实的数据驱动过程也不是一次性的三步。关门以后,我们可能发现评测与真实需求不一致,或者大象还有一部分露在外面。此时必须重新开门、修改冰箱、再训练、再验证。

更准确的循环也许是:

定义期待,选择表示与分解,检查有效监督,建立可达的信用通道,让规律在参数中复用,再用真实效用闭环验证。

先问大象是什么#

在谈论更多数据、更大模型和 Scaling Law 之前,也许应该先问六个问题:

  • 我们期待解决的“大象”究竟是什么,哪些差异必须被保留?
  • 当前“冰箱”怎样定义相同、邻近、组合、不变性与多解性?
  • 相对于任务所需的有效自由度,现有数据提供了多少任务相关且非重复的约束?
  • 结果好坏能否被分配到真正需要改变的中间环节?
  • 一个样本中学到的规律,能否真正帮助其他样本和场景?
  • 所谓“关上门”,衡量的是方便的代理目标,还是真实任务已经完成?

如果这些问题没有答案,Scaling 就不是策略,只是一种希望。

反过来,如果任务期待、表示与分解、有效监督、信用分配、参数复用和真实效用能够形成闭环,那么规模才可能像我们期待的那样工作:不是凭空创造能力,而是在这些条件已经对齐以后,不断提取、压缩并复用现实中反复出现的规律。

参考与延伸阅读#

把大象装进合适的冰箱:为什么 Scaling 始于问题定义
https://example.pages.dev/blog/problem-space-before-scaling
Author 祝仰坤
Published at 2026年8月28日