把大象装进合适的冰箱:为什么 Scaling 始于问题定义
关于任务期待、问题空间、有效监督、信用分配与参数复用的一则随想:规模只能放大问题定义中已经存在的可学习结构。
Scaling 不是魔法,更像一台放大器:问题定义得合适,更多数据、参数和计算会把反复出现的规律积累成能力;问题定义错了,它们只会让模型更熟练地优化错误的目标。
我们习惯把深度学习的进步概括成三个词:更多数据、更大模型、更多计算。
这个叙事大体没错,却省略了一个更早发生、也更容易被忽略的步骤:现实问题必须先被翻译成一个适合学习的问题。
数据不会直接进入“现实”。它总要进入一套人为选择的表示:什么是一个基本元素,什么算相同,什么算相近,复杂答案怎样被拆开,模型犯错以后又从哪里得到反馈。只有这些假设足够贴近我们真正期待解决的任务,数据和算力才可能持续转化成能力。
这里说的“问题空间”并不只是一个向量空间。更准确地说,它是任务使用的表示域及其结构:包括输入、中间表征与输出,也包括什么算相同或相近、问题如何分解和组合、状态如何变化。围绕它的监督、优化与评测,则决定这个空间能否被学会、学到的能力能否兑现。后面为了保留直觉,我仍然把问题空间简称为“冰箱”。
一个关于冰箱和大象的直觉#
小时候有一道脑筋急转弯:把大象装进冰箱需要几步?
答案是三步:打开冰箱门,把大象装进去,把门关上。
如果把它借来描述数据驱动,我会稍微改写一下:
- 打开一个合适的冰箱;
- 把大象装进去;
- 确认门真的关上了。
这里最重要的不是“三步”,而是“合适”。
冰箱是我们为任务选择的问题空间;大象是现实中真正想解决的事情;把大象装进去,是利用数据、模型和计算,把反复出现的规律压进参数;关上门,则意味着训练目标、评测标准和真实使用效果形成了闭环。
我们经常把绝大部分精力花在第二步:收集更多数据,训练更大模型,提高算力和吞吐量。但如果冰箱太小、内部结构不合适,或者门的形状根本不允许大象通过,继续增加搬运的人手并不会解决问题。
更危险的情况是,我们先把大象切成容易装进去的几块,然后把“冰箱门关上了”误认为“原来的任务已经解决”。模型可能把 benchmark 做得很好,却只解决了真实问题的一个方便代理。
所以,这个比喻是合理的,但数据驱动并不只是“把数据灌进模型”。第一步是决定模型究竟在什么世界里学习,第三步是检查那个世界里的成功能否兑现成现实里的成功。
任务的“期待规模”#
任务是否被解决,不能脱离我们对它的期待来讨论。
MNIST 在标准数据分布和十分类评测下之所以接近被解决,是因为期待很小也很明确:识别十个数字即可,不需要保留书写者、笔迹风格和运笔方式。一个十分类空间足以承载这个期待。
人脸识别的期待不同。真实产品关心的不是“这张脸属于训练集中的哪一个人”,而是两张脸是否属于同一身份,以及一个新身份能否被登记和检索。因此,固定类别并不是最终的产品接口;常见系统虽然仍可借助分类或 margin loss 训练,却把结果组织在 embedding 和相似度空间中。
所谓合适的问题空间,从来不是对现实绝对完备,而是对某一种期待足够充分。
期待越开放,冰箱就需要越大的容量和越强的组合能力。十个类别可以容纳 MNIST,却无法容纳开放语言;固定长度向量可以表达某些属性,却未必是承载任意长度程序、证明和对话的可学习、可组合接口;一张静态图像可以描述外观,却未必足以描述因果和变化。
很多“这个问题是否已经解决”的争论,实际是在用不同的期待规模说话。
一个技术猜想:先有可辨识的问题,才有 Scaling#
基于这个直觉,我暂时提出一个不成熟的猜想:
一个成功的学习任务,是把真实期待翻译成一个对任务充分、结构对齐、可分解、可验证的问题:让单位数据产生尽可能多的有效约束,让约束能够被归因,并让重复规律沉淀到共享参数中。
因此,一个任务能否持续 Scaling,取决于期待、表示与分解、监督、信用分配和参数复用能否首尾对齐。下面仍用期待、空间、稠密和信用分配四个直觉展开;参数复用是它们对齐以后产生的结果。
期待:先决定希望模型做到什么#
前一节所说的期待既是需求,也是评价指南。更具体地说,它把模糊愿望转成模型必须分辨的差异、可以忽略的不变性,以及何时能够宣布任务完成。不存在脱离期待的“最佳表示”,只有对某种期待足够充分的表示。
所谓期待和定义的平衡,也不是在二者之间各退一步,而是让问题空间刚好有能力表达任务需要的差异,又尽量不为任务无关的差异支付自由度。
空间:不只定义元素,还要定义结构#
即使最后选用一个向量空间,定义向量的维数也远远不够。向量空间本身只提供元素和线性运算;一个可学习的问题还需要回答:距离意味着什么,哪些变化应当保持语义,变量如何组合,状态如何转移,以及哪一种误差最重要。
分类空间规定“落在哪一类”;人脸 embedding 规定“相似者相邻”;BEV 规定位置应该在统一的米制坐标中比较;token 序列规定复杂对象可以被有限元素组合,并把联合概率分解成连续的条件预测。
这些几何、等价关系、组合规则、动态和损失,才是问题定义真正施加的特性。空间不是一个被动容器:它决定一份数据能够对模型提出什么样的约束。
稠密:不是数据多,而是约束相对自由度足够多#
这里可以引入一个工作性的直觉量,叫作“有效监督密度”:
有效监督密度 ≈ 任务相关且非重复的约束 / 实现任务期待所需的有效自由度
它不是一个已经建立好的统一指标,只是在提醒我们:数据量必须相对于问题规模来讨论。这里的分子不是样本数或梯度数,而是非冗余、任务相关、覆盖关键模式且能被模型利用的约束;分母也不是向量维数或参数量,而是仍需由数据辨识的有效自由度。
有效监督可以从三个方向变得稠密:局部密度,即每个 token、像素、时间点或噪声层级都产生目标;关系密度,即样本之间形成匹配、比较或排序;覆盖密度,即数据触及足够多的概念、场景和变化。三者不能互相替代:目标很多未必信息多,关系很多也未必覆盖广。
同一批数据放进一个过大、缺少结构的空间会非常稀疏;如果把任务无关差异合并,让相同规律反复落到共享结构上,数据就会相对变得稠密。
因此,空间太小会装不下期待,把必要信息提前压掉;空间太大或结构太弱,则会留下过多自由度,让有限数据无法确定模型应该学什么。合适的问题空间既对任务充分,又让可获得的数据足以覆盖关键变化。
一个标签也可能带来丰富监督,一万个标签也可能只是在重复同一个偏差。弱监督同样可能具有很高的有效性:关键不只在标签强弱,还在它能否被任务结构展开成大量一致关系。
监督的密度不是梯度的密度。随机标签和逐像素重建都可以提供非常稠密的梯度,却未必提供我们真正关心的知识。
把足够多的数据统一编码成 token,是一个强大的起点,但 token 化本身并不保证成功。Token 需要保留期待所需的差异,组合规则需要能够表达任务结构,可获得的数据也必须覆盖这些结构。否则只是统一了语法,并没有定义对问题。
信用分配:监督还要能够到达模型#
最后,数据中存在约束,不等于模型能够利用约束。模型犯错以后,必须有一条信号路径把结果归因到需要改变的表示和参数上。
对于希望由同一任务目标联合学到的模型内部,有效的端到端梯度是必要条件:最终损失必须能够抵达真正需要改变的表示和参数。计算图上的“连通”还不够;梯度还需要有足够的信噪比,避免长期消失或被错误捷径支配,并大体指向真实任务效用。
但把视野扩大到整个学习系统,就不必要求环境、搜索或每个模块都可微。更一般的必要条件,是存在一条端到端可达的信用分配链。搜索、价值传播、强化学习回报和蒸馏,也可以把远端结果转化成局部学习信号。
这些环节并不是一张并列清单:期待规定必须保留什么;表示与分解决定哪些规律能够重复出现;有效监督让规律被看到;信用分配把约束送进参数;参数复用让一次学习改善其他样本;真实效用闭环最终检查这一切是否兑现了最初的期待。这也要求训练损失至少是最终效用的可靠代理,而不能只奖励一个方便的捷径。
任务期待 → 表示与分解 → 有效监督 → 信用分配 → 参数复用 → 真实效用闭环
这里的参数复用不只是形式上的参数共享,而是一个样本产生的更新,也能帮助具有相同结构的其他样本。此时模型才是在压缩规律,而不只是记忆样本;过去需要逐例完成的求解过程,也被摊销进一套可以反复调用的参数中。
Scaling 能够积累的六步闭环
六步不是并列清单;前一步决定下一步能够接收到什么。
- 1 任务期待
先说清楚希望模型做到什么,以及哪些差异必须保留。
- 2 表示与分解
定义元素、关系、几何与组合方式,让规律能够重复出现。
- 3 有效监督
让单位数据提供任务相关、非重复且覆盖关键变化的约束。
- 4 信用分配
让结果好坏能够抵达真正需要改变的表示和参数。
- 5 参数复用
让一个样本学到的规律帮助其他位置、样本与任务。
- 6 真实效用闭环
检查代理损失的改善,是否兑现成最初期待的现实效果。
相邻的思想谱系#
这些工作不是同一个理论,而是从不同侧面接近本文的直觉。Newell 与 Simon ↗ 关心问题怎样被表述成可搜索的问题空间;Marr ↗ 强调先说清楚要计算什么,再讨论表示、算法和实现。后来的表征学习 ↗、信息瓶颈 ↗和几何深度学习 ↗,又分别从变化因素、任务相关信息和结构先验补上了这幅图;MDL ↗为“重复规律可以被压缩”提供语言,Gershman 与 Goodman 的摊销推断 ↗则说明重复求解如何复用计算。本文只是尝试把这些直觉与 Scaling、监督密度和信用分配串在一起。
沿着这个猜想回看已经成功的技术方向,会看到一些反复出现的模式。以下不是给每项技术补一套完整理论,而是用同一组六个问题,辨认它究竟打开了学习链条中的哪个瓶颈。为了避免机械重复,六个维度合并成三组来读。
成功案例主要打开了哪一个瓶颈
分组表示主要着力点,不代表某个案例只影响一个维度。
① 表示与分解
让任务结构先变得可学习
- 分类与 CNN
- 检测、分割与关键点
- 人脸识别与检索
- BEV
- AlphaFold2
② 有效监督
让数据在局部、关系与覆盖上形成有效约束
- CLIP:关系密度与概念覆盖
- 语言模型:逐 token 与语料覆盖
- Diffusion:逐位置与分噪声层级
③ 信用分配与反馈
让结果抵达模型,或持续生成新的学习经验
- NeRF:可微渲染
- AlphaGo Zero:搜索与自博弈
对照组:问题空间并不能解释全部突破
AlexNet 主要扩大数据、计算与可优化容量;ResNet 主要改善参数化和梯度传播;Transformer 主要改善跨位置交互与并行训练。
第一类成功:让表示结构对齐任务#
分类与 CNN:先决定哪些差异不重要#
图像分类建立了一个类别世界,而 CNN 决定这个世界怎样跨空间共享经验。
- **任务期待 / 表示与分解:**期待是在封闭类别中辨认“它是什么”。标签把字体、位置和笔画粗细等变化合并为任务等价类;以 LeNet ↗ 为代表的 CNN 再把图像组织成具有局部性和平移结构的空间信号。
- **有效监督 / 信用分配:**每张图通常只有一个类别标签,名义监督并不稠密,但交叉熵提供了稳定的端到端误差信号。它能说明类别错了,却不能直接说明错在图像哪里。
- **参数复用 / 效用闭环:**卷积核跨位置、图像和类别反复使用;分类准确率能较好闭合标准封闭集任务,却不能自动证明开放集识别、鲁棒性或因果理解已经解决。
**主要打开的瓶颈:**任务等价类与空间参数共享。
检测、分割与关键点:让输出结构像它要描述的对象#
单一类别无法回答“有几个对象、分别在哪里”。DETR ↗ 把检测写成集合预测,FCN ↗ 把分割输出组织成像素场,Stacked Hourglass ↗ 等关键点方法则用热力图表达位置。
- **任务期待 / 表示与分解:**期待分别是对象集合、区域归属和位置分布;集合、像素场与热力图对应了对象的置换不变性、空间对齐和位置不确定性。
- **有效监督 / 信用分配:**框、掩码和关键点提供不同粒度的局部监督;匹配、逐像素损失和热力图误差,让系统更明确地知道哪个对象或位置出了错。热力图虽有很多像素目标,却常由一个坐标展开,并非等量的独立事实。
- **参数复用 / 效用闭环:**同一骨干、检测头或像素解码器跨对象与位置复用;mAP、IoU 和关键点指标能验证结构化感知,却仍只是驾驶、医疗或操作等下游决策的代理。
**主要打开的瓶颈:**输出结构与信用粒度的对齐。
人脸与检索:把“是什么”改成“彼此有多像”#
FaceNet ↗ 直接以度量目标学习 embedding;ArcFace ↗ 则用带角度 margin 的分类代理塑造判别性空间。
- **任务期待 / 表示与分解:**期待不是在固定名单里分类,而是验证同一身份并检索训练时未见的新身份;问题因此被改写成具有任务含义的度量或角度空间。
- **有效监督 / 信用分配:**身份标签可展开成成对、三元组或相对间隔约束;FaceNet 的 triplet loss 直接约束样本关系,ArcFace 则约束样本与类别方向的角度间隔。样本挖掘尤其决定度量学习中哪些关系真正提供有效梯度。
- **参数复用 / 效用闭环:**同一个距离函数可以服务于未见身份以及验证、检索、聚类等接口;但阈值、域偏移、公平性和攻击安全仍需在真实产品中校准。
**主要打开的瓶颈:**让空间中的距离获得产品语义。
BEV:在视角之间建立共同坐标#
BEVFormer ↗ 为多相机三维感知建立统一的鸟瞰表征。它的关键不是“把图像换个角度看”,而是让不同摄像头和不同时刻的观测落到可比较的坐标系中。
- **任务期待 / 表示与分解:**期待是在统一坐标中理解多相机三维环境;BEV 把透视图像映射到自车或世界坐标下的网格、对象或占据表示,并允许沿时间累积。
- **有效监督 / 信用分配:**三维框、地图或占据标签与这个空间天然对齐;在可微且连通的计算图中,三维感知损失可以经投影或注意力模块回到各相机特征。BEV 本身并不一定需要直接标签。
- **参数复用 / 效用闭环:**统一坐标使不同相机、位置、时刻和感知任务复用同一套空间规律;它改善的是三维感知接口,并不单独证明规划与驾驶安全已经闭环。
**主要打开的瓶颈:**原始观测与任务坐标之间的错位。
AlphaFold2:把绝对坐标问题改写成关系与几何#
AlphaFold2 ↗ 让大量推理发生在 MSA、残基对表征与几何感知的结构模块中,而不是把蛋白质折叠简化成对全部绝对坐标的一次猜测。
- **任务期待 / 表示与分解:**期待是从序列和进化信息恢复三维结构;单残基、残基对、局部参考系和迭代更新,使全局形状能够从重复的局部关系逐步形成。
- **有效监督 / 信用分配:**一份结构可以展开为大量残基、残基对和局部几何约束,结构损失再回到单残基表征、成对表征与结构模块;这些约束高度相关,不能简单按残基对数量视为独立标签。
- **参数复用 / 效用闭环:**相同的几何操作、相互作用和结构规律跨残基位置与蛋白复用;结构精度闭合了核心目标,却不等于动力学、功能、无序区域和配体作用都已解决。
**主要打开的瓶颈:**关系表示、几何结构与迭代分解的协同。
第二类成功:把数据组织成高密度的学习信号#
CLIP:弱标签也可以产生稠密关系#
CLIP ↗ 的单个网页图文对其实很粗糙:文字不会描述图片中的所有物体,更不会直接给出词语和像素的对应关系。
- **任务期待 / 表示与分解:**期待是在开放概念下完成图文匹配与迁移;图像和文本被放入同一个语义度量空间,任务被写成跨模态匹配与排序。
- **有效监督 / 信用分配:**batch 内的完整相似度矩阵提高了关系利用率,海量互联网图文提高了概念覆盖;这些比较不是同等数量的独立事实,还可能包含假负例。对比损失能归因到整对图文,却很难指出具体词与具体区域错在哪里。
- **参数复用 / 效用闭环:**共享语义方向可以跨类别、提示词和下游任务复用;零样本分类和检索验证了一部分效用,却不保证细粒度定位、计数、否定关系或无偏理解。
**主要打开的瓶颈:**弱标签的关系密度与分布覆盖。
语言模型:把大量可文本化的任务写成序列#
Token 不是语言和知识本身,却提供了一套有限、统一、可组合的接口;自回归链式分解又把复杂联合问题改写成连续的条件预测。语言模型的经验 Scaling Law ↗ 描述了损失随模型规模、数据量和计算量变化的经验关系,但并不证明 token 化本身就足够。
- **任务期待 / 表示与分解:**训练期待首先是预测自然文本中的下一个 token;大量可文本化的知识、任务描述和解题轨迹因此进入同一接口。可变长度序列提供组合结构,自回归链式分解则把联合似然写成一系列重复、统一的条件预测。
- **有效监督 / 信用分配:**长度为 n 的序列在 teacher forcing 下可贡献接近 n 个逐 token 损失项,因此局部监督很密;但这些目标共享上下文且高度相关,并不等于 n 份独立知识。大规模预训练的有效密度来自逐位置目标、自然文本的广泛覆盖,以及共享参数对重复规律的复用;长程结果和现实后果的信用仍然间接。
- **参数复用 / 效用闭环:**同一组参数跨位置和文档复用语言结构、事实关联以及文本中反复出现的解题模式;困惑度只闭合训练分布上的文本预测,事实性、推理可靠性和行动成功仍须另行验证。
因此,LLM 的数据是否“稠密”,必须相对于期待来回答。对自然文本分布上的 next-token 预测,它同时具有很高的局部监督密度和广泛的覆盖密度;但数据没有铺满所有可能序列,更没有直接覆盖可靠推理、事实核验和现实行动。稠密性来自语言中的结构、重复与参数复用,而不是对组合空间的穷举。
情感分类提供了一个反例:再多情感标签,也主要约束会改变情感判断的差异。它可以推动否定、反讽或上下文理解,因为这些能力有助于分类;但若两个模型在所有文本上的情感预测相同,分类损失无法奖励其中更会翻译、写代码或做数学的模型。窄任务不是绝不会产生附带能力,而是与标签无关的能力缺少稳定的积累方向。
**主要打开的瓶颈:**可组合分解、逐位置监督、广泛覆盖与跨上下文复用。统一成 token 只是起点,不是保证。
Diffusion:为多解问题定义一条可学习的路#
一个条件往往对应很多合理图像;若用平方误差一步回归唯一结果,模型容易输出多个答案的平均。DDPM ↗ 转而定义从数据到噪声、再从噪声逐步回到样本的过程。
- **任务期待 / 表示与分解:**期待是学习一对多的复杂生成分布;反向去噪把全局生成改写成不同噪声尺度上的条件修正,随机采样为多个合理答案保留空间。
- **有效监督 / 信用分配:**每个样本可以与随机时间步和噪声组成明确的训练目标,并在图像或 latent 位置产生局部误差;损失可直接抵达去噪网络,却没有直接优化多步采样后的最终用户偏好。
- **参数复用 / 效用闭环:**同一个去噪器跨空间位置、噪声尺度和样本复用视觉规律;生成质量、条件遵循和人类偏好共同构成闭环,单一去噪损失并不足够。
Latent Diffusion ↗ 主要把过程移到压缩空间以降低高分辨率生成成本,它与 DDPM 的问题重述有关,但不是同一项突破。
**主要打开的瓶颈:**多解分布的表示与分噪声层级的局部学习。
第三类成功:让反馈持续产生并抵达模型#
NeRF:从图像误差抵达三维表示#
NeRF ↗ 把场景表示成连续的空间位置、观察方向、密度和颜色,再通过体渲染生成图像。
- **任务期待 / 表示与分解:**期待是从有限视图生成彼此一致的新视角;连续辐射场提供隐藏的三维表征,射线积分规定它怎样组合成观测像素。
- **有效监督 / 信用分配:**大量视图中的像素与射线反复约束同一个场,但相邻像素不是独立事实;可微渲染把像素残差穿过射线积分,分配给空间采样点的密度和颜色。
- **参数复用 / 效用闭环:**经典 NeRF 主要在同一场景内部跨坐标和视角复用参数,跨场景积累有限;新视角逼真也不保证几何唯一正确,模型可能用视角相关外观解释误差。
**主要打开的瓶颈:**中间表示与可微前向模型共同建立的信用通道。
AlphaGo Zero 与自博弈:稀疏结果也可以形成有效经验#
AlphaGo Zero ↗ 面对的是一个规则、动作、终止条件和胜负标准都很明确的世界;self-play 又能在同一套规则中不断生成随当前策略演进的新局面。
- **任务期待 / 表示与分解:**期待是在封闭规则中提高胜率;棋盘状态、合法动作、策略、价值与树搜索共同分解长时程决策。
- **有效监督 / 信用分配:**终局胜负很稀疏,但 MCTS 产生改进后的策略目标,终局胜负提供价值目标,自博弈则持续覆盖模型当前不会的局面;信用通过搜索回传和价值学习传递,不需要让梯度穿过环境。
- **参数复用 / 效用闭环:**同一网络跨棋局、状态和对称位置复用规律;数据分布随策略演进,胜率又直接对应最初期待,因此这个闭环尤其干净。
**主要打开的瓶颈:**自生数据引擎、非梯度信用分配与明确效用的组合;它也因此很难原样迁移到奖励含糊、试错昂贵的现实环境。
这个猜想的边界#
把所有突破都解释成“重新定义问题空间”,会让这个猜想失去意义。三个对照案例尤其重要:
- AlexNet ↗ 没有改变 ImageNet 的类别空间。它主要同时扩大了数据、计算和可优化容量,并让已有的卷积参数共享真正发挥出来。
- ResNet ↗ 没有创造新的任务或监督。残差参数化提供了更顺畅的梯度与信息通道,使显著更深的网络可以被训练。
- Transformer ↗ 也没有单独发明 token 世界。它主要重构了 token 之间的交互、信用路径和并行计算方式,让同一序列问题能够利用更大的模型与数据。
因此,更稳妥的说法是:任务期待、表示与分解、有效监督、信用分配、参数复用和真实效用的匹配,构成了 Scaling 的一组基础条件,而不是充分条件。冰箱合适以后,仍然需要足够的数据质量、模型容量、优化稳定性、计算资源,以及持续供应的大象。
Sutton 的“苦涩教训” ↗ 还提醒我们,长期进展往往来自能够持续利用计算的一般方法,而不是不断手写领域知识。对本文而言,这意味着定义合适的空间并不等于把解法手工写死;问题定义应该提供可靠的结构与效用接口,同时给通用学习方法留下自行发现规律的空间。
同时,真实的数据驱动过程也不是一次性的三步。关门以后,我们可能发现评测与真实需求不一致,或者大象还有一部分露在外面。此时必须重新开门、修改冰箱、再训练、再验证。
更准确的循环也许是:
定义期待,选择表示与分解,检查有效监督,建立可达的信用通道,让规律在参数中复用,再用真实效用闭环验证。
先问大象是什么#
在谈论更多数据、更大模型和 Scaling Law 之前,也许应该先问六个问题:
- 我们期待解决的“大象”究竟是什么,哪些差异必须被保留?
- 当前“冰箱”怎样定义相同、邻近、组合、不变性与多解性?
- 相对于任务所需的有效自由度,现有数据提供了多少任务相关且非重复的约束?
- 结果好坏能否被分配到真正需要改变的中间环节?
- 一个样本中学到的规律,能否真正帮助其他样本和场景?
- 所谓“关上门”,衡量的是方便的代理目标,还是真实任务已经完成?
如果这些问题没有答案,Scaling 就不是策略,只是一种希望。
反过来,如果任务期待、表示与分解、有效监督、信用分配、参数复用和真实效用能够形成闭环,那么规模才可能像我们期待的那样工作:不是凭空创造能力,而是在这些条件已经对齐以后,不断提取、压缩并复用现实中反复出现的规律。