2.4Scaling Law 与能力增长
本课只解决一个主问题:本单元只解决一个主问题:为什么模型变大、数据变多、计算变强后,能力通常会提升,但这件事又不是无限魔法?
学习目标
学完本单元后,学习者应该能够:
- 解释 Scaling Law 的基本含义。
- 理解参数、数据、算力之间的关系。
- 知道为什么大模型会表现出更强能力。
- 理解小模型仍然有价值。
- 初步理解 Test-time Compute 的意义。
先给直觉
学习一个复杂技能,通常需要三样东西:
- 足够大的脑容量。
- 足够多、足够好的练习材料。
- 足够长、足够有效的训练。
模型也类似:
- 参数:模型容量。
- 数据:学习材料。
- 训练算力:学习过程中的计算投入。
Scaling Law 研究的是:当这些因素扩大时,模型性能如何变化。
直觉上,模型更大、数据更多、训练更充分,通常会更强。但“通常”不是“必然”,更不是“无限变强”。
Scaling Law 是什么
Scaling Law 可以理解为模型规模与性能之间的经验规律。
研究者观察到,在一定范围内:
- 模型参数增加。
- 训练数据增加。
- 计算量增加。
模型在某些指标上的表现会按相对可预测的方式改善。
这让训练大模型从“拍脑袋试试”变得更像工程规划:投入多少计算,大概能获得什么性能提升。
注意:Scaling Law 是经验规律,不是宇宙保证书。
参数、数据、算力
参数
参数是模型内部可学习的数字。
参数越多,模型表达复杂模式的容量通常越强。
但参数多也带来:
- 训练成本高。
- 推理成本高。
- 部署难度高。
- 延迟可能增加。
数据
数据是模型学习的材料。
数据不只是越多越好,还要:
- 质量高。
- 覆盖面广。
- 重复少。
- 噪音低。
- 风险内容可控。
如果数据质量差,模型可能学到错误、偏见或低质量表达。
算力
算力是训练和推理所需的计算资源。
训练算力决定模型学习过程能跑多大规模。
推理算力影响用户使用时的速度、成本和能力。后面会讲 Test-time Compute,也就是在回答时投入更多计算,让模型有机会做更复杂的推理。
能力为什么会出现跳跃感
有些能力在模型较小时不明显,模型变大后突然看起来出现了。
比如:
- 更好的上下文理解。
- 更强的代码能力。
- 更复杂的指令遵循。
- 更好的多步推理。
- 更自然的对话。
这常被称为“涌现”。但要谨慎理解:
- 有些能力确实在规模扩大后明显增强。
- 有些“突然出现”可能来自评估指标的门槛效应。
- 不同任务的增长曲线不同。
所以不要把“涌现”讲成玄学。它更像复杂系统在规模变化后表现出的能力变化。
小模型为什么仍然重要
如果大模型更强,为什么还要小模型?
因为真实产品不只看能力,还看:
- 成本
- 延迟
- 隐私
- 部署环境
- 任务复杂度
- 可控性
- 并发量
简单任务没必要每次都请最强模型出场。
例子:
- 文本分类可以用小模型。
- 本地输入法可以用端侧模型。
- 高频客服意图识别可以用便宜模型。
- 隐私敏感场景可能需要本地部署。
大模型像重型设备,小模型像常用工具。你不会用挖掘机夹菜,虽然它力气很大。
Test-time Compute
传统上,我们常关注训练时投入多少计算。
但近年来,推理时投入更多计算也变得重要。可以粗略理解为:模型回答问题时,不是马上给一个答案,而是花更多步骤进行推理、检查、搜索或规划。
常见形式:
- 多步推理。
- 自我检查。
- 生成多个候选再选择。
- 调用工具验证。
- 更长的思考过程。
它的价值:
- 对复杂推理任务更有帮助。
- 可以改善答案质量。
- 适合高价值、低频、需要准确性的任务。
代价:
- 更慢。
- 更贵。
- 系统更复杂。
- 仍然需要评估和边界控制。
模型能力增长的现实边界
Scaling 带来了巨大进步,但也有边界:
- 数据质量瓶颈。
- 算力成本瓶颈。
- 能源和硬件约束。
- 推理延迟和价格压力。
- 评估越来越难。
- 安全与合规要求更高。
更大的模型也不自动解决:
- 私有知识缺失。
- 实时信息缺失。
- 幻觉。
- 权限控制。
- 产品体验。
- 用户信任。
这些问题需要 RAG、工具、评估、产品设计和安全机制共同解决。
案例
做一个“合同审阅助手”。
模型选择可能是:
- 简单条款分类:小模型或规则足够。
- 合同摘要:中等或强模型。
- 高风险条款解释:强模型 + RAG + 引用 + 人工确认。
- 法律建议:不能只靠模型,需要专业人员审核。
这里的关键不是“用最大的模型”,而是按任务风险和价值分配模型与计算资源。
常见误区
误区 1:模型越大一定越好
能力通常更强,但成本、延迟、部署和任务适配也要考虑。
误区 2:小模型没有价值
小模型在低成本、低延迟、私有部署和特定任务中非常有价值。
误区 3:Scaling Law 等于能力无限增长
Scaling Law 是经验规律,不代表没有边界。
误区 4:推理时多想就一定更准
更多推理计算可能改善复杂任务,但也会增加成本,并且不能保证永远正确。
动手练习
选择一个 AI 功能,填写表格:
| 任务 | 是否需要强模型 | 原因 | 可接受延迟 | 风险等级 |
|---|---|---|---|---|
| 用户评论情感分类 | ||||
| 根据公司制度回答员工问题 | ||||
| 自动发送法律意见 | ||||
| 生成 20 个广告标题 |
然后思考:哪些任务值得花更多模型能力和推理成本?
检查题(自测)
- Scaling Law 主要描述什么关系?
- 为什么小模型仍然重要?
- Test-time Compute 的价值和代价分别是什么?
参考答案
- 主要描述模型性能随参数、数据、算力规模增长而提升的关系:在未饱和区间,规模越大能力越强,但增长会放缓,且需要三者按比例配合。
- 小模型成本低、延迟低、便于私有部署,适合高频、简单、稳定的任务;大模型不是所有场景的正确答案。
- 价值:在推理时投入更多计算(多次采样、逐步思考)能提升复杂任务表现;代价:延迟和成本明显增加,只适合对质量要求高的场景。
Takeaway
模型规模、数据和算力推动了 LLM 能力增长,但真实应用不能只崇拜“大”。好的 AI 系统会根据任务价值、风险、成本和延迟分配模型能力。