规模法则(Scaling Laws)揭示了大模型性能与“规模”之间的定量关系:在可控范围内,把模型的参数、训练数据、算力同步扩大,模型在标准评测上的表现会平滑地、可预期地提升。这一规律由 OpenAI 团队在 2020 年发表的研究中系统化提出,后来 DeepMind 的 Chinchilla 研究又进一步指出“数据和参数应按约 1:1 的关系同步扩展”。
核心发现
- 参数越多、数据越多、算力越大,性能越好
- 提升是“平滑可预测”的:可以在训练前用曲线外推,估算投入多少资源能达到什么水平
- 计算最优:给定算力预算,参数与数据量存在最佳配比
- 为大模型“大力出奇迹”提供了理论依据:砸钱加算力是“有回报”的
- 支撑了算力军备竞赛:各家公司按规模法则持续扩大训练规模
- 原始规模法则在大规模上出现偏离,算法和数据质量的提升同样关键
- 2025 年前后“推理时算力(Test-Time Compute)”被视为新的扩展维度