论文 · 资源记录

Scaling Laws for Neural Language Models

在受控实验中研究语言模型损失随参数量、数据量和训练计算变化的经验幂律。

作者:Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B. Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, Dario Amodei年份:2020出版信息:暂无可核实信息元数据:存在暂无可核实字段链接核验于 2026-07-14

为什么重要

用于说明规模律是特定数据、模型与损失范围内的经验关系,不是无条件能力定律。

阅读前提

教材中的引用位置

  1. A12 · 第 1 章 语言建模、tokenization 与规模规律

    支持的主张:Kaplan 等的规模律论文用于核对损失随参数、数据和计算量变化的经验幂律、拟合区间及受控实验设置;《Deep Learning》用于核对语言建模似然、优化和泛化基础。本章将规模律限定为特定模型族、数据与损失上的经验关系,不由该回归外推能力、安全性或无限规模表现。

  2. A12 · 第 6 章 系统评估、故障模式与智能体综合复习

    支持的主张:ReAct 论文用于核对推理文本与工具动作交错的代理轨迹,RAG 论文用于核对检索器—生成器的联合建模,CLIP 论文用于核对图文对比预训练,InstructGPT 论文用于核对指令与偏好训练流程,规模律论文用于核对语言模型损失的经验缩放。本章分别引用这些接口,不把单篇实验扩张为自主性、事实性、多模态理解或安全性的统一保证。

官方入口