专栏中心

EEPW首页 > 专栏 > 语言模型参数越多越好?DeepMind用700亿打败自家2800亿,训练优化出「小」模型

语言模型参数越多越好?DeepMind用700亿打败自家2800亿,训练优化出「小」模型

发布人:机器之心 时间:2022-04-09 来源:工程师 发布文章
给定固定的 FLOPs 预算,应该如何权衡模型大小和训练 token 的数量?DeepMind 得出了与先前不同的结论。


最近一系列大型语言模型 (LLM) 正在崛起,其中最大的语言模型已经拥有超过 5000 亿个参数。这些大型自回归 transformer 通过使用各种评估协议(例如零样本、少样本和微调),在许多任务中表现出令人印象深刻的性能。
然而训练大型语言模型需要消耗巨大的计算和能源,并且这种消耗随着模型的增加而增加。在实践中,研究者事先分配的训练计算预算通常是预先知道的:有多少加速器可用以及我们想要使用它们多长时间。通常这些大模型只训练一次是可接受的,因此准确估计给定计算预算的最佳模型超参数至关重要。
Kaplan 等人研究 (2020) 表明,自回归语言模型 (LM) 中的参数数量与其性能之间存在幂律关系。结果是该领域一直在训练越来越大的模型,期望性能得到改善。Kaplan 等人(2020) 得出的一个值得注意的结论是,不应该将大型模型训练到其可能的最低损失,以获得计算的最佳化。
来自 DeepMind 的研究者得出了相同的结论,但他们估计大型模型可以训练的 token 数应该比作者推荐的更多。具体来说,假设计算预算增加 10 倍,其他研究者建议模型的大小应该增加 5.5 倍,而训练 token 的数量应该只增加 1.8 倍。相反,DeepMind 发现模型大小和训练 token 的数量应该以相等的比例扩展。
图片
论文地址:https://arxiv.org/pdf/2203.15556.pdf
继 Kaplan 等人和 GPT-3 的训练设置研究之后,近期大型模型的训练 token 大约为 3000 亿个(表 1),这与增加算力时,主要采用增加模型大小结论一致。
图片
在这项工作中,DeepMind 重新审视了这个问题:给定固定的 FLOPs 预算,应该如何权衡模型大小和训练 token 的数量?为了回答这个问题,DeepMind 将最终的预训练损失

专栏文章内容及配图由作者撰写发布,仅供工程师学习之用,如有侵权或者其他违规问题,请联系本站处理。 联系我们

关键词: AI

相关推荐

AI/HPC新世代 COUPE光互连扮要角

网络与存储 2026-05-15

EEPW2018年6月刊(5G)

资源下载 2018-06-11

研华科技与Axelera AI深化战略合作 加速推动基于Europa平台的边缘AI创新

AI催生“芯片通胀”:2D NAND价格失控,300%涨幅背后的行业博弈

2026-05-19

尼吉康的事业介绍

视频 2025-07-25

存储器转型AI战略资源 台厂受惠

网络与存储 2026-05-19

国家“算力网”:像用水用电一样用AI

2026-05-18

重新构想AI电源:塑造AI加速的未来(第三部分)

EEPW2018年3月刊(工业物联网)

基于Microchip MCU的AI/ML培训教程3

视频 2025-11-12

基于Microchip MCU的AI/ML培训教程1

视频 2025-11-12

CSR8670CSR8675智能语音Alexa蓝牙方案开发

资源下载 2017-12-14

基于Microchip MCU的AI/ML培训教程2

视频 2025-11-12

PowiGaN for AI Data Centers: Unmatched Power Density and Reliability

视频 2025-12-19

联发科加速AI在地化应用布局

智能计算 2026-05-19

思科凭借通用商用芯片与光模块赢得 AI 领域客户

被动元件新周期:AI时代高端化、服务器化重构MLCC产业格局

电子元件培训教材

AI聊天机器人能像医生一样推理吗?

更多 培训课堂
更多 焦点
更多 视频

技术专区