如何构建 AI 扩展定律以实现高效 LLM 训练和预算最大化

MIT-IBM 团队发布大规模语言模型扩展定律系统性指南,通过分析 485 个模型和 190 万条性能指标,拟合超 1000 条扩展定律。研究发现预测相对误差最佳可控制在 4%,并证实小模型与大模型存在可迁移规律。建议优先训练多个小模型而非追求大模型,中期检查点数据最具预测价值。这项研究为资源受限的研究者提供了更公平参与大模型研究的可能,揭示了扩展定律在跨模型家族间的通用性。

发布于2026年4月13日 10:04
编辑小创
评论0
阅读1

MIT-IBM 团队发布大规模语言模型扩展定律系统性指南

训练大型语言模型往往耗资数百万美元。在预算有限的情况下,研究人员需要在模型架构、优化器和数据集选择等关键决策上精打细算。传统做法是通过扩展定律( scaling laws )来预测大模型性能:用规模更小的模型来估算目标大型模型的预测质量。然而,面对数千种可能的扩展定律构建方式,如何选择一直缺乏系统性的参照标准。

MIT-IBM Watson AI Lab 研究团队近日解决了这一困境。研究人员收集了来自 40 个模型家族的 485 个独立预训练模型及其训练检查点、计算成本、训练轮次等数据,并整理了 190 万条关于损失函数和下游任务的性能指标。基于这些数据,研究团队拟合了超过 1000 条扩展定律,并对比了它们在不同架构、模型规模和训练策略下的预测准确性。

研究的核心发现是:受随机种子噪声影响,扩展定律预测的绝对相对误差( ARE )最佳可控制在 4% 左右,而高达 20% 的误差在资源决策中仍具参考价值。具体而言,将中期训练检查点纳入分析能显著提升预测可靠性,但训练初期、 10 亿 tokens 之前的数据噪声较大,应当舍弃。研究建议优先在不同规模区间训练多个模型,而非一味追求大模型,五模型起步可提供稳健的预测基础。在成本受限的情况下,也可以仅训练目标模型家族中一个较小规模模型,借用架构相近家族的扩展定律参数。

令研究团队感到意外的是,部分训练的小模型展现出相当的预测能力,而来自完全训练模型的中期检查点数据可以直接用于其他目标模型的预测。更出乎意料的是,扩展定律在大型模型和小型模型之间表现出强相关性。此前学界普遍认为小模型与大规模模型存在本质差异。

这篇论文标题为《 A Hitchhiker‘s Guide to Scaling Law Estimation 》,已在国际机器学习大会上正式发表。研究人员下一步计划将分析扩展至模型推理阶段,探讨推理时长与性能的关联。

创艺洞察

这项研究的价值不仅在于提供了操作指南,更在于它揭示了一个长期被忽视的事实:扩展定律并非黑箱,不同模型家族之间存在可迁移的高层规律。三个超参数便能解释几乎全部行为变异,这意味着资源受限的研究者有了更公平地参与大模型研究的可能。与此同时,研究团队对推理阶段扩展定律的布局更具前瞻性。当训练成本相对固定而推理需求持续增长时,能够预判推理资源需求的理论框架将成为下一代模型开发的核心基础设施。

相关文章

生成式 AI 的未来将会怎样?
AI 新闻资讯
2026年4月13日
0 条评论
小创

生成式 AI 的未来将会怎样?

2025 年 9 月 MIT 举办首届生成式智能体影响联盟峰会,业界领袖共论技术未来。 MIT 校长与教务长强调需确保人类智慧与技术同步进步。杨立昆指出生成式智能体真正的突破口在于研发“世界模型”,即让机器像婴儿般通过感官与物理世界互动来构建对现实的抽象理解。亚马逊 CTO 认为生成式智能体是极具影响力的技术。峰会折射出业界期待正从“更强大的语言能力”转向“更接近人类认知模式的学习机制”。

#MIT#世界模型
阅读全文
从 LLMs 到“幻觉”,一文搞懂常见 AI 术语
AI 教程知识
2026年4月13日
0 条评论
零重力瓦力

从 LLMs 到“幻觉”,一文搞懂常见 AI 术语

本文系统梳理了人工智能领域的核心术语框架,涵盖 AGI 定义、智能体、神经网络、深度学习、大语言模型、扩散模型等关键技术概念,并解读了蒸馏、微调、幻觉、算力等产业实践要素。文章揭示 AI 产业飞速发展与概念定义尚未收敛的矛盾,指出记忆危机与算力瓶颈正从基础设施层面重塑竞争格局,理解概念本质比背诵定义更为重要。

#AI 模型
阅读全文
智谱 AI 发布开源 GLM-5.1 编程模型
AI 产品工具
2026年4月11日
0 条评论
小创

智谱 AI 发布开源 GLM-5.1 编程模型

智谱 AI 发布 GLM-5.1 编程模型,专为编程和智能体工程设计,可持续运行 8 小时完成规划、执行、测试、修复等全流程任务。基准测试表现亮眼, SWE-Bench Pro 获 58.4 分,超越 GPT-5.4 等竞品。具备 20 万 token 上下文窗口等技术优势,现已面向开发者开放。此举标志着智谱 AI 在编程和智能体基础设施领域迈出关键一步。

#AI 模型#开源模型#GLM
阅读全文
互动讨论

评论区

围绕《如何构建 AI 扩展定律以实现高效 LLM 训练和预算最大化》展开交流,未登录用户可浏览评论,登录后可参与讨论。

评论数
0
登录后参与评论
支持发表观点与回复一级评论,互动后将同步到消息中心。
登录后评论
暂无评论,欢迎成为第一个参与讨论的人。