1. 首页
  2. 7x24H快讯

智谱创始人唐杰:大模型Scaling不只是堆参数,未来竞争核心转向后训练与推理能力

OKX欧易app

OKX欧易app

欧易交易所app是全球排名第一的虚拟货币交易所,注册领取6万元盲盒礼包!

APP下载   官网注册
Odaily星球日报讯 智谱创始人唐杰在 X 平台发布关于大模型 Scaling Law 的思考文章表示,当前人工智能行业对模型能力提升的理解正在从“扩大参数规模”转向多维度扩展,参数量并非衡量模型能力的唯一指标,还需要结合数据规模、计算资源分配方式以及模型实际运行场景综合评估。唐杰指出,早期研究曾推动行业快速扩大模型参数规模。Kaplan 等人在 2020 年的研究认为,模型参数增长速度应高于数据增长速度,推动了 GPT-3、Gopher、MT-NLG 等超大规模模型的发展。但 Hoffmann 等人在 2022 年通过分析数百个模型发现,计算最优方案更接近“每个参数对应约 20 个训练 Token”,模型参数和数据规模应保持同步增长,过去追求万亿参数模型的路线实际上是一次行业共同经历的“偏航”。随着模型应用场景变化,推理成本逐渐成为生命周期成本的重要组成部分,优化目标也从单纯降低训练成本转向提升长期运行效率,因此“小模型+更充分训练”的路线开始受到关注。唐杰表示,稀疏混合专家(MoE)架构进一步改变了 Scaling 逻辑。在 MoE 模型中,总参数量决定模型能够存储多少知识,而激活参数和有效深度更影响模型完成复杂推理任务的能力。对于漏洞发现等需要长链条推理的任务而言,能力并不来自简单记忆更多信息,而是需要模型保持多步推理过程的连贯性。近期研究显示,最优“Token/参数比例”并不存在统一答案:偏向记忆型任务需要更多参数,而偏向推理型任务则更依赖更多数据和计算深度。在固定训练数据规模下,盲目增加总参数甚至可能削弱推理能力,而增加激活专家数量则更有助于提升模型表现。围绕智谱最新模型进展,唐杰透露,GLM-5.3 是一次针对 Scaling 方向的实验。该模型与 GLM-5.2 采用相同基础模型、架构以及总参数和激活参数规模,但通过一个月的大规模长周期环境训练和强化学习(RL)进行后训练优化,性能提升并非来自参数增加,而是来自后训练阶段的扩展。他总结称,大模型竞争已经从单纯比拼参数规模,进入探索“多维 Scaling”的阶段,未来模型能力提升将更多依赖训练策略、推理深度以及后训练能力的持续优化。

本文由网站用户发布,不代表炒久币网立场,转载联系作者并注明出处:https://www.chaobtc.com/kx/48780.html

相关内容