据量子位报道,有阿里巴巴研究人员透露,Qwen4.5之后的模型将把参数规模扩展至5T至10T(5万亿至10万亿参数)区间。该说法来自研究人员的公开表述,阿里官方尚未公布相应模型的具体架构、发布时间与训练数据规模,因此更宜视为方向性规划,而非正式发布。
为什么值得关注?参数规模长期是基础模型能力讨论的核心变量之一。若按稠密结构实现,5-10T量级在训练与推理上都极不现实,业界普遍预期这类规模会以稀疏混合专家(MoE)等形态落地,即总参数远大于单次推理实际激活的参数。这意味着模型的总容量与知识覆盖可以继续扩展,同时通过激活比例控制单次推理开销。
对从业者的影响集中在三方面。训练侧,这一量级的预训练对算力集群规模、通信效率与训练稳定性提出更高要求,也会进一步放大数据质量与配比的重要性。推理侧,总参数与激活参数分离后,显存占用、专家路由效率与批处理调度成为工程重点,服务成本未必随总参数线性上升。生态侧,Qwen系列以开放权重与多尺寸矩阵著称,旗舰模型向T级迈进后,小尺寸与蒸馏版本的定位、开源策略如何调整,同样值得观察。
也需注意,参数规模并非能力的唯一决定因素,数据质量、后训练与强化学习等环节的权重仍在持续上升。5-10T会否成为下一代主流配置,取决于训练成本、推理经济性与实际收益之间的权衡。
