据科技媒体 Solidot 报道,阿里巴巴下一代模型的参数规模将扩大到 5 万亿至 10 万亿。报道未披露该模型的具体名称、发布时间、架构选择与训练细节,目前也未见官方对这一数字的确认。
对 AI 从业者来说,这个数字之所以值得关注,是因为它把国产大模型的规模上限又往上推了一档。参数规模长期被视为模型能力的粗略代理指标:在数据质量与训练方法相当的前提下,更大的参数量通常对应更强的知识容量与推理潜力,但代价是算力、显存、通信与推理成本的显著上升。为缓解这一矛盾,业界普遍采用混合专家(MoE)等稀疏激活架构,让总参数量达到数万亿级的同时,每次前向传播只激活其中一小部分参数,从而把单次推理开销控制在可接受范围。若阿里确实推进到这一量级,其技术路径大概率也涉及类似的稀疏化设计,但这一点属于基于行业通行做法的推断,报道本身并未确认。
另一个关键在于训练侧门槛。万亿级以上的训练对集群规模、卡间互联带宽、数据配比、断点恢复与长周期稳定性工程都提出了很高要求,任何一环的短板都会直接体现为有效算力浪费。因此,参数规模的扩大往往不只是"堆参数",而是对整套训练基础设施与工程能力的同步检验。
从竞争格局看,参数规模的抬升也会传导到下游:推理成本如何控制、是否开源、上下文长度与多模态能力如何配置,将决定这一规模优势能否转化为实际可用的产品能力。上述问题目前均无公开答案,需等待官方信息或后续披露。
