跳到主内容
快讯直播
AI智模界
模型

谷歌发布 Gemma 4 12B:无编码器统一多模态模型

谷歌 DeepMind 发布 Gemma 4 12B,在官方博客中将其介绍为「统一、无编码器的多模态模型」(a unified, encoder-free multimodal model)。

当前主流多模态模型多采用「拼装式」架构:为图像、音频等模态分别配备独立编码器,再把编码结果投射到语言模型的特征空间,由语言模型统一生成。该方案成熟,但组件多、链路长,模态之间的对齐通常还需要额外训练。

Gemma 4 12B 的两个关键词正对应这两点:unified 指不同模态走同一套模型结构,encoder-free 指不再依赖独立编码器。若这一路径成立,多模态能力的引入会更接近「原生」,工程上也可减少模块数量与对齐环节。

对从业者而言,值得关注的是该模型在 Gemma 系列中的定位、权重与许可方式,以及无编码器设计在真实任务上能否与专用编码器方案相当。目前官方仅给出模型命名与整体定位,具体能力与开放形式需以官方发布信息为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。