HN精选|Gemma 4 12B发布

Gemma4 12B:无编码器多模态,16G显存本地跑

背景:Gemma家族的“中杯”终于来了

2026年6月3日,Google DeepMind正式发布Gemma 4 12B,这是Gemma 4系列中填补4B轻量版与26B MoE旗舰版之间关键空白的中间型号。Gemma系列模型下载量已突破1.5亿次,从可穿戴机器人手臂到企业级AI安全,开发者社区的创造力远超预期。此次12B版本的核心卖点可归纳为:无编码器多模态架构、先进的推理能力、可在16GB显存的笔记本上本地运行,以及Apache 2.0开源协议。

更值得注意的是,这是Gemma系列首款原生支持音频输入的中型模型,标志着Google将多模态能力从云端推向终端的决心。

技术突破:无编码器的统一架构

Gemma 4 12B最引人注目的创新是彻底取消了传统的多模态编码器。在之前的Gemma 4版本中,视觉处理依赖专用的视觉编码器(如SigLIP),音频处理也需要单独的模块。而12B版本采用了一种全新的方式:视觉和音频输入直接流入LLM主干网络。

具体来说,视觉编码器被替换为一个轻量级嵌入模块,仅由单一矩阵乘法、位置嵌入和归一化层组成——整个模块只有约3500万参数。一位Hacker News用户对此表示困惑:“从技术上讲这仍然是编码,只是没有使用SigLIP这样的专用模型?”Google开发者指南解释道,这种设计大幅减少了模型的内存占用和推理延迟,同时保持了接近26B模型的基准性能。

性能实测与社区讨论

社区对Gemma 4 12B的实际表现反应不一。有用户使用Q4量化版本(llama.cpp)运行了扫雷游戏编程基准测试,结果“还算不错”,但出现了几次奇怪的语法错误——多余的括号和不正确的函数分隔符。另一位用户则报告了灾难性的图像处理结果:Gemma 4 12B在处理一张简单的“这是一次测试”文字图片时思考了6分钟后仍然失败,而7%参数量的Qwen 3.5 0.8B却在一秒内准确给出了答案。

关于量化精度也引发了讨论。Google宣传16GB内存即可运行,但实际上HuggingFace上发布的模型是16位浮点版本,这意味着用户需要自行量化到8位才能在16GB显存下运行,可能会带来显著的性能损失。这被部分社区成员视为一种“有误导性的营销”。

战略意义:Google为何持续开源?

一个反复被社区提出的问题是:Google作为营利性公司,为何持续开源如此先进的模型?有分析认为,这既是一种生态布局策略——通过开源培养开发者习惯和工具链依赖——也是在AI监管趋严背景下建立行业标准的举措。另有用户指出,Google在模型效率上的积累(不断缩小模型的同时提升性能)类似于半导体行业的摩尔定律,这种技术壁垒本身就是护城河。

还有人提出了更直接的洞见:“我们正在进入一个闭环博弈。Google不需要任何其他人来加速他们的模型。这就是他们的核心业务。”从这个角度看,开源既是信心的展示,也是人才和注意力的磁石。

原文链接:Google Blog: Introducing Gemma 4 12BHN讨论

Leave a Reply

Your email address will not be published. Required fields are marked *