Google DeepMind 於 6 月 3 日發布 Gemma 4 12B,為 Gemma 4 系列(累積下載已逾 1.5 億次)的最新成員。此版本最大亮點是原生多模態:可直接處理文字、影像及音訊,無需額外編碼器,降低推理時的延遲與記憶體需求。關鍵規格是只需 16GB VRM 或統一記憶體即可在本機端運行,且各項基準測試表現接近兩倍大小的 Gemma 4 26B。這也是首款支援原生音訊處理的 Gemma 模型。

重點 / 為何重要

  • 原生三模態(文字 + 影像 + 音訊):首次無需外掛編碼器,架構更精簡
  • 16GB 記憶體門檻:消費級 MacBook Pro/高階 AI 筆電均可本機運行
  • 效能對應 26B 水準:12B 模型達到 26B 效能,參數壓縮比值得關注
  • 開放授權:Gemma 系列累積 1.5 億次下載,持續擴大開發者生態

影響 / 編輯按

本地 AI 模型效能持續快速提升,Gemma 4 12B 的規格顯示「裝置端多模態推理」正式進入主流消費硬體可及範圍。對企業與開發者而言,可不依賴雲端 API 即完成完整多模態任務,在隱私合規場景優勢明顯。

本文由 AI 整理,原文:TechNews 科技新報