模型與開源工具
Gemma 4 12B 以單一 Transformer 直接處理影像與音訊,降低多模態部署複雜度
Google 發布 Gemma 4 12B 開放權重模型,以線性投影取代獨立視覺與音訊編碼器。新架構簡化微調與本機推論,但官方效能數據仍須由獨立測試驗證。

Google 的 Gemma 4 12B 採用密集、僅解碼器 Transformer,最大變化不是參數規模,而是把多模態輸入直接納入語言模型的權重路徑。傳統視覺語言模型通常先由獨立影像或音訊編碼器抽取特徵,再交給 LLM;Gemma 4 12B 則把 48×48 像素區塊以單次矩陣乘法投影到隱藏空間,並將 16 kHz 音訊切成 40 毫秒訊框後做線性投影。影像位置資訊由分解式 X、Y 座標查表加入。
這種「無編碼器」設計移除了多階段執行與分散的記憶體配置。由於文字、影像與音訊最後共用同一組 Transformer 權重,LoRA 或全量微調可在單一訓練迴路內改變跨模態行為,不必另外協調凍結的視覺、音訊塔。對建置文件辨識、語音助理或影片分析系統的團隊而言,模型封裝、記憶體規劃及推論排程都有機會變得更單純。
12B 版本可接收文字、影像及音訊,Google 稱其可在配備 16GB VRAM 或統一記憶體的裝置上執行;LiteRT-LM 亦提供 OpenAI 相容的本機 API 伺服器與前綴快取。技術報告另描述思考模式、量化感知訓練版本,以及供推測式解碼使用的多詞元預測草稿頭。長上下文部分則混用滑動視窗與全域注意力,官方宣稱可把全域 KV cache 佔用最多降低 37.5%。
工程團隊仍應自行量測首詞元延遲、音訊長度與影像數量增加時的顯存曲線,以及量化後的跨模態品質。直接投影原始訊號雖然減少前處理,卻也把感知與推理更緊密地綁在同一模型內;這是否能在專業影像、口音、噪音與長影片上穩定勝過專用編碼器,尚待獨立評測。