多模態模型
ParVL 以共享骨幹並行擴展多模態模型,視覺與語言算力可分別配置
ParVL 不增加多套完整參數,而是重複使用同一組 ViT 與 LLM 權重,再以分支專屬 KV prefix 區分運算路徑。研究顯示,不同任務需要不同的視覺與語言分支比例,固定配置可能浪費推論算力。

多模態模型通常沿兩條路擴展:增加參數,或讓模型在推論時產生更長的序列;前者提高記憶體需求,後者增加延遲。ParVL 提出第三種做法:讓多個視覺與語言分支重複使用同一套 InternVL3.5/Qwen3 骨幹權重,只替各分支加入可學習的 KV prefix,再以輕量聚合器合併輸出。如此可增加實際執行的運算量,卻不必按分支數複製主要權重。
團隊以約 130 億 token 進行全參數監督微調,並在 1B 模型上測試九種視覺、語言分支配置。公開結果顯示,單分支基線在九項影像基準的等權平均為 49.6;四個視覺、四個語言分支升至 50.5。較大的 2B 與 8B、各採 2:2 配置時,平均分別為 54.7 與 63.0。改善幅度不算巨大,但實驗的重要發現是分配不存在通用最優值:OCR、數學及一般視覺理解偏好的視覺/語言算力比例不同。
專案已公開模型實作、DeepSpeed 設定、11 組檢查點、訓練歷史及 CPU 測試;評測涵蓋 MMMU、MathVista、ChartQA、DocVQA 等資料集。不過訓練資料本身未重新散布,部分答案抽取依賴 GPT-4o,結果也會受硬體數量、FlashAttention 版本及批次組成影響。工程團隊下一步應關注分支並行是否能在真實 serving 系統中轉化為更好的品質/延遲曲線,以及能否依請求類型動態調整視覺與語言分支,而非為所有工作固定支付相同算力。