機器人/邊緣 AI
CoTinyVLA 以 9 億參數超越 7B 機器人基線,但實驗仍停留在模擬環境
CoTinyVLA 把 35B 教師的分層推理蒸餾進 0.9B 視覺—語言—動作模型,在 LIBERO-Plus 四組測試均領先最強 7B 基線。程式、訓練流程與權重已公開,但尚無真實機器人、不同硬體或外部團隊的重現結果。

機器人 VLA 模型通常以擴大語言骨幹換取泛化能力,CoTinyVLA 則嘗試把必要的推理結構壓進 9 億參數。系統以 Qwen3.5-0.8B 為骨幹,每個控制步驟讀取第三人稱與腕部相機共 16 張歷史影格,並加入相機、時間標記,避免模型只依賴最新畫面。訓練時,35B 教師先產生兩層文字監督:整段任務的 `Plan`,以及描述階段、夾爪狀態和下一個子動作的 `Think`;40 條原始指令另被擴增成 800 種說法。
在包含 10,030 個擾動任務的 LIBERO-Plus,CoTinyVLA 在 Spatial、Object、Goal 與 Long 四套件分別取得 90.8%、87.3%、86.6% 和 80.7%,比各套件最強的既有 7B 結果高 2.8 至 15.9 個百分點。最顯著的差距出現在機器人初始狀態變化;這表示時間歷史與結構化監督可能比單純增加參數更能改善閉環控制的狀態辨識。
作者報告閉環推論峰值配置記憶體為 2.25 GiB;在 L40S、每張 GPU 三個並行 rollout 下,每八個動作的穩態延遲為 1.37 秒。快取 episode-level Plan 可把穩態延遲降低 48.5%。測試時刪除或置換 Plan,成功率會下降 40 至 45 點,顯示文字推理並非完全裝飾性輸出。
不過,成績來自 LIBERO 模擬器,且每個 LIBERO-Plus 擾動任務只執行一次,不能代表真實機械臂面對感測雜訊、控制延遲與硬體磨損的可靠度。儲存庫雖包含資料轉換、訓練及評測管線,目前社群採用與獨立驗證仍接近空白。下一步應觀察真機遷移、不同教師模型的蒸餾敏感度,以及在嵌入式 GPU 上的實際控制頻率。