GitHub Repo
CUA-S1-FORMS 以70萬參數處理表單決策,公開權重與訓練流程
Cua 將欄位配對與動作選擇交給小型模型,再由程式安排執行順序。公開評測仍限於少量示範表單,中文泛化與完整工作流程可靠度有待驗證。

Cua 團隊於9月19日在 Hacker News 介紹 CUA-S1-FORMS,把表單操作中的欄位配對交給約70.6萬參數、原始檢查點約2.8 MB的小模型。它讀取結構化介面元素與文件抽出的值,選擇填入、勾選、點擊或略過;不看螢幕截圖,也不自行生成欄位內容。團隊已公開訓練與執行整合程式。[團隊說明](https://news.ycombinator.com/item?id=49767564)
模型採用位元組嵌入及兩層 Transformer 編碼器,寬度128、四個注意力頭,再由選項注意力機制計算候選動作分數。表單元素可以合批評分,但各元素獨立判斷;填寫、勾選與送出的順序由應用程式安排。這種分工讓工程師能把重複決策交給本機分類器,另行保留工作流程與執行控制。[模型卡與權重](https://huggingface.co/cua-ai/cua-s1-forms)
訓練使用一萬組合成情境,加入同義標籤、相似欄位及干擾資料,並按完整欄位組合分隔訓練與測試。公開資料另含三個示範表單頁面與三份 PDF 所構成的196項決策;模型卡報告此小型實例評測全數答對。這項結果的分母是個別決策,不能直接視為跨網站、跨語言的完整填表成功率。[資料集](https://huggingface.co/datasets/cua-ai/cua-s1-forms)、[評測結果](https://huggingface.co/cua-ai/cua-s1-forms)
重驗時應把欄位選錯、略過必要欄位、重複送出及整份表單完成率分開記錄,避免大量容易的略過決策掩蓋少數會改動資料的錯誤。團隊量得本機表單評分約7至9毫秒,但不包含整套文件解析、觀察介面與實際操作時間。對照的雲端 Jev 未針對同一任務微調,呼叫時間也含網路延遲,因此無法據此推導通用模型間的速度或能力排名。[測試條件](https://news.ycombinator.com/item?id=49767564)
導入仍有執行限制:原始碼預設只產生計畫,執行與送出須分別啟用,每次修改後重新觀察視窗;若 Driver 未宣告相容的欄位寫入能力,填入操作會被拒絕。[執行介面說明](https://raw.githubusercontent.com/trycua/cua/main/libs/cua-s1/README.md)
中文使用者尤其需要重測:模型標籤以英文為主,上下文與選項各有224及96位元組截斷限制。按此限制,多位元組中文字可容納的字數更少。後續值得追蹤的是繁中欄位、未知版面與錯誤復原測試,以及分數能否可靠支援拒答門檻。[模型限制](https://huggingface.co/cua-ai/cua-s1-forms)