最新模型
Sarvam Vision 2.1 加入表單結構化抽取與印度語言手寫辨識
新版結合版面解析與視覺語言模型,支援跨頁表格及表單欄位抽取。官方評測更換了部分測試範圍,API 模型版本對應也須在部署前核對。

Sarvam AI 於 9 月 24 日公布 Vision 2.1,新增跨頁表格、表單鍵值抽取與印度語言手寫辨識能力,服務範圍涵蓋英文及 22 種印度語言。這次更新把文件辨識延伸至欄位抽取,適合評估能否減少人工整理表單的工作。[官方公告](https://www.sarvam.ai/blogs/sarvam-vision-2-1)
系統延續視覺語言模型搭配專用處理元件的設計,以語意版面解析器與指標式閱讀順序網路輔助辨識。訓練結合真實及合成資料,再進行監督式微調與可驗證獎勵強化學習。因此,公布的表現應視為整套文件處理系統的結果,不能直接歸因於單一模型。[架構說明](https://www.sarvam.ai/blogs/sarvam-vision-2-1)
接入方式已有具體規格:Extract API 接受 JSON Schema 或已儲存的抽取設定,非同步執行後回傳欄位結果,並附上各末端欄位的信心值與來源。結構最多嵌套四層,每個欄位須有型別及描述;工程上可據此安排人工覆核,但信心值是否準確反映錯誤機率,仍須另行驗證。[抽取介面文件](https://docs.sarvam.ai/api-reference/doc-ai/job/extract)
若目標是建立搜尋或檢索增強生成資料,Digitise API 可保留版面,輸出 HTML、Markdown 或含文字區塊邊界框的 JSON。依此介面設計,團隊可保留文字與原文件位置的關係,方便追查資料來源;實際檢索品質仍要自行評估。[數位化介面](https://docs.sarvam.ai/api-reference/doc-ai/job/digitise)
官方測得 olmOCR-Bench 總分 87.3,但本次採官方完整測試集,前版使用過濾後的英文子集,兩版分數不能直接相減當作進步幅度。這也是供應商自行評測,尚不能據此推定中文文件的處理品質。[評測範圍](https://www.sarvam.ai/blogs/sarvam-vision-2-1)
另一項可重現資源是公開的 Indic OCR Bench:6,909 個文字區塊涵蓋英文及 22 種印度語言,標準答案經語言專家兩次審閱。評分以詞錯誤率換算詞準確率,並先正規化文字;其中「有效樣本」指標會排除失控重複輸出。重現時應同時呈現全體分數、失敗數與各語言結果,而且區塊辨識成績不等於整份表單欄位全部正確。[資料集與評分說明](https://huggingface.co/datasets/sarvamai/indic-ocr-bench)
部署前還有版本對應問題:目前文件的模型預設值仍寫作 `sarvam-vision-v1`,不足以確認請求實際使用 2.1。開發者應核對服務端版本,並以自家跨頁表格測量欄位正確率、部分失敗處理與端到端延遲,再判斷是否接入正式流程。[API 模型參數](https://docs.sarvam.ai/api-reference/doc-ai/job/extract)