最新模型
Sarvam Vision 2.1、フォームの構造化抽出とインド諸言語の手書き認識に対応
新バージョンはレイアウト解析と視覚言語モデルを組み合わせ、複数ページにまたがる表やフォーム項目の抽出をサポートする。公式評価ではテスト範囲の一部が変更されており、導入前にAPIのモデルバージョン対応を確認する必要がある。

Sarvam AIは9月24日、複数ページにまたがる表、フォームのキーと値の抽出、インド諸言語の手書き認識に対応したVision 2.1を発表した。英語と22のインド諸言語を対象とする。今回の更新で、文書認識の機能が項目抽出まで拡張された。フォーム整理にかかる手作業を減らせるか評価する際に役立つ。[公式発表](https://www.sarvam.ai/blogs/sarvam-vision-2-1)
システムは、視覚言語モデルと専用処理コンポーネントを組み合わせる設計を引き継ぎ、意味的なレイアウト解析器とポインターベースの読み順ネットワークを認識に活用している。学習には実データと合成データを組み合わせ、その後、教師ありファインチューニングと検証可能な報酬による強化学習を行う。このため、公表された性能は文書処理システム全体の結果として捉えるべきで、単一のモデルに直接帰属させることはできない。[アーキテクチャの説明](https://www.sarvam.ai/blogs/sarvam-vision-2-1)
接続方法は具体的に定められている。Extract APIはJSON Schemaまたは保存済みの抽出設定を受け付け、非同期処理の完了後に項目の結果を返す。各末端項目には信頼度スコアと出典情報も付く。構造は最大4階層までネストでき、各項目には型と説明が必要だ。これをもとに人手による確認を組み込めるが、信頼度スコアが実際の誤り確率を正確に反映するかは、別途検証する必要がある。[抽出APIのドキュメント](https://docs.sarvam.ai/api-reference/doc-ai/job/extract)
検索や検索拡張生成(RAG)用のデータを作る場合、Digitise APIではレイアウトを保持し、HTML、Markdown、またはテキストブロックの境界ボックスを含むJSONとして出力できる。このインターフェース設計により、チームはテキストと元文書上の位置との対応関係を保持し、データの出典を追跡しやすくなる。実際の検索品質は別途評価が必要だ。[デジタル化APIのドキュメント](https://docs.sarvam.ai/api-reference/doc-ai/job/digitise)
公式評価ではolmOCR-Benchの総合スコアが87.3だった。ただし、今回は公式の全テストセットを使っており、前バージョンではフィルタリング済みの英語サブセットが使われていたため、両バージョンのスコアを単純に差し引いて性能向上の幅とみなすことはできない。これはベンダーによる評価でもあり、この結果から中国語文書の処理品質を推定することもできない。[評価範囲](https://www.sarvam.ai/blogs/sarvam-vision-2-1)
再現可能なリソースとして、公開済みのIndic OCR Benchもある。英語と22のインド諸言語を網羅する6,909のテキストブロックで構成され、正解データは言語の専門家が2回レビューしている。評価ではテキストを正規化したうえで、単語誤り率から単語精度を算出する。「有効サンプル」指標では、制御不能な反復出力を除外する。評価を再現する際は、全体スコア、失敗件数、言語別の結果を併せて示すべきだ。また、ブロック単位の認識成績は、フォーム全体の全項目が正しいことを意味しない。[データセットと評価方法](https://huggingface.co/datasets/sarvamai/indic-ocr-bench)
導入前には、モデルバージョンの対応も確認が必要だ。現在のドキュメントではモデルのデフォルト値が` sarvam-vision-v1`と記載されており、リクエストが実際に2.1を使うかどうかは確認できない。開発者はサーバー側のバージョンを確認し、自社の複数ページにまたがる表で項目の正確性、部分的な失敗への対処、エンドツーエンドの遅延を測定してから、本番フローに組み込むか判断する必要がある。[APIのモデルパラメーター](https://docs.sarvam.ai/api-reference/doc-ai/job/extract)