GitHub Repo
Ollamaコミュニティ、GLM-OCRの表認識の劣化を報告 アップグレード後にプレーンテキスト出力や生成の反復が発生する可能性
10月5日のコミュニティ報告によると、Ollamaを0.34.0から0.35.1にアップグレードした後、GLM-OCRの表出力と認識結果が劣化する可能性がある。報告者は同一環境でのバージョン比較を示したが、原因、影響範囲、修正状況は上流での確認を待っている。

OllamaのGitHubで10月5日、GLM-OCRの表認識が劣化したとの報告があった。ユーザーによると、0.35.1へのアップグレード後、同じ文書画像とTable Recognition:プロンプトを使っても、プレーンテキストしか出力されない場合や、生成を繰り返した末にHTTP 500で終了する場合があるという。この事例は文書解析の出力構造と安定性に関わり、表データに依存する自動化ワークフローにとって参考になる。コミュニティ報告
テスト環境はWindows 11、RTX 5060 Ti 16GB、モデルライブラリのglm-ocr:latest bf16モデル。報告者は0.34.0と0.35.1を並行して実行し、旧版では4~9秒で完全なHTML表が生成された一方、新版では一部のリクエストに1~5分かかったとしている。また、合成ラボレポートのテストセットでは、正解数が197/197から113/197に低下したという。これらの数値は単一ユーザーによるテスト結果であり、一般的な文書の認識精度を直接示すものではない。バージョン比較
表認識プロンプトの使用方法は公式資料にも記載されている。OllamaのモデルページではTable Recognition:の使い方が示され、Z.aiのモデルカードでも、テキスト、数式、表の認識がサポート対象として挙げられている。GLM-OCRはビジョンエンコーダー、クロスモーダルコネクター、言語デコーダーを組み合わせている。一方、公式の文書解析SDKはレイアウト分析と構造化出力も追加するため、モデル単体の推論結果と完全な解析パイプラインの結果は分けて評価すべきだ。Ollamaの使用方法、公式モデルカード
技術面でのリスクは、モデルがテキストを読み取れていても、セル構造が失われれば下流の処理で値と列の対応がずれ、レポートの取り込みや検索データの品質に影響する可能性があることだ。これは報告事例から推測される影響であり、他の環境にも広く影響していることを示す証拠は現時点でない。アップグレードを検証するチームは、内容の正確さ、HTMLの解析可能性、行と列の対応、タイムアウトの割合を併せて確認できる。
報告者は両バージョンで記録された起動パラメーターが同じだったことから、同梱のllama-serverのビルド変更を疑っているが、これはまだ検証されていない仮説だという。画像を縮小したり、プロンプトの末尾に改行を加えたりする方法は、ときどきしか効果がなかった。今後は、メンテナーが問題を再現できるか、バージョン間の差を特定できるか、同じ画像で修正の効果を確認できるかを追う必要がある。報告と暫定的な対処結果