返回首頁

AI 軟體/文件處理

Cohere Parse 5 以 2.3B 視覺模型處理企業文件,但基準分數排除了圖表與版面定位

Parse 5 將 PDF、簡報與影像轉成保留表格及閱讀順序的 Markdown,API 定價為每千頁 1.50 美元。官方公布的 ParseBench 79.2 分只涵蓋五個評測維度中的三個,不能當成完整文件理解成績。

DrAntonioCarlosMdeQueiroz · CC BY-SA 4.0 · Image source
zh-Hant

Cohere 發布文件解析模型 Parse 5,模型識別碼為 `parse-v5.0`。它是一款約 23 億參數、4.6GB 的專有視覺語言模型,上下文長度為 8,192 token,可從 PDF、PPT 與影像抽取文字、閱讀順序、表格、表單、清單、圖片及說明,再輸出 Markdown 或有序內容區塊;表格與圖片可附帶 bounding box。這使它可直接放在 RAG、文件索引或代理工作流程的入口,減少自行串接 OCR、版面分析與格式重建的工程。

服務現已透過 Cohere API、Model Vault、Microsoft Foundry 與 AWS SageMaker 提供。Cohere API 標價為每千頁 1.50 美元;官方亦稱八張 H100 可處理每秒 36 頁。不過,這是供應商控制環境下的吞吐結果,實際延遲仍會受頁面解析度、視覺路徑比例、批次大小及重試影響。模型不公開權重,也不為抽取內容回傳信心分數,受監管流程仍需另建抽樣、欄位驗證與人工複核機制。

最值得留意的是評測口徑。Cohere 依更新後規則重跑 ParseBench,在表格、內容忠實度及語意格式三項平均取得 79.2,低於 GPT-5.5、Opus 4.8 與 Gemini 3.5 Flash,但略高於 LlamaParse Cost Effective。原始 ParseBench則包含約 2,000 頁、逾 16.9 萬條規則及五個維度;Cohere沒有把圖表資料抽取與完整視覺定位納入平均,因 Parse 目前只描述圖表,也不為每段文字輸出定位框。因此工程團隊應以自身的中文掃描件、跨頁表格、印章與圖表建立回歸集,不能只比較單一總分。

來源

  1. Introducing Parse: Enterprise document intelligence at scale
  2. ParseBench: A Document Parsing Benchmark for AI Agents