ミストラルAI、書類読み取りAIを更新
Mistral OCR 4 Brings Citation-Ready Structured Output to RAG, Agentic, and Enterprise Search Pipelines

ミストラルAIの新しい書類読み取りAI「OCR 4」は、文字情報に加え、場所や種類、AIの自信度も提供。文書からの情報抽出が正確になり、企業での活用が広がります。
本日、Mistral AIは最新の文書理解モデルであるOCR 4をリリースしました。この新しいリリースでは、bounding boxes、block classification、およびinline confidence scoresが抽出されたテキストに加えて追加されました。これは10の言語グループにわたる170言語をサポートし、完全にセルフホスト型デプロイメントのために単一のコンテナで動作します。OCR 4は、エンタープライズ検索、RAG、およびドメイン固有のretrieval pipelinesの取り込みコンポーネントとしても機能します。TL;DR OCR 4は、単なるテキストだけでなく、bounding boxes、typed-block labels、およびper-word confidence scoresを返します。これは10のグループにわたる170言語をサポートし、稀少言語やリソースの少ない言語でも改善が見られます。独立したアノテーターは、テストされたすべてのシステムの中でOCR 4を好み、平均72%の勝率を記録しました。価格は1,000ページあたり4ドルで、Batch-API割引を適用すると2ドルに下がります。1つのエンドポイントで、生の抽出とスキーマ駆動のDocument AI出力の両方を提供します。Mistral OCR 4は、幅広い種類の文書からコンテンツを抽出し、構造化します。以前の世代は、ページをクリーンなテキストとテーブルに変換することに焦点を当てていました。OCR 4は代わりに、文書全体の構造化された表現を返します。各ブロックはbounding boxで位置が特定され、タイプによって分類されます。ブロックタイプには、タイトル、テーブル、数式、署名などが含まれます。inline confidence scoresはページごと、単語ごとに生成されます。したがって、ダウンストリームシステムは、文書に何が書かれているかだけでなく、各要素がどこに位置し、どのような役割を果たし、モデルがどれだけ自信を持っているかを学習します。この追加のコンテキストは、引用、墨消し、およびhuman-in-the-loop検証にとって重要です。OCR 4は、PDF、DOC、PPT、OpenDocumentなどの一般的なエンタープライズ形式に対応しています。モデルは単一のコンテナにデプロイできるほどコンパクトです。データレジデンシーとコンプライアンスのために、エンタープライズ顧客向けにセルフマネージドデプロイメントが利用可能です。ベンチマークにおいて、MistralはOCR 4をAIネイティブのOCRモデル、最先端の汎用モデル、エンタープライズ文書サービス、およびMistral OCR 3と比較しました。多くの独立したアノテーターは、すべての
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。