Mistral AIは、単なるテキスト抽出ではなく文書理解を目的とした光学文字認識API「Mistral OCR」を導入したと発表した。同社の製品発表では、OCRは、メディア、テキスト、表、数式の構造を保持しながら画像やPDFを処理できるシステムと説明されている。売り文句は、ページ上の文字を読み取ることだけではない。情報量の多い文書を、後続システムで利用できる機械可読な入力へ変換することにある。

同社によると、このモデルは科学論文、スライド、技術PDFなどの複雑なファイルを扱う組織を対象としている。発表によれば、Mistral OCRはテキストと画像の両方を含むコンテンツを、順序を保って交互に配置された形式で抽出する。レイアウトや視覚的要素が意味に影響し得る検索・質問応答パイプラインでは、この点が重要になる。Mistralは、単純なテキストブロックではなくマルチモーダル文書を必要とする検索拡張生成(RAG)システムと組み合わせる際に、特に有用な製品だと位置づけている。

Mistralによると、このモデルは同社の開発者向けプラットフォームを通じて利用でき、すでにLe Chatの数百万人のユーザーに対する標準の文書理解モデルとなっている。同社によれば、`mistral-ocr-latest`という名称のAPIは、1ドル当たり1,000ページという価格で、バッチ推論を利用すれば1ドル当たりの処理ページ数はおよそ2倍になる。発表では、同社のプラットフォームですでにサービスを利用でき、クラウド、推論パートナー、オンプレミスでの提供も今後始まるとしている。

性能はその主張の中心部分だ。Mistralによると、このモデルは単一ノードで1分当たり最大2,000ページを処理でき、数千種類の文字体系、フォント、言語に対応できる。同社はまた、機密情報や秘密指定されたデータを扱う組織向けに、OCRをセルフホスト環境で利用できるとしている。この選択肢からは、文書ワークフローを外部サービスに送るのではなく自社インフラ内に維持したい企業に、同社が製品を売り込んでいることがうかがえる。

発表はさらに、このシステムには文書を認識する能力があり、ユーザーは文書をプロンプトとして使い、特定の情報を抽出し、JSONなどの構造化データとして出力を整形できるとしている。Mistralによると、このためモデルはエージェントの構築や、抽出した出力を後続の関数呼び出しにつなげる用途に役立つ。同社はこのほか、研究資料のデジタル化、文化遺産の保存、顧客サポート、教育・法律・工学分野の資料を索引化され回答に利用できるコンテンツへ変換することなどを用途として挙げている。

情報源で示されている一つの点は、Mistral OCRが恒久的に固定された製品ではないということだ。同社によると、現在はすでに保守されておらず、新しいOCRモデルに置き換えられている。それでも、この発表はMistralが文書ツールをどう位置づけているかを示す当時の記録として有用だ。高速、多言語対応、レイアウト認識が可能で、単純なスキャンではなく企業の文書パイプラインに適しているという位置づけである。より大きなメッセージは、OCRが単なるユーティリティーとしてではなく、複雑なファイルを対象に推論する必要があるAIシステムの基盤層として扱われつつあるということだ。