AIがPDFから情報自動抽出
Datalab Releases lift: A 9B Open-Weights Vision Model That Extracts Structured JSON From PDFs Using Schemas

Datalabが、PDFや画像から指定形式で情報を自動抽出するAI「lift」を公開。書類からのデータ入力作業を90.2%の精度で効率化し、手作業を大幅削減できる点が重要。
Datalabは、構造化抽出のための9Bオープンウェイト視覚モデルであるliftをリリースしました。JSONスキーマを渡すと、それに一致するJSONオブジェクトを返します。このモデルはPDFや画像を直接読み込み、スキーマに照らしてデコードします。これはDatalabが純粋に抽出のために構築した最初のモデルです。同チームはすでにオープンソースのOCRツールであるchandra、marker、suryaを提供しています。liftはその取り組みをスキーマ駆動型のフィールド抽出へと拡張します。liftはDatalabの225文書ベンチマークで90.2%のフィールド精度を記録しました。研究チームは、テストした中で最も強力な小型の自己ホスト可能なモデルであると報告しています。1文書あたり中央値で9.5秒で実行されます。Datalab liftとは何ですか?liftは、構造化抽出のための9Bパラメータ視覚モデルです。標準のJSON Schemaを入力として受け入れます。その形式の有効なJSONを出力として返します。このモデルは複数ページの文書を一度に処理します。ページをまたがる値を読み取ることができます。文書全体が一度に入力され、ページごとではありません。パッケージには2つの推論モードが付属しています。ローカル推論はHuggingFaceを通じて実行されます。リモート推論はvLLMサーバーを通じて実行され、Datalabはこれを本番環境向けに推奨しています。コードはApache 2.0です。ウェイトは修正されたOpenRAIL-Mライセンスを使用しています。liftは、小規模ながら成長しているオープン抽出モデルの分野に参入します。NuExtractファミリーのように目的特化型で構築されたものもあれば、Qwen3.5-9Bのように抽出に活用される汎用ビジョン言語モデルもあります。liftは、ビジョン言語基盤とスキーマ制約付きデコーディング、および訓練された棄却を組み合わせています。Datalabのベンチマークでは、オープンなグループの中でフィールド精度をリードしています。スキーマ制約付きデコーディング:主要なメカニズム。主な設計上の選択はスキーマ制約付きデコーディングです。liftは出力をスキーマに直接照らしてデコードします。その結果は常に正しい形式の有効なJSONになります。内部で何が起こるかというと、liftはまずJSON SchemaをPydanticモデルに変換します。次に、それを厳密なJSON Schemaに正規化します。このスキーマはresponse_format制約としてvLLMサーバーに渡されます。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。