
DatalabのMarker v2がB200 GPU1枚で毎秒23.7ページを処理。共有推論で実現。
品質・速度ともMinerUを上回る。
高速モードはコスト削減に効果。
何が起きたか
Datalabがオープンソースの解析パイプラインMarker v2を公開。B200 GPU1枚で毎秒最大23.7ページを処理し、Markdown・JSON・HTMLを出力。90以上の言語に対応するOCR、レイアウト、読解順序、表認識を担う単一の650MパラメータモデルSurya 2上で動作する。
なぜ重要か
従来の解析スケーリングはワーカーを増やす方法で、各ワーカーがモデルのコピーを読み込むため、GPUのアイドル時間が生じ、複数コピーのコストを支払いながらスループットは1台分にとどまっていた。Marker v2は軽量なCPUワーカーを多数動かし、1つのSurya推論サーバーを共有する。ページがバッチ処理されるためGPUはビジー状態を保ち、スループットはVRAMではなくサーバーに応じてスケールする。
注目点
トレードオフのモードが重要。バランスモード(最高品質、GPUに最適)、高速モード(1ページあたりのコストは安いが、数式をテキストレイヤーから読むため数学精度が急落)、OCR無効モード(クリーンなデジタルファイル向けのCPU専用)。Allen AIのolmOCR-bench(1,403 PDF)では、バランスモードが76.0%でMinerUの72.7%を上回り、1秒あたりの処理ページ数は5倍以上。
Marker v2は文書解析の古典的なボトルネック、GPUの非効率使用に取り組む。従来のスケーリングはワーカーごとにモデルコピーを保持し、アイドル時間と冗長なメモリを生んでいた。推論を共有サーバーに集中させることで、GPUが多数のページを一度に処理し、OCRをオフにした場合、B200 1枚で毎秒23.7ページを実現。この設計はスループットをVRAMから切り離し、企業にとってコスト効率の良いスケーリングを可能にする。
ベンチマーク結果は効率性の具体的な証拠を示す。olmOCR-benchでバランスモードは76.0%を記録し、MinerUの72.7%を上回る。1秒あたりの処理ページ数は5倍以上。ただしモード選択は重要で、高速モードはテキストレイヤーから数式を読むため数学精度が落ちる。数式中心のコーパスではバランスモードを選ぶべきだ。このトレードオフは速度優先の最適化戦略に典型的なもの。
非技術者向けに言えば、Marker v2は適切なモードを選べば、品質を損なわずに解析コストを下げ、スループットを向上できる実用的な手段を提供する。オープンソースの性質により、ベンダーロックインなしで採用できるが、各チームは自社のドキュメントタイプで性能を検証すべきだ。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
モデルナとメルクが個別化がんワクチンの第3相試験で成功を報告した後、テンパスAIに関するソーシャルメディア上の議論が活発化し、関係者はこれに伴う顕著な株価上昇を指摘している

マスターカードのマイケル・ミーバッハCEOは、AIショッピングエージェントが決済を完了できる新プロトコル「Agent Pay」と、機械同士の決済向け「Agent Pay for Machines(AP4M)」について説明

AIが前例のない経済成長をもたらすなら、Visaとマスターカードは10年に一度の買い場だという主張だ

ブロードコムのAI半導体売上は四半期あたり約84億ドル、AIチップの受注残高は約730億ドル

ゴールドマン・サックスの幹部がAIにより銀行員の思考力が低下していると指摘

Simply Wall Stが創業者主導の3社—Meta Platforms、Oracle、AppLovin—をAI投資機会として紹介
