blog

DeepSeek OCRの長文精度が向上!BaiduのUnlimited-OCRが示す文書DX

企業のペーパーレス化や業務効率化において、紙文書やPDFから高精度にテキストを抽出するOCR(光学文字認識)技術は不可欠です。しかし、複数ページに及ぶ長大なドキュメントを処理する際、従来のAIモデルはメモリ消費の増大や処理速度の低下、最悪の場合には処理が停止するという技術的課題を抱えていました。

この課題に対し、Baidu(百度)が「DeepSeek-OCR」をベースとした新しいオープンウェイトモデル「Unlimited-OCR」をリリースし、長文ドキュメントの認識精度と処理効率を大幅に向上させました。本記事では、この最新技術の要点と、日本のビジネス現場における導入メリットや注意点について、意思決定者向けに解説します。

DeepSeek OCRの長文精度が向上!BaiduのUnlimited-OCRが示す文書DX

BaiduによるDeepSeek OCRの長文・精度向上アップデートの要点

海外メディアの「theaiautomators.com」および「medium.com」などの報道によると、Baiduは長文ドキュメントのOCR処理に特化したオープンウェイトのビジョン言語モデル「Unlimited-OCR」をリリースしました。このモデルは、中国のDeepSeek社が開発した「DeepSeek-OCR」をベースに構築されています。

従来のDeepSeek-OCRは、テキストトークンよりも約10倍少ないビジョントークン(画像情報)を使用しながら97%の精度を達成する画期的なモデルとして知られていました(出典:Unsloth公式ドキュメント)。しかし、複数ページのPDFなど長大な文書を処理する際、出力が長くなるにつれて「KVキャッシュ(Key-Value Cache)」が肥大化し、メモリ消費の増大や処理速度の低下が発生するという限界がありました。

今回リリースされたUnlimited-OCRは、「Reference Sliding Window Attention (R-SWA)」と呼ばれる新しいアテンション機構を導入しています。これにより、長文処理時でもメモリ使用量を一定に保ち、複数ページのPDFを1回のパスで安定かつ高速に処理することが可能になりました。複雑なレイアウトや長大なテキストを含むドキュメントの解析精度が大幅に改善され、企業のデータ抽出業務を強力に支援します。

長文ドキュメント解析における「KVキャッシュ肥大化」の解消が意味すること

従来のLLM(大規模言語モデル)やビジョン言語モデルを用いたOCR処理では、入力する文書が長くなればなるほど、文脈を保持するためのメモリ領域(KVキャッシュ)が指数関数的に増加していました。これは、サーバーの物理メモリを圧迫し、途中で処理が強制終了する「Out of Memory (OOM)」エラーを引き起こす主因となっていました。

Baiduが導入したR-SWA(Reference Sliding Window Attention)は、必要な参照範囲をスライド窓のように限定しながら処理を進める技術です。これにより、どれだけ長大な文書であってもメモリ消費量を一定の閾値以下に抑え込むことができます。

この技術革新は、単に「長いページが読めるようになった」というレベルに留まりません。これまでページごとに分割して並列処理し、後から結合していた複雑なパイプラインが不要になり、「1つの長大なPDFファイルをそのまま一括投入して、文脈を維持したまま高精度に構造化データ(Markdownなど)へ変換する」というシンプルな運用を可能にします。これは、企業のシステム構築コストや運用保守の工数を劇的に削減するブレイクスルーです。

なお、DeepSeek-OCRの基本的な仕組みや、文書をMarkdown化するオープンソースとしての特性については、詳細を解説した関連記事「DeepSeek OCRとは?文書をMarkdown化するオープンソースAIの仕組み」も併せてご参照ください。

日本企業におけるUnlimited-OCR導入のメリットと活用場面

Unlimited-OCRの登場は、日本の商習慣や行政手続きにおける文書DXを大きく加速させる可能性があります。具体的な活用場面とメリットは以下の通りです。

介護・医療分野における長大な審査書類のデータ化

日本の介護や医療の現場では、膨大な手書き書類や複数ページの認定書類が日常的に飛び交っています。厚生労働省の科学研究費補助金による研究報告「機械学習を用いた介護認定審査会の審査判定プロセス等に関する研究」でも、審査判定プロセスにおける機械学習やデータ活用の重要性が指摘されています。Unlimited-OCRを活用することで、数十ページに及ぶ介護認定書類や医師の意見書を一括で読み込み、文脈を損なわずに正確なテキストデータとして構造化することが可能になります。

製造業やインフラ業界における「長大なマニュアル」の解析

製造業や建設業、IT業界における数万ページ規模の製品マニュアルや仕様書のデータ化にも威力を発揮します。例えば、ゲームマニュアルの構造化分析に関する研究(出典:Jxiv「ゲームマニュアルにおける没入的記述の構造化分析」)にみられるように、複雑なレイアウトや図表、テキストが混在するドキュメントから、特定の仕様や手順を正確に抽出するニーズは高まっています。Unlimited-OCRは、長文の文脈を維持したまま図表とテキストの関係性を解析できるため、社内マニュアルを学習させたRAG(検索拡張生成)システムの精度向上に直結します。

金融・法務における契約書やアニュアルレポートの解析

数百ページに及ぶ有価証券報告書や、複雑な特約条項が並ぶ契約書の解析において、従来のOCRではページの境界をまたぐ文脈の読み飛ばしや誤認識が課題でした。Unlimited-OCRであれば、1回のパスでドキュメント全体を俯瞰して処理できるため、契約書内の矛盾点の検知や、財務データの正確な抽出を低コストで実現できます。

こうした高度なテキスト解析技術の背景にある自然言語処理モデルの進化については、関連記事「BERTとは?自然言語処理を革新したAIモデルの仕組みと活用例」で詳しく解説しています。

導入におけるデメリットと日本特有の注意点・リスク

Unlimited-OCRは強力な技術ですが、日本企業が実務に導入するにあたっては、以下のデメリットやリスクを客観的に評価する必要があります。

評価項目 Unlimited-OCR(Baidu/DeepSeekベース)の現状と課題
日本語の認識精度 ベースとなるDeepSeek-OCRは多言語対応ですが、日本語特有の縦書き、ルビ、業界専門用語、手書き文字に対する精度は、日本語特化型モデルと比較して検証が必要です。
インフラコスト オープンウェイトモデルであるため自社サーバー(オンプレミスやプライベートクラウド)でのホストが可能ですが、高性能なGPU(NVIDIA A100等)の確保と運用コストが発生します。
セキュリティとガバナンス 中国系テック企業(Baidu、DeepSeek)が主導する技術であるため、地政学的リスクや企業のセキュリティポリシー、個人情報保護法(APPI)に準拠したデータ取り扱い体制の構築が求められます。
サポート体制 オープンソースコミュニティ主導の開発となるため、商用ベンダーのような24時間365日の保守サポートや、不具合時の即時対応は期待できません。自社での技術力(エンジニアリングリソース)が必要です。

特に、機密性の高い個人情報や医療データを扱う場合、外部のパブリックAPIにデータを送信することはガバナンス上困難なケースが多いでしょう。その点、Unlimited-OCRはオープンウェイト(MITライセンス等)で提供されているため、国内のセキュアなインフラ環境に自社ホスト(ローカル環境での構築)できる点は大きなメリットですが、それを構築・維持するための社内リソースの確保がトレードオフとなります。

このような機械学習モデルを自社で効率的に運用・学習させる手法については、関連記事「機械学習とは?基礎知識から具体的な学習手法まで分かりやすく解説」や「ディープラーニング(深層学習)の仕組みとビジネス応用」が参考になります。

経営・導入判断:日本企業が今とるべき実務的なアプローチ

BaiduによるUnlimited-OCRのリリースは、長文ドキュメント処理のコストパフォーマンスを劇的に改善する可能性を秘めています。企業の意思決定者は、単に「新しいAIが出た」と静観するのではなく、以下のステップで実務的な検証を開始することを推奨します。

【推奨される実務プロセス】

  1. 対象文書の選定:社内に存在する「複数ページにわたり、かつ構造化(MarkdownやJSON化)したいが、従来のOCRではエラーやコスト高で断念していた文書」(例:過去の報告書、マニュアル、契約書)をリストアップする。
  2. PoC(概念実証)の実施:Hugging Face等で公開されているUnlimited-OCRのウェイトを用いて、セキュアな検証環境を構築し、実際の日本語ドキュメントを読み込ませて「長文における認識精度」と「メモリ消費量(コスト)」を測定する。
  3. ハイブリッド運用の検討:すべての処理をUnlimited-OCRに置き換えるのではなく、定型フォーマットは従来のルールベースOCRで処理し、非定型の長文ドキュメントやマニュアル解析のみをUnlimited-OCRに割り振るなどのハイブリッド構成を設計する。

また、画像とテキストを同時に処理する「マルチモーダルAI」の技術トレンドを把握しておくことも、今後のシステム投資判断において重要です。詳細については、関連記事「マルチモーダルAIとは?テキスト・画像・音声を統合する次世代AIの可能性」をご参照ください。

以下に、従来の長文OCR処理と、Unlimited-OCRが導入した「R-SWA」によるメモリ最適化プロセスの違いを図解します。

従来の長文OCR処理長文入力(複数ページPDF)KVキャッシュが累積・肥大化メモリ不足(OOM)で処理停止Unlimited-OCR (R-SWA)長文入力(複数ページPDF)スライド窓でメモリを一定保持安定した高速・高精度処理
図1:従来の長文OCR処理におけるメモリ肥大化課題と、Unlimited-OCR(R-SWA)によるメモリ最適化プロセスの比較

Baiduが提供するこの新しいアプローチは、オープンソースAIを活用した文書DXの新たな選択肢となります。自社のセキュリティ要件、インフラコスト、および対象となる文書の特性を総合的に評価し、最適な技術選定を進めてください。

〈参考文献〉

監修

河合 継(クリスタルメソッド株式会社 代表取締役)

AI・ディープラーニングに関する特許16件の発明者。過去、国立がん研究センターとの共同研究や、テレビ番組でのAI解説実績を持つAI研究者として、AIの研究開発を主導している。
運営会社について編集方針

AIブログ購読

 
クリスタルメソッドがお届けする
AIブログの更新通知を受け取る

Study about AI

AIについて学ぶ

  • Claude Code オートモードが9月25日より既定化|課金撤廃と企業が備えるべきリスク

    Claude Code オートモードが9月25日より既定化|課金撤廃と企業が備えるべきリスク

    Anthropicは、自律型コーディング支援ツール「Claude Code」において、新規セッションの既定(デフォルト)設定を「オートモード(auto mode...

  • Gemini 3.8 Liveのビジネス活用ガイド:音声・思考AIが現場にもたらす変革

    Gemini 3.8 Liveのビジネス活用ガイド:音声・思考AIが現場にもたらす変革

    Googleは2026年9月15日、音声対話に特化した最新のAIモデル「Gemini 3.8 Live」および「Gemini 3.8 Live Extended...

  • Claudeで金融業務効率化を推進する:資産管理特化AIの国内導入メリットと課題

    Claudeで金融業務効率化を推進する:資産管理特化AIの国内導入メリットと課題

    金融業界において、生成AIを活用した業務効率化は避けては通れない経営課題となっています。特に、高度な専門知識と厳格なコンプライアンスが求められる資産管理(ウェル...

View more