blog

DeepSeek OCRとは?特徴・使い方・料金|文書をMarkdown化するオープンモデル

DeepSeek OCRとは?文書をMarkdown化するオープンOCRモデルの特徴・使い方・導入判断

DeepSeek OCRとは何か――設計思想と基本仕様

DeepSeek OCRは、DeepSeek AIが2025年10月21日に公開した視覚言語(Vision-Language)OCRモデルである。論文タイトルは「DeepSeek-OCR: Contexts Optical Compression」(arXiv:2510.18234)で、その名が示すとおり「Contexts Optical Compression(文脈的光学圧縮)」が中核技術となる。

従来の大規模言語モデル(LLM)が長い文書テキストを大量のトークンとして処理するのに対し、DeepSeek OCRは文書のテキスト情報を「視覚トークン」として圧縮し、少ないトークン数で文書コンテキスト全体を扱う設計をとる。テキストより画像は情報密度が高いという性質を活かした発想であり、長文書の処理効率と精度を両立させることを狙っている。

モデルの主な仕様は以下のとおりである。

  • パラメータ数:約30億(3B)、テンソル型BF16
  • ライセンス:MIT(オープンウェイト。自己ホスト・商用利用が可能)
  • 実行環境:Hugging Face Transformers(trust_remote_code=True)またはvLLM(2025年10月23日より公式対応)
  • 入力形式:画像+プロンプト(例:<image>\nConvert the document to markdown.
  • 出力形式:Markdown、プレーンテキスト等
  • 対応機能:表の抽出、レイアウト理解、数式認識

モデルウェイトはHugging Face(deepseek-ai/DeepSeek-OCR)およびGitHubで公開されており、モデル利用自体に料金は発生しない。推論コストは、ユーザーが用意するGPU環境またはクラウドインフラに依存する点は後述する。

なお、DeepSeek OCRは2026年現在の主力チャット・APIモデルであるDeepSeek-V4-Pro・V4-Flashとは別系統のOCR特化モデルである。チャットAPIとの混同を避けて評価することが重要だ。DeepSeekのAPIや料金体系についてはDeepSeek API活用ガイドで詳しく解説している。

文書画像入力PDF・スキャン等Contexts OpticalCompressionテキストを視覚トークンへ圧縮・コンテキスト保持VLM推論3Bパラメータ表・数式・レイアウト解釈Markdown構造化テキスト出力MITライセンス・オープンウェイト / 自己ホスト or GPUクラウドで実行olmOCR-bench 75.7 / Arxiv Math 77.2(公式model card記載値)
図:DeepSeek OCRの処理フロー。文書画像をContexts Optical Compressionで視覚トークンへ圧縮し、3BパラメータのVLMが表・数式・レイアウトを解釈してMarkdown等の構造化テキストへ変換する。

DeepSeek OCRの公式ベンチマークと限界を正確に読む

DeepSeek OCRの公式model card(HuggingFace)に記載されているベンチマーク結果は下表のとおりである。本稿では公式一次情報として確認された数値のみを掲載し、SERPに流通する未検証の数値は採用しない。

DeepSeek OCR 公式ベンチマーク(公式model card記載値、2026年7月時点)
ベンチマーク スコア 評価内容
olmOCR-bench 総合 75.7 一般的なOCR精度の総合評価
Arxiv Math 77.2 論文・数式の認識精度
Old Scans Math 73.6 古い文書スキャンの数式認識
MDPBench 総合 51.8 複雑なレイアウトを含む文書処理

公式model card上では、推論サイズ(Tiny〜Largeの各構成)と「Gundam」モードという複数の動作構成が存在する。ユースケースや利用可能なGPUリソースに応じてサイズを選択できる点は、エンタープライズ導入において一定の柔軟性をもたらす。

ただし、MDPBench総合スコアが51.8にとどまる点には留意が必要である。複雑な多段組レイアウトや特殊な書式を含む文書では精度が不十分な場面も想定される。特に日本語文書や複雑なレイアウトを含む場合は、必ず実文書でのPoC検証を行うことを強く勧める。

なお、DeepSeek OCRの日本語対応の詳細についてはDeepSeekの日本語対応解説も参照されたい。

解像度モード別スペックとアーキテクチャ――視覚トークン圧縮の設計思想

DeepSeek OCRは単一の設定で動くモデルではない。公式GitHubリポジトリ(deepseek-ai/DeepSeek-OCR)は、入力解像度と視覚トークン数の組み合わせを5段階の「解像度モード」として公開している。導入検討時にまず押さえるべきスペックを以下に整理する。

モード 入力解像度 視覚トークン数
Tiny 512×512 64
Small 640×640 100
Base 1024×1024 256
Large 1280×1280 400
Gundam n×640×640 + 1×1024×1024(動的) 動的(入力ページ構成に応じて可変)

モードを上げるほど視覚トークン数(=処理コスト)は増えるが、その分レイアウトが複雑な文書でも精度を確保しやすくなる。逆にTiny/Smallのような低トークンモードは高速・低コストだが、複雑な表組みや小さな文字を含む文書では精度が落ちやすい。自社の文書の複雑さに応じてモードを選ぶ設計であり、「DeepSeek OCR=1つの精度」ではない点は導入判断で見落とされやすい。

DeepEncoderとMoEデコーダという2コンポーネント構成

この解像度可変設計を支えるのが、論文(arXiv:2510.18234「DeepSeek-OCR: Contexts Optical Compression」)が明示するアーキテクチャである。DeepSeek OCRは「DeepEncoder」と、デコーダに「DeepSeek3B-MoE-A570M」(Mixture-of-Expertsデコーダ)を組み合わせた2コンポーネント構成を採る。論文はDeepEncoderについて、高解像度入力でも活性化(メモリ負荷)を低く抑えるよう設計されている、と説明している。

公式ベンチマーク(OmniDocBench)での比較として、論文はGOT-OCR2.0が1ページあたり256トークンを要するのに対し、DeepSeek OCRは100視覚トークンでこれを上回る精度を達成したと報告する。また、MinerU2.0が1ページ平均6000トークン以上を要するのに対し、DeepSeek OCRは800視覚トークン未満でこれを上回ったとしている。圧縮率と精度の関係についても、論文は「圧縮率10倍未満で約97%のOCR精度」「圧縮率20倍で約60%の精度」を維持すると報告しており、圧縮率を上げるほど精度は低下するトレードオフが存在する。モード選定はこのトレードオフの上に成り立っている。

AIアバター開発の現場から見た「視覚トークン圧縮」という設計思想

当社(クリスタルメソッド)はAI面接練習・AIロープレ用の対話アバター「DeepAI」を自社開発しており、音声・表情・視線といった非言語情報をリアルタイムに処理する際、常に計算コストとの兼ね合いに直面してきた。DeepSeek OCRが採用する「情報を少数のトークンに圧縮し、精度とのトレードオフを許容しながら処理コストを下げる」という設計思想は、非言語情報をリアルタイムに扱う際の情報圧縮の考え方と技術的に地続きである。ただし、当社はDeepSeek OCRそのものを自社システムに実装・検証したわけではなく、以上はあくまで技術構成を読み解いた考察であり、独自の実測データではない点を明記しておく。

DeepSeek OCRの実行方法と導入時の技術・コスト要件

DeepSeek OCRの実行には、Hugging Face TransformersまたはvLLMを用いる2つの経路がある。いずれも自前のGPUサーバー、またはGPUクラウドサービス上で動作する。モデル自体はMITライセンスで無償配布されているが、推論インフラの調達・運用コストは別途発生することを稟議段階から明示的に計上しなければならない。

Hugging Face Transformers経由の基本的な呼び出し:

from transformers import AutoProcessor, AutoModelForCausalLM

processor = AutoProcessor.from_pretrained(
    "deepseek-ai/DeepSeek-OCR",
    trust_remote_code=True
)
# 入力例
# messages = [{"role": "user", "content": "<image>\nConvert the document to markdown."}]

入力は画像とプロンプトの組み合わせで与え、文書をMarkdownへ変換するよう指示する。プロンプト設計の柔軟性が高く、「表形式で出力」「数式をLaTeX記法で出力」など用途に応じた指示が可能である点は、既存の文書処理パイプラインへの組み込みに際して実用的な強みとなる。

vLLM経由:vLLMは2025年10月23日よりDeepSeek OCRに公式対応しており、高スループット推論が求められるバッチ処理環境での利用に適している。

導入判断において稟議担当者が積算すべき主なコスト要因を以下に整理する。

  • GPUメモリ:3BモデルをBF16で動作させるには一定のVRAMが必要となる。実際の必要量は推論構成(Tiny〜Large)により異なるため、公式GitHubドキュメントで推奨スペックを確認した上でインフラ設計を行うこと。
  • インフラ運用コスト:自己ホストの場合、モデル管理・セキュリティパッチ・スケーリング対応が内部工数として継続的に発生する。この「見えないコスト」は商用マネージドサービスとのTCO比較において必ず計上すべき項目だ。
  • MITライセンスの範囲と変更リスク:現時点では商用利用・改変・再配布が可能であり、社内システムへの組み込みやサービス展開において法的制約は少ない。ただし将来的なライセンス変更リスクは排除できないため、法務部門との定期的な確認体制を設けることを推奨する。

DeepSeekのコアAPIおよびV4系モデルとの統合を検討する場合はDeepSeek API活用ガイドを、料金体系全般についてはDeepSeek料金・費用の詳細解説を参照されたい。セキュリティ・リスク面の評価についてはDeepSeekのリスクと注意点でも論点を整理している。

ローカルLLMの導入やRAG構築をご検討の方は、AI開発会社クリスタルメソッドの無料相談をご利用ください。

他のOCRアプローチとの比較――企業導入における選択基準

DeepSeek OCRを既存の商用OCR・LLMベースのOCRアプローチと並べて評価する際の主要軸を以下の比較表に整理した。各サービスの仕様は変動するため、最新情報は各公式ドキュメントで確認すること。

OCRアプローチの比較(2026年7月時点・概要)
比較軸 DeepSeek OCR 商用クラウドOCR
(主要クラウドベンダー等)
汎用VLMによるOCR
(最新世代のLLM等)
ライセンス・モデル費用 MITオープンウェイト(モデル無料) 従量課金(API利用料が継続発生) 従量課金(トークン単価)
データのプライバシー 自己ホスト可(社外送信なし) クラウド送信が前提 クラウド送信が前提
OCR特化設計 OCR専用モデル・圧縮手法 OCR専用エンジン 汎用VLM(OCR専用ではない)
表・数式対応 あり(公式対応) 製品により差異あり 対応可能だが精度は用途次第
Markdown出力 標準対応 別途後処理が必要な場合あり プロンプト次第で対応可
運用負荷 自己インフラ運用が必要 低(マネージドサービス) 低(API呼び出しのみ)
カスタマイズ性 高(ウェイト公開・改変可) 限定的 プロンプト範囲内

DeepSeek OCRが優位性を発揮しやすいのは、(1)機密性の高い文書を社内に閉じた環境で処理したい、(2)大量バッチ処理でAPIコストを抑えたい、(3)MarkdownやLaTeX形式での構造化出力が業務要件として明確に存在する、という3条件が揃う場合である。

一方、OCR専任のエンジニアを確保できない、またはGPUインフラを持たない組織では、商用マネージドサービスのほうが総所有コスト(TCO)で有利になりやすい。自己ホストの「見えないコスト」——インフラ保守・モデル更新管理・セキュリティ対応——は稟議段階で明示的に積算することを強く勧める。

DeepSeekの他モデルとの比較についてはDeepSeek比較記事も参照されたい。DeepSeek OCRが属するDeepSeekエコシステムの全体像はDeepSeek概要解説で把握できる。

導入判断チェックリスト――稟議前に確認すべき6項目

経営・情報システム・事業責任者が稟議・意思決定の場でDeepSeek OCRの採否を判断する際、以下の問いを事前に整理しておくと検討が整理しやすい。

  1. 業務要件の確認:処理対象文書の種類(PDF・スキャン・手書き等)と必要な出力形式(Markdown・テキスト・LaTeX)が一致しているか。
  2. 精度閾値の設定:公式ベンチマーク(olmOCR-bench 75.7 / MDPBench 51.8)が業務の許容誤差と合致しているか。PoCで実文書を使った検証を行ったか。特に日本語文書や複雑なレイアウトを含む場合は必須の工程だ。
  3. GPU環境の調達:必要なVRAMを持つGPUサーバーを自社調達またはクラウドで確保できるか。ランニングコストは試算済みか。
  4. データセキュリティ要件:文書をクラウドAPIに送信せず社内処理することが規制・社内規定上の要件か。あるいは商用クラウドOCRでも許容されるか。
  5. 運用体制:モデルの更新管理・障害対応・セキュリティパッチを担当できるエンジニアリソースが存在するか。
  6. ライセンスリスクの許容:MITライセンスの範囲を法務部門と確認し、将来的なライセンス変更リスクへの対応方針を定めているか。

これらのチェックを経た上でPoC評価に進むことが、導入後の手戻りを防ぐ最短経路となる。DeepSeekの無料利用範囲の全体像はDeepSeek無料利用ガイドでも確認できる。

なお、弊社クリスタルメソッドが開発するバーチャルヒューマン・AIアバターソリューション「DeepAI」は、接客・研修・面接練習などの用途で活用されている。DeepSeek OCRのような文書処理モデルとは異なるカテゴリだが、AIを業務に組み込む際のインフラ・ライセンス・運用体制の検討は共通する論点である。DeepAIの詳細はクリスタルメソッドのAIソリューション紹介で案内している。


よくある質問

Q. DeepSeek-OCRは無料で使えますか?
A. モデルはMITライセンスのオープンウェイトとして公開されており、モデル自体は無料です。ただし推論には自前のGPUまたはGPUクラウドが必要で、そのインフラ費用は別途発生します。

Q. どんな文書に使えますか?
A. PDFやスキャン画像などの文書を、表・数式・レイアウトを解釈してMarkdownやテキストへ変換できます。数式(Arxiv Math 77.2)に比較的強い一方、複雑なレイアウト(MDPBench 総合51.8)は実文書でのPoC検証を推奨します。

Q. 日本語の文書にも使えますか?
A. 使えますが、日本語や複雑なレイアウトの文書は精度が用途次第のため、導入前に実文書でのPoC検証を行うことを推奨します。

Q. チャット版のDeepSeekとは違いますか?
A. 別物です。DeepSeek-OCRはOCRに特化したモデルで、汎用チャット/APIのDeepSeek-V4-Pro・V4-Flashとは系統が異なります。

参考文献

監修

河合 継(クリスタルメソッド株式会社 代表取締役)

AI・ディープラーニングに関する特許16件の発明者。過去、国立がん研究センターとの共同研究や、テレビ番組でのAI解説実績を持つAI研究者として、AIの研究開発を主導している。
運営会社について編集方針


関連記事

LLM・ローカルLLMの業務導入をご検討の方へ

クリスタルメソッドは、オープンモデル・ローカルLLMの選定からRAG構築・PoC・本番導入までのAI開発を支援しています。「機密データを外部に出さずにLLMを使いたい」「自社の業務に合うモデルを選びたい」といったご相談を承っています。

AIブログ購読

 
クリスタルメソッドがお届けする
AIブログの更新通知を受け取る

Study about AI

AIについて学ぶ

  • Gemini 3.7 Flash料金比較と導入判断:2026年末までの半額期間を活かす企業戦略

    Gemini 3.7 Flash料金比較と導入判断:2026年末までの半額期間を活かす企業戦略

    Googleは2026年8月13日、前バージョンであるGemini 3.6 Flashのリリースからわずか3週間という異例の速さで、最新の軽量・高速モデル「Ge...

  • GPT-5.6の高速化が日本企業に与える影響と、経営層が取るべき導入判断基準

    GPT-5.6の高速化が日本企業に与える影響と、経営層が取るべき導入判断基準

    GPT-5.6 Solの「14倍高速化」が示す技術革新の全貌 OpenAIはAIチップメーカーのCerebrasと提携し、同社のフラグシップモデル「GPT-5....

  • IBM OpenAI 提携がもたらす企業向けAIの変革と日本企業が取るべき一手

    IBM OpenAI 提携がもたらす企業向けAIの変革と日本企業が取るべき一手

    IBMとOpenAIの戦略的提携と「GPT-5.6」統合の概要 米IBMとOpenAIは2026年8月13日、エンタープライズAIの展開を大規模に加速するための...

View more