blog
AIブログ
Ollamaの料金体系——無料範囲とコスト構造を完全整理
文:クリスタルメソッド編集部 監修:河合 継(代表取締役)

関連記事Ollamaとは?自分のPCで無料AIを動かす方法をやさしく解説【2026年版】 / ollama models 完全ガイド|主要モデル一覧・選定基準・Modelfile実践 / ollama 日本語モデル おすすめ|用途・VRAM別に徹底解説【2026年版】
Ollamaの料金構造——「ソフトウェアは無料、コストは環境に宿る」
企業でOllamaの導入を検討するとき、まず把握すべきは「Ollama自体への支払いはゼロ」という事実だ。Ollama(https://ollama.com/)はMITライセンスのオープンソースソフトウェアであり、ソフトウェア本体・REST APIサーバー・モデルライブラリ経由のダウンロードのいずれにも費用は発生しない。商用利用にも制限はない。
ただし「Ollamaが無料」と「運用コストがゼロ」は同義ではない。Ollamaはランタイムであり、動かす環境——ローカルマシン、クラウド仮想マシン、あるいは公式のホスト型推論サービス——によって実質コストは大きく分岐する。2026年6月時点では、ローカルGPUを持たない組織向けにOllama Cloud(個人向けは$0〜$100/月。月額に利用クレジットが付く方式)も提供されている(公式料金ページ: https://ollama.com/pricing、2026年10月10日確認)。
本記事では、導入を検討する企業の意思決定者が稟議・予算策定・ベンダー比較に使える粒度で、Ollamaのコスト構造を整理する。有料クラウドAPIとの比較、ローカル運用・クラウドVM運用それぞれの費用感、そしてOllama Cloudの料金プランの詳細までを一貫して扱う。
なお、ローカルLLM活用の研究事例については、国立研究開発法人日本原子力研究開発機構(JAEA)がオンプレミス生成AI基盤の構築事例を公開しており(JAEA-Technology-2025-017)、機密データを外部に送らないローカルLLM構成の実用性が公的な場で確認されている。
費用が発生する箇所としない箇所——項目別一覧
稟議書や比較検討資料に直接転用できるよう、費用の発生有無を項目ごとに整理する。
| 項目 | 費用 | 補足 |
|---|---|---|
| Ollamaソフトウェア本体(0.30系、2026年6月時点) | 無料 | MIT License。個人・法人を問わず商用利用可。 |
| モデルのダウンロード(ollama.com/library) | 無料 | Ollamaはモデル配布プラットフォームであり、取得費は不要。 |
| ローカル推論(トークン数・API呼び出し回数) | 無料・無制限 | 従量課金なし。大量処理でも追加費用ゼロ。 |
| REST APIサーバー(ポート11434) | 無料 | ローカルおよびLAN内利用はすべて無償。 |
| Ollama Cloud(ホスト型推論サブスク) | $0〜$100/月 | 月額に利用クレジットが付き、使ったモデルの単価で消費する方式。詳細は次節。 |
| ローカルハードウェア(GPU・PC) | 実費が発生 | 既存機材があれば追加購入不要。新規調達は別途試算。 |
| 電気代 | 実費が発生 | GPU推論時は消費電力が増加。CPUのみなら軽微。 |
| クラウドVMでの運用(AWS・GCP・Azure等) | インスタンス代が発生 | Ollama本体は無料だが、GPUインスタンス費用がかかる。 |
| モデルの商用利用ライセンス | 多くは無料、一部条件あり | Qwen3・DeepSeek-R1はApache 2.0等で自由度が高い。Gemmaは利用規約への同意が必要。 |
上記を整理すると、Ollamaというソフトウェアそのものへの支払いは一切発生しない。予算計上が必要なのは「動かすための環境コスト」に限られ、その選択肢と金額感は以降の節で詳述する。
ローカルLLMの業務活用に関心のある方は、機械学習の基礎と導入判断も合わせて参照されたい。
Ollama Cloudの料金プラン——月額に利用クレジットが付く方式
ローカルGPUを持たない組織、あるいは大型モデルをすぐに評価したい場合に適した選択肢がOllama Cloudだ(公式: ollama.com/pricing、2026年10月10日確認)。かつて「Ollama Turbo」と呼ばれていたが、現在の正式名称はOllama Cloudであり、「Turbo」名で記載された二次情報には注意が必要だ。
| プラン | 月額 | 同時リクエスト数 | 主な特徴 |
|---|---|---|---|
| Free | $0 | 1 | お試し用の利用クレジット付き。入門向けのクラウドモデルを使える。利用クレジットを購入すると全モデルを使える |
| Pro | $20/月(約3,000円) 年払い$200 |
3 | 毎月$60分の利用クレジット。より大きいクラウドモデルを使え、複数のモデルを同時に動かせる |
| Max | $100/月(約15,000円) | 10 | 毎月$300分の利用クレジット。最新モデルの先行利用。複数のエージェントを同時に動かす人向け |
| Team | $500/月(約75,000円) 早期アクセス |
10 | 人数無制限。チームで共有する毎月$1,000分の利用クレジット、請求と管理の一元化、優先サポート |
| Enterprise | 個別見積もり | — | Teamの内容に加えて、使えるモデルの制限、利用者・APIキーごとの予算設定、専用のサポート窓口 |
Ollama Cloudは、月額のプランに利用クレジットが含まれ、使ったモデルの単価に応じてクレジットが減っていく方式である(公式pricing、2026年10月10日確認)。公式のFAQに書かれている仕組みは次のとおりだ。
- 毎月リセット・繰り越しなし:Pro・Max・Teamに含まれる利用クレジットは、契約を始めた日と同じ日に毎月リセットされる(年払いでも同じ)。使い残しは翌月に繰り越せない。
- 使い切ったあと:どのプランでも(Freeを含む)利用クレジットを追加で購入できる。まずプランに含まれる分が使われ、そのあと購入した残高から引かれる。
- 同時リクエスト数:Freeは1、Proは3、MaxとTeamは10。上限を超えたリクエストは順番待ちになり、待ち行列がいっぱいのときは拒否される。
- ローカル実行は別:自分のハードウェアでモデルを動かすぶんには、常に無制限で料金はかからない。
- データの扱い:プロンプトや応答のデータは、記録も学習への利用もされないと書かれている。
以前のプランは「固定の利用枠が5時間ごと・週ごとにリセットされる」方式で、Ollama公式Xアカウントの投稿(https://x.com/ollama/status/2032744932633620611)もその時点の説明である。公式のFAQによると、以前のPro・Maxの契約者が新しいプランに切り替えると利用量はリセットされ、以前の5時間ごと・週ごとの上限は適用されなくなる。Claude Codeなどのコーディングエージェントを長時間稼働させる場合は、使うモデルの単価と1日のトークン量から、月のクレジット消費を先に見積もっておきたい。
モデルごとの単価(100万トークンあたり・抜粋)
利用クレジットは、モデルごとに決まった単価で消費される。公式料金ページ(2026年10月10日確認)に載っている単価の一部を示す。全モデルの単価と最新の金額は公式料金ページで確認してほしい。
| モデル | 入力 | キャッシュ済み入力 | 出力 |
|---|---|---|---|
gpt-oss:20b |
$0.07 | $0.035 | $0.30 |
gpt-oss:120b |
$0.15 | $0.014 | $0.60 |
gemma4 |
$0.14 | $0.05 | $0.40 |
deepseek-v4.1-flash |
$0.30(オフピーク $0.15) | $0.006(同 $0.003) | $1.20(同 $0.60) |
deepseek-v4-pro |
$1.32(オフピーク $0.66) | $0.044(同 $0.022) | $3.96(同 $1.98) |
glm-5.3 |
$1.40 | $0.26 | $4.40 |
kimi-k3 |
$3.00 | $0.30 | $15.00 |
オフピーク料金は、平日のUTC 12:00〜18:00(日本時間 21:00〜翌3:00)以外の時間帯と週末に適用される。たとえばProに含まれる月$60分のクレジットは、gpt-oss:20b の出力だけで計算すると約2億トークン分、kimi-k3 の出力だけなら400万トークン分に当たる(60÷単価×100万で計算。実際は入力分も消費する)。
なお、Maxプランの価格は$100/月が現行の公式料金であり、一部の二次情報が「$200」と誤記しているが、公式pricing(2026年10月10日確認)に基づけば$100/月が正しい。Teamプランは早期アクセスとして月$500で提供されており、モデルの利用制限や利用者ごとの予算設定が必要な組織向けにはEnterpriseプラン(個別見積もり)がある。
ローカルLLMとRAGアーキテクチャを組み合わせた活用については、J-STAGEに掲載された図書館サービスへの応用研究(jstage.jst.go.jp)でも実用事例が報告されており、ローカル実行環境の有効性が学術的にも確認されつつある。
ローカル運用・クラウドVM運用の実質コスト試算
Ollama Cloudを使わず自前環境で動かす場合、コストはハードウェアと電気代、あるいはクラウドVMの使用料に帰着する。ここでは導入判断に必要な粒度で費用を試算する。
ローカル運用:必要スペックとハードウェア費用の目安
Ollama 0.30系はApple Silicon向けMLXエンジンにも対応しており(Ollama公式ブログ、2026年6月時点)、M2 Pro(16GB統合メモリ)以上のMacBookであれば7Bクラスを快適に動かせる。M2 Max(32GB以上)では30Bクラスも実用速度に達する。既存のゲーミングPCやワークステーションがあれば追加投資なしで評価を開始できる点は、コスト面での大きな利点だ。
| モデルサイズ | 最低RAM目安 | 推奨GPU VRAM | 新規調達費の目安 |
|---|---|---|---|
| 1B〜3B(軽量評価用) | 8GB | 4GB〜 | 既存PCで対応可(追加費用なし) |
| 7B〜8B(業務PoC向け) | 16GB | 6〜8GB | 3〜6万円前後(コンシューマGPU) |
| 13B〜14B(中規模実用) | 32GB | 12〜16GB | 8〜15万円前後 |
| 34B(高精度・重負荷) | 64GB〜 | 24GB以上 | 15〜30万円前後 |
| 70B〜(大規模業務向け) | 128GB〜 | 48GB以上または複数GPU構成 | 30万円〜(業務用途) |
電気代については、GPU推論中の消費電力を電力単価30円/kWhで試算すると、7Bクラス(80〜120W)を月24時間稼働させた場合でも月額1,700〜2,600円程度にとどまる。開発・検証用途のように必要なときだけ起動する運用であれば、実際の電気代はさらに低くなる。4bit量子化(GGUF形式)モデルを選ぶことでVRAM消費を抑え、より安価なハードウェアで同じモデルを動かせる点も、コスト管理の重要な手段となる。
クラウドVM運用:費用感と削減の要点
チームでAPIを共有したい、あるいはローカルに適切なマシンがない場合は、クラウドVMにOllamaをインストールする構成が選ばれる。Ollama本体は無料だが、GPUインスタンス費用が発生する。
| クラウド | インスタンス例 | VRAM | 料金目安($/時間) | 24時間稼働時の月額参考 |
|---|---|---|---|---|
| AWS | g4dn.xlarge | 16GB | 約$0.53〜 | 約$380〜 |
| Google Cloud | n1+T4(16GB) | 16GB | 約$0.35〜 | 約$250〜 |
| Azure | NC4as T4 v3 | 16GB | 約$0.56〜 | 約$400〜 |
| RunPod | RTX 4090 | 24GB | 約$0.34〜 | 約$245〜 |
24時間365日常時稼働させると月額数万円から十数万円になるが、使用時間を限定する「スポット運用」に切り替えれば月額を大幅に圧縮できる。コスト管理の核心は稼働時間の最小化であり、自動起動・停止スクリプトの導入と量子化モデルの選択が有効な手段となる。
深層学習の基礎理解についてはディープラーニングの仕組み、テキスト解析・NLPの背景についてはテキストマイニングの概論も参照されたい。
ローカルLLMの導入やRAG構築をご検討の方は、AI開発会社クリスタルメソッドの無料相談をご利用ください。
有料クラウドAPIとのコスト比較——処理量が増えるほど差が開く
OpenAI・Anthropic・Google等の有料APIはトークン単位の従量課金であり、処理量に比例してコストが増加する。Ollamaのローカル運用はトークン課金がゼロであるため、月間処理量が大きくなるほど優位性が拡大する。
| サービス | モデル例 | 入力(1Mトークン) | 出力(1Mトークン) |
|---|---|---|---|
| OpenAI API | GPT-4o | $2.50 | $10.00 |
| OpenAI API | GPT-4o mini | $0.15 | $0.60 |
| Anthropic API | Claude 3.5 Sonnet | $3.00 | $15.00 |
| Google AI API | Gemini 1.5 Pro | $1.25〜$2.50 | $5.00〜$10.00 |
| Ollama(ローカル実行) | Qwen3・DeepSeek等 | $0 | $0 |
少量処理(月間100万トークン未満)では有料APIとの費用差は小さいが、月間数千万トークンを超える大規模処理になると、ローカルまたはクラウドVM上のOllamaが経済的に有利になる傾向がある。一方で、有料APIにはモデルの最新性・冗長性・SLA・セットアップコストの低さといったメリットがある。機密データの社外送信を回避したい要件がある場合はOllamaのローカル運用が有効な選択肢となり、この点はJAEAのオンプレミス生成AI基盤構築事例(JAEA-Technology-2025-017)でも示されている。
また、都市・社会インフラ分野でのローカルLLM活用については、国土交通省PLATEAUを基盤にした対話型情報支援の研究(J-STAGE: jsceiii 7-1-189)においてもローカル推論環境が採用されており、データ主権を重視する場面でのオープンウェイトLLM活用の実績が蓄積されつつある。
マルチモーダルLLMの活用可能性についてはマルチモーダルAIの概要、強化学習との組み合わせ応用については強化学習の基礎も参考になる。
Ollamaライブラリで利用できる主要モデルの商用ライセンス整理
Ollamaのコスト評価において見落としがちなのが、モデルごとの商用利用ライセンスだ。Ollamaはモデルを開発した会社ではなく、各社が公開したオープンウェイトモデルをollama.com/libraryで配布するプラットフォームである。「Ollama公式モデル」という概念は存在せず、配布されている各モデルのライセンスは提供元に依拠する。
| モデル系列 | 提供元 | 代表的なサイズ(2026年6月時点) | 商用利用 | 備考 |
|---|---|---|---|---|
| Qwen3 / Qwen3.5 / Qwen3.6 | Alibaba | 0.6B〜235B | Apache 2.0(制限なし) | 最多pulls級(30.4M+)。日本語・thinking・agentic対応。Qwen3.5はマルチモーダル。Qwen3.6はコーディング特化 |
| DeepSeek-R1 / DeepSeek-V4-Flash | DeepSeek | 1.5B〜671B(V4-Flash: MoE 284B総/13B活性) | MIT相当(制限なし) | 推論特化。R1は87.1M pulls。V4-Flashは1Mコンテキスト対応のプレビュー |
| gpt-oss | OpenAI | 20B / 120B系 | 要個別確認 | OpenAIのオープンウェイトモデル。Ollamaと提携配布。調整可能な推論強度でo3-mini級とされる |
| Gemma 4 | 12B・26B・31B | Gemma利用規約(条件付き) | vision・tools・thinking対応の最新世代。規約への同意が必要 | |
| Kimi-K2.6 / GLM-5.1 | Moonshot AI / Zhipu AI | — | 要個別確認 | GitHub READMEにも掲載される最新モデル。長文コンテキスト・多言語対応 |
商用プロダクトへの組み込みでライセンスの手間を最小化したい場合、Qwen3系とDeepSeek-R1がApache 2.0相当で自由度が高く、扱いやすい選択肢となる。Gemmaはライセンス条件の確認が必要であり、gpt-oss・Kimi-K2.6・GLM-5.1については個別の規約精査を推奨する。
モデル選定の詳細についてはOllamaモデル一覧とおすすめの選び方も参照されたい。また、BERTをはじめとする言語モデルの技術的背景についてはBERTとNLPの基礎も理解の助けになる。
コスト最小化の判断フレームワーク——3形態の使い分け
Ollamaの運用形態は「ローカル実行」「クラウドVM上での実行」「Ollama Cloud利用」の3択に集約される。それぞれの費用構造と適合する組織・用途の特性を整理する。
| 運用形態 | 月額コスト感 | 向いている場面 | 留意点 |
|---|---|---|---|
| ローカル実行 | 電気代数百〜数千円(既存HW使用時) | 機密データを扱う・大量処理・長期継続利用 | 大型モデルにはハードウェア投資が必要 |
| クラウドVM(スポット運用) | 数百〜数万円(稼働時間次第) | チーム共有API・一時的な大型モデル評価 | 常時稼働では月額数万円超になりやすい |
| Ollama Cloud Free | $0 | 個人評価・小型モデルの試用・モデル選定 | 同時1リクエスト・お試し用のクレジットの範囲 |
| Ollama Cloud Pro | $20/月(約3,000円) | ローカルGPUなし・中規模処理・開発者個人 | 同時3リクエスト・毎月$60分のクレジット(超える分は追加購入) |
| Ollama Cloud Max | $100/月(約15,000円) | 常時稼働エージェント・重負荷ワークフロー | 同時10リクエスト・毎月$300分のクレジット |
意思決定の基準として、まず「月間処理量」と「データの機密性」を軸に整理するとよい。機密データを扱い処理量が多い場合はローカル実行が最も経済的であり、GPU投資の回収期間は有料APIとの比較で試算できる。ローカルGPUの準備が難しくすぐに評価を始めたい場合はOllama Cloud Freeから入り、業務利用に移行するタイミングでProへアップグレードするという段階的なアプローチが合理的だ。
GANや生成モデルの技術的な理解を深めたい場合はGANの概要、スパースモデリングとの比較軸についてはスパースモデリングの基礎も参考になる。
なお、クリスタルメソッドが開発するバーチャルヒューマン・AIアバターソリューション「DeepAI」は、リップシンク・表情生成・音声合成・対話AIを組み合わせた接客・研修・面接練習・広報向けのソリューションであり、ローカルLLM基盤の活用と親和性の高い領域での展開を視野に入れている。詳細は弊社ブログを参照されたい。
AIの業務活用・導入をご検討の方へ
クリスタルメソッドは、各種LLM・ローカルAI・RAG・AIアバターを活用した業務へのAI導入を支援しています。「自社の業務でどう使えるか」をまずはお気軽にご相談ください。
参考文献
- Ollama 公式サイト: https://ollama.com/(2026年6月8日確認)
- Ollama 公式料金ページ: https://ollama.com/pricing(2026年6月8日確認)
- Ollama 公式ライブラリ: https://ollama.com/library(2026年6月8日確認)
- Ollama 公式ブログ: https://ollama.com/blog(2026年6月8日確認)
- Ollama GitHub(README): https://github.com/ollama/ollama(2026年6月8日確認)
- ollama on X(以前の料金方式についての投稿): https://x.com/ollama/status/2032744932633620611(2026年6月8日確認)
- 国立研究開発法人日本原子力研究開発機構(JAEA)「スーパーコンピュータを用いたオンプレミス生成AI基盤の構築と展開」: https://jopss.jaea.go.jp/pdfdata/JAEA-Technology-2025-017.pdf
- J-STAGE「PLATEAUとローカルLLMを基盤とした対話型情報支援」: https://www.jstage.jst.go.jp/article/jsceiii/7/1/7_189/_article/-char/ja
- J-STAGE「Difyで作成した図書館サービスへの質問に回答するRAG型AIチャットボット」: https://www.jstage.jst.go.jp/article/jpla/70/3/70_90/_article/-char/ja
よくある質問
Q. Ollamaのソフトウェアや API 利用に料金はかかりますか?
A. Ollama本体・REST APIサーバー・ollama.com/libraryからのモデルダウンロードはいずれも無料(MITライセンス)で、商用利用にも制限はない。ローカル推論はトークン数やAPI呼び出し回数にかかわらず無料・無制限だ。
Q. Ollama Cloudの料金プランにはどんな種類がありますか?
A. Free($0、同時1リクエスト)、Pro(月$20・年払い$200、毎月$60分の利用クレジット、同時3リクエスト)、Max(月$100、毎月$300分、同時10リクエスト)、Team(月$500、毎月$1,000分を共有)、Enterprise(個別見積もり)がある。月額に含まれる利用クレジットを、使ったモデルの単価に応じて消費する方式で、使い切ったあとは別に購入したクレジットから引かれる。
Q. Ollamaを使う上で実際にコストが発生するのはどの部分ですか?
A. ソフトウェア自体は無料だが、動かす環境(ローカルハードウェアと電気代、クラウドVMのインスタンス代、Ollama Cloudの月額料金)には実費がかかる。
Q. Ollamaライブラリのモデルは商用利用できますか?
A. Qwen3系やDeepSeek-R1はApache 2.0・MIT相当で商用利用の制限がない一方、Gemmaは利用規約への同意が必要。モデルごとに提供元のライセンスが異なるため個別確認が必要だ。
Q. 有料のクラウドAPI(OpenAI等)と比べてOllamaはどのくらいコストを抑えられますか?
A. OpenAIのGPT-4oは1Mトークンあたり入力$2.50・出力$10.00などトークン従量課金なのに対し、Ollamaのローカル実行はトークン課金がゼロ。月間処理量が大きくなるほど有利になる傾向がある一方、月間100万トークン未満の少量処理では費用差は小さい。
Q. クラウドVMでOllamaを動かす場合の費用感はどのくらいですか?
A. 例えばAWSのg4dn.xlarge(16GB VRAM)は1時間あたり約$0.53〜で、24時間稼働させると月額約$380〜になる試算が示されている。使用時間を限定するスポット運用に切り替えることで月額を圧縮できる。
Q. ローカル実行・クラウドVM・Ollama Cloudはどう使い分ければよいですか?
A. 機密データを扱い処理量が多い場合はローカル実行が最も経済的、チーム共有や一時的な大型モデル評価にはクラウドVMのスポット運用、ローカルGPUの準備が難しくすぐ評価したい場合はOllama Cloud Freeから始める、という段階的なアプローチが示されている。
監修
河合 継(クリスタルメソッド株式会社 代表取締役)
AI・ディープラーニングに関する特許16件の発明者。過去、国立がん研究センターとの共同研究や、テレビ番組でのAI解説実績を持つAI研究者として、AIの研究開発を主導している。
運営会社について | 編集方針
Read next
あわせて読みたい
-
Ollamaとは?自分のPCで無料AIを動かす方法をやさしく解説【2026年版】
「Ollamaって何ができるの?」「自分のPCでAIを動かせるって本当?難しくない?」——そんな方に向けて、このページではOllamaの正体・できること・始め方...
-
ollama models 完全ガイド|主要モデル一覧・選定基準・Modelfile実践
ollama models の全体像――ライブラリの構造と位置づけ Ollama自体はモデルの開発元ではない。外部のオープンウェイトモデルをollama.com...
-
ollama 日本語モデル おすすめ|用途・VRAM別に徹底解説【2026年版】
Ollamaは、ChatGPTのような大規模言語モデル(LLM)を自分のPCやサーバー上で無料で動かせるオープンソースツールである。クラウドAIと異なりデータを...
