blog

text to speechとは?仕組み・読み上げの流れ・活用シーンを初心者向けに解説

Text to Speech(TTS)とは、入力したテキストをコンピューターが音声に変換して読み上げる技術です。日本語では「音声合成」「テキスト読み上げ」とも呼ばれ、ナレーション作成、読み上げアプリ、音声案内などに使われています。

Text to Speech の仕組み|正規化からボコーダまでのパイプライン解説

関連記事text to speech 料金ガイド|課金モデル・価格相場・コスト最適化の選び方 / 日本語音声合成 比較|自然な声で選ぶ実務観点の選定指針 / VOICEVOX 使い方|インストールから音声生成まで【2026】

Text to Speech(TTS)とは:文字を声に変える技術

Text to Speech(テキスト・トゥ・スピーチ、略してTTS)は、文字で書かれた文章を、コンピューターが人の声のような音声に変えて読み上げる技術です。スマートフォンの読み上げ機能、カーナビの音声案内、動画のナレーション、電話の自動応答など、身近なところで広く使われています。逆に、声を文字に変える技術は「Speech to Text(音声認識)」と呼ばれます。

文字が声になるまでの流れ(かんたん版)

  1. 文章を読める形に整える:「3,500円」を「さんぜんごひゃくえん」に直すなど、数字や記号を読み方に変える
  2. 読み方と抑揚を決める:漢字の読み、アクセント、間の取り方、声の高さや速さを決める
  3. 音声の波形を作る:決めた読み方と抑揚から、実際に耳で聞ける音を作る

現在の主流は、この流れをディープラーニング(深層学習)で行う方式で、以前の機械的な声に比べて大幅に自然になりました。各段階のくわしい仕組みは、後半の「Text to Speechの仕組み」で解説します。

主な活用シーン

場面 使われ方
動画・教材のナレーション 原稿から読み上げ音声を作り、収録の手間を省く
読み上げ・アクセシビリティ Webページや電子書籍、画面の内容を読み上げ、目で読むのが難しい人や「ながら聞き」を助ける
電話の自動応答・音声案内 問い合わせ窓口の自動音声、駅や施設の案内放送
音声アシスタント・チャットボット AIが作った回答文を、その場で声にして返す
カーナビ・機器の音声ガイド 地名や道順など、その都度変わる内容を読み上げる
語学学習・多言語対応 同じ文章を複数の言語や話者の声で読み上げる

Text to Speechの進化と、これから

  • 1930年代:電気式の音声合成装置が登場する(1939年にベル研究所が公開した「Voder」が知られている)。操作は複雑で、できることは限られていた
  • 1950年代後半〜:コンピューターによる音声合成の研究が進む。録音した音声の断片をつなぎ合わせる方式が実用化されたが、声は機械的だった
  • 2000年代:統計的な手法(HMM=隠れマルコフモデル)で、少ないデータからなめらかな音声を作れるようになる
  • 2016年〜:ディープラーニングで音声の波形を直接作る「WaveNet」(2016年)、文字から音声の特徴を一気に作る「Tacotron」(2017年)が発表され、自然さが大きく向上する
  • 2019年〜:「FastSpeech」(2019年)、「HiFi-GAN」(2020年)、「VITS」(2021年)などにより、高い音質のまま高速に生成できるようになり、リアルタイムの読み上げが広がる

これからの方向としては、感情や話し方の細かな表現、短い録音から特定の人の声を再現する技術、多言語への対応が進んでいます。一方で、他人の声をまねた偽の音声(ディープフェイク音声)への対策も課題になっており、利用規約や本人の同意の確認がこれまで以上に大切になっています。

無料で使える主なText to Speech(読み上げ)ツール

「すぐに文章を読み上げさせたい」という場合は、仕組みを知る前にツールを試すのが早道です。代表的な選択肢を、公式サイトの記載をもとに整理しました(2026年10月10日確認)。

ツール 種類 無料で使える範囲(公式記載) 向いている人
VOICEVOX パソコン用の無料ソフト(Windows/Mac/Linux) 商用・非商用を問わず無料。ただしキャラクターごとの利用規約を確認する必要あり(公式) 日本語の動画ナレーションや読み上げを手元で作りたい人
ElevenLabs Webサービス Freeプラン($0)で月1万クレジット。商用利用は有料のStarterプラン以上(公式料金) 自然な声を手軽に試したい人
Amazon Polly 開発者向けクラウドAPI 新規利用者向けの無料利用枠あり(条件は公式料金ページで確認) アプリやシステムに読み上げを組み込みたい開発者

まず無料で試し、声の自然さ・日本語の読み間違いの少なさ・商用利用の可否の3点を確認してから、有料プランやAPIを検討すると失敗が少なくなります。なお、ここから先はText to Speechが文字を音声に変える仕組みを、段階ごとに解説します。

Text to Speechの仕組み:5つの段階で文字が声になる(くわしく知りたい人向け)

Text to Speech(TTS)を単なる「テキストを音声に変換するAPI」として扱うと、品質劣化の原因が特定できず、改善の打ち手を見失う。まず押さえたいのは、TTSが独立した5つの処理ステージを直列に繋いだパイプラインであるという構造だ。各ステージが前段の出力を受け取り、加工して次段へ渡す。どのステージで誤差が生じたかによって、出力音声の崩れ方がまったく異なる。

以下の図は、テキスト入力から波形出力までの処理の流れを示している。

テキスト正規化①フロントエンドG2P(書記素→音素)②フロントエンド韻律推定③フロントエンド音響モデル④バックエンドボコーダ(波形生成)⑤バックエンド
図1: TTSパイプラインの5段階処理フロー(①〜③がフロントエンド言語処理、④〜⑤がバックエンド音響生成)

NICTの研究報告「ニューラル音声合成技術」(NICT技術報告 2022)でも、フロントエンド(言語処理)とバックエンド(音響生成)の分離構造は現代TTSシステムの基本設計として位置づけられている。各ステージの役割と品質への影響を順に解説する前に、一点だけ設計原則を示しておく。ステージを細かく分離するほどデバッグしやすくなるが、ステージ間の誤差伝播リスクが増す。End-to-end型アーキテクチャはこの問題をステージ統合で回避しようとするが、それはまた別の制御困難を生む。以下では古典的なパイプライン構造に則り、各段の仕組みと実装上の注意点を掘り下げる。

ステージ1〜2の仕組み:テキスト正規化とG2P(書記素→音素変換)

パイプラインの最前段はテキスト正規化(Text Normalization)だ。入力テキストには、後段の音響モデルがそのままでは処理できない表記が混入する。数字、略語、記号、URLなどがその代表例である。「3,500円」を「さんぜんごひゃくえん」と読むか「さんてんごひゃくえん」と読むかは文脈に依存し、「Dr.」を「ドクター」と読むか「どらいぶ」と読むかも同様だ。

正規化モジュールの実装方式は主に2つある。規則ベース(正規表現+辞書)とニューラルモデルベースだ。規則ベースは高速で制御しやすいが、カバレッジに限界がある。ニューラルモデルベースは汎化性能が高い一方、誤りが予測しにくい傾向がある。日本語では助数詞(「3個」「3回」「3冊」)の読み分けが特に難しく、正規化品質が最終音声の自然さに直結する。なお、正規化の誤りはパイプライン全体を通じて訂正されることはなく、必ずそのまま音声に出力される。これがこのステージをデバッグ対象の筆頭に置く理由だ。

正規化を経たテキストは次にG2P(Grapheme-to-Phoneme)変換へ渡される。書記素(文字)を音素系列へマッピングするステージであり、日本語では仮名から音素への変換、英語ではスペルから発音記号への変換がこれに相当する。J-STAGEに収録された音声合成研究「音声合成のための言語処理と韻律制御」(J-STAGE, 人工知能学会誌)では、G2P変換の精度が発音品質の基盤であることが示されている。

英語G2Pの難しさは、同じスペルでも文脈によって読みが変わる同綴異音語(heteronym)にある。”lead” は名詞か動詞かで発音が異なる。日本語では同音異義語(「橋」と「箸」)のアクセント付与がG2P相当の課題として機能する。現代的な実装では、形態素解析器(MeCab、Sudachiなど)をG2Pの前処理として挟み、品詞情報を活用して曖昧性を解消するアプローチが一般的だ。G2Pモジュール単体の出力(音素列)を独立してロギングし、異常な音素列が後段に流れていないことを定常的に確認することが、運用安定性の要となる。

英語TTS固有の実装課題については英語テキスト読み上げツールの比較・解説も参照されたい。

ステージ3〜4の仕組み:韻律推定と音響モデルが「自然さ」を決める

韻律推定(Prosody Estimation)は、TTSパイプラインの中で人間が最も敏感に感知するステージだ。韻律とは、ピッチ(基本周波数F0)、デュレーション(音素・音節の長さ)、エネルギーの時系列パターンを指す。これが不自然であると、たとえ個々の音素が正確に発音されていても、聴衆は「ロボット的」と判断する。

NICTの多言語音声合成研究(NICT技術報告 vol.58)においても、韻律モデリングは多言語TTS品質の主要な変動因子として扱われている。韻律は言語ごとに構造が大きく異なり、日本語の高低アクセント、英語の強勢アクセント、中国語の声調がそれぞれ異なる韻律表現を要求する。このことは、多言語TTSを構築する際に韻律推定モジュールを言語ごとに設計する必要があることを意味する。

韻律推定には、言語情報(品詞列、文境界、強調語)をF0軌跡とデュレーション系列にマッピングする回帰モデルが使われる。古典的にはHMM(隠れマルコフモデル)ベースのアプローチが主流だったが、現在はTransformerベースのシーケンス変換モデルが精度・柔軟性の両面で支持されている。実装上の注意点として、韻律推定モデルは学習データのスピーカースタイルに強く依存するため、ナレーション調のデータで学習したモデルを会話体テキストに適用すると、句読点の無視や文末の不自然なイントネーションとして現れやすい。

韻律推定の出力を受け取る音響モデルは、音素列と韻律パラメータからスペクトル特徴量(メルスペクトログラムなど)を生成する。ここはTTSバックエンドの中核であり、アーキテクチャ選択が音声品質・推論速度・話者適応性のトレードオフを決定づける。各アーキテクチャの詳細な比較については無料AI音声合成の解説に譲るが、実装時に押さえておくべき落とし穴を一点だけ示す。

アテンション崩壊だ。Tacotron系のエンコーダ・デコーダ構造では、長文入力においてアテンション機構が途中でフォーカスを失い、音素のスキップや繰り返しが発生することがある。FastSpeech2はこの問題をduration predictorによる明示的なアライメント制御で解決しているが、duration予測器の学習データ品質に依存する別のトレードオフを生じさせる。この種のトレードオフは、アーキテクチャを選定する前に「どのような入力テキスト分布が来るか」を想定して評価する必要がある。

音声合成の業務導入や自社サービスへの組み込みをご検討の方は、日本語特化AI音声合成「SakuraSpeech」を開発するクリスタルメソッドの無料相談をご利用ください。

ステージ5の仕組み:ボコーダが最終音質を左右する理由

パイプラインの最終段であるボコーダ(Vocoder)は、音響モデルが出力したスペクトル特徴量(通常はメルスペクトログラム)から実際の音声波形を合成する。このステージは往々にして「最後の仕上げ」と軽視されるが、ボコーダの品質が最終出力のリアリティを大きく左右する。

古典的なボコーダはGriffin-Lim法のような位相推定アルゴリズムを使用していたが、出力がこもった印象になりやすかった。現代ではニューラルボコーダが主流であり、HiFi-GANに代表する生成的敵対ネットワーク(GAN)ベースの方式は、波形レベルの高周波成分まで再現する能力を持ち、かつ推論速度がリアルタイム以上になるよう最適化されている。IBM「Text to Speechとは」(IBM Think Topics)でも、ニューラルネットワークを活用した音声合成が自然さの向上に大きく寄与しているとされている。

方式ごとの違いを以下の表に整理する。

代表的なボコーダ方式の比較(設計選定用)
方式 音質 推論速度 学習コスト 主な用途
Griffin-Lim 低〜中 高速 不要(アルゴリズム) プロトタイプ・試験実装
WaveNet系 高 低速(自己回帰) 高 高品質オフライン生成
WaveGlow / Glow系 高 中速(並列フロー) 高 品質重視のオンライン生成
HiFi-GAN 高 高速(GAN) 中 リアルタイムTTS・エッジ推論
VITS(統合型) 高 高速 高 エンドツーエンド構成

ボコーダとアップストリームの音響モデルは共同学習(joint training)するか、個別に学習するかという設計判断がある。個別学習は汎用性が高いが、音響モデルとボコーダの分布ミスマッチが音声にノイズや歪みとして現れることがある。共同学習はこれを軽減するが、パイプライン全体の学習安定性を管理する難易度が上がる。個別学習構成でミスマッチを抑える実践的なアプローチとして、音響モデルの推論出力分布でボコーダをファインチューニングする「fine-tuning on synthesized mel」が知られている。学習時と推論時のスペクトログラムの分布差を縮小するこの手法は、追加データ収録なしで実施できる点で費用対効果が高い。

作る側の視点:誤りを後ろの段階へ広げない3つの原則

TTSを作る・運用する側にとって最大の課題は、上流の誤差が下流で増幅されることだ。テキスト正規化で「2,500人」を「にせんごひゃくにん」と誤変換すれば、その誤りはG2P、韻律推定、音響モデルを通じてそのまま音声に出力される。パイプラインのどのステージも、誤りを「修正」するのではなく「引き継ぐ」構造であることを設計の前提として置く必要がある。

NICTの多言語音声合成研究(NICT技術報告 vol.58)は、言語依存フロントエンドと言語非依存バックエンドを分離するアーキテクチャの有効性を示している。この分離原則を含め、実装者が取るべき対策を3点に集約する。

  1. ステージ間インターフェースの可視化:各ステージの入出力を検査可能にするロギング層を挟む。正規化後テキスト、G2P後の音素列、韻律パラメータをそれぞれ独立して確認できる設計にすることで、品質劣化の原因ステージを素早く特定できる。本番運用では、特定の入力パターン(長文・数式混在・URLなど)に対してステージ出力をサンプリングし、定期的に人手確認する仕組みを持つことが望ましい。
  2. 言語依存モジュールの明確な分離:日本語TTSと英語TTSでは正規化ルールもG2Pモデルも異なる。言語依存処理を言語非依存の音響バックエンドから切り離すことで、多言語対応時の保守性が大幅に向上する。フロントエンドの差し替えだけで新言語に対応できる構造を最初から意識した設計が、後工程での手戻りを防ぐ。
  3. ボコーダのミスマッチ対策:前述の「fine-tuning on synthesized mel」に加え、音響モデルのデコーダ出力にPostNetを挟んでスペクトログラムを補正するアプローチも有効だ。ボコーダの入力分布を安定させることが、最終音声のノイズ低減に直結する。

クリスタルメソッドが開発するバーチャルヒューマンソリューション「DeepAI」では、音声合成パイプラインとリップシンク・表情生成を組み合わせた構成を採用している。音声合成パイプラインの出力タイミングが口唇動作の生成と同期される必要があるため、ボコーダのレイテンシが実用上の制約として直接効いてくる。リアルタイム対話AIにTTSを組み込む場合、ボコーダ方式の選定はレイテンシ予算の観点で音質と同等に重要な設計判断となる。この点はデジタルヒューマン用途に限らず、音声アシスタントや会話AIに組み込む場面でも共通して問題になる。

TTSの応用先やサービス選定を検討している場合は、テキスト読み上げアプリの選び方やかわいい声のTTS解説も参照されたい。フリーの音声合成AI実装については無料AI音声合成の解説が詳しい。またTTSと組み合わせて使われることの多いテキストマイニングの実装についてはPythonによるテキストマイニングを、ディープフェイク技術との関係を理解したい場合はディープフェイクの仕組み解説を参照されたい。


Text to Speech(TTS)を「導入するか・どう選ぶか」の判断ガイド

仕組みを理解したうえで、実務では「そもそもTTSが向く用途か」「どの方式・サービスを選ぶか」を切り分ける必要があります。ここでは検討時に効く判断軸だけを整理します。

TTSが向く場面/向かない場面

向く場面

  • 読み上げ対象が大量・更新頻度が高い(ニュース、記事、通知など)——ナレーターの都度収録が現実的でない。
  • 動的に生成される文章を即時に音声化したい(IVR・音声アシスタント・チャット応答)——事前録音では網羅できない。
  • アクセシビリティや多言語展開でスケールが要る——同じ原稿を複数言語・複数話者で量産したい。

向かない(人手収録を検討すべき)場面

  • ブランドの顔になる短尺・高露出のコピー(TVCM等)——尺が短く、感情表現の作り込みが売上に直結する。
  • 固有名詞・専門用語・数式が密で誤読が許されない——G2Pや正規化の誤りが致命傷になる領域。
  • 歌唱・演技・間の演出など非言語表現が主役——現行TTSの得意領域から外れる。

用途別・優先すべき評価軸の早見表

用途 最優先で確認する軸 妥協しやすい軸
コンテンツ/動画ナレーション 自然さ・韻律、話者バリエーション リアルタイム性(バッチ生成で足りる)
IVR・音声応答・アシスタント 低レイテンシ、SSML等の制御 話者数(少数で足りることが多い)
アクセシビリティ読み上げ 対応言語・記号/数字の読み精度 声の個性(明瞭さが優先)
ブランド固有ボイス カスタム音声(作成可否)と商用ライセンス 初期構築の手軽さ
社内・機密文書の音声化 データの取り扱い/オンプレ・自己ホスト可否 最新の音質トレンド

提供形態の1行使い分け

  • クラウドAPI型:多言語・多話者を最短で導入したい/自前のGPU運用を避けたいとき。従量課金と外部送信の可否を確認する。
  • アプリ・SaaS型:非エンジニアが画面上で原稿を音声化したいとき。ワークフローの手軽さが利点、細かな制御やバッチ連携は弱い。
  • オープンソース/自己ホスト型:データを外に出せない、あるいは声質を作り込みたいとき。運用・チューニングの人的コストを負担できることが前提。

失敗しないための選定チェック軸

  1. 自然さは必ず「自社の実原稿」を入れて試聴で判断する(デモ文は各社が最適化済みで参考にならない)。
  2. 読み精度は固有名詞・数字・記号を含む実データで確認する(本文で解説した正規化・G2Pの弱点が最も出る箇所)。
  3. 制御性としてSSMLや読み辞書・ポーズ指定に対応するかを見る。
  4. 商用利用と権利:生成音声の商用可否、話者の権利、生成物の帰属を規約で確認する。
  5. 運用条件:レイテンシ、同時実行、料金体系、データの送信先(オンプレ要否)を要件と突き合わせる。

これらは順位付けの軸であり、絶対的な優劣ではありません。用途で最優先軸を1つ決め、そこから逆算して形態と方式を選ぶのが実務的です。


よくある質問

Text to Speech(TTS)とは何ですか?

文字(テキスト)を読み取って、人の声のような音声に変換する技術のことです。テキストの正規化・読みの推定・抑揚(韻律)の推定・音声の生成といった段階を経て音声を作ります。

無料で使えるText to Speechはありますか?

あります。パソコン用ソフトのVOICEVOXは商用・非商用を問わず無料で使えます(キャラクターごとの利用規約の確認が必要)。WebサービスのElevenLabsにもFreeプラン($0・月1万クレジット)があります(2026年10月10日に公式サイトで確認)。

無料のText to Speechで作った音声は商用利用できますか?

ツールによって異なります。VOICEVOXは商用利用も無料ですが、キャラクターごとの規約に従う必要があります。ElevenLabsはFreeプランでは商用利用ができず、有料のStarterプラン以上が必要です(各公式サイトの記載)。

Text to SpeechとSpeech to Textの違いは何ですか?

Text to Speech(TTS)は文字を音声に変える技術、Speech to Text(STT・音声認識)は音声を文字に変える技術です。音声アシスタントは、聞き取りにSpeech to Text、返事の読み上げにText to Speechを組み合わせています。

スマートフォンだけでText to Speechは使えますか?

使えます。iPhoneやAndroidには、画面の文章を読み上げる機能が標準で入っています(iPhoneは設定の「アクセシビリティ」にある読み上げコンテンツ、Androidは「選択して読み上げ」など)。より自然な声や音声ファイルの保存が必要な場合は、専用のアプリやWebサービスを使います。

参考文献

監修

河合 継(クリスタルメソッド株式会社 代表取締役)

AI・ディープラーニングに関する特許16件の発明者。過去、国立がん研究センターとの共同研究や、テレビ番組でのAI解説実績を持つAI研究者として、AIの研究開発を主導している。
運営会社について | 編集方針

AIの業務活用をご検討の方へ

クリスタルメソッドは、バーチャルヒューマンをはじめAIの開発・業務導入を支援しています。生成AI・AIエージェントの活用や、自社業務へのAI導入をご検討の際は、お気軽にご相談ください。



AIブログ購読

 
クリスタルメソッドがお届けする
AIブログの更新通知を受け取る

Read next

あわせて読みたい

  • 音声・音楽AIのイメージ

    text to speech 料金ガイド|課金モデル・価格相場・コスト最適化の選び方

    本ページは「text to speechの料金」に特化し、文字数課金・定額制・API課金などの課金モデルと価格相場、用途別のコスト試算を整理します。各サービスの...

  • 音声・音楽AIのイメージ

    日本語音声合成 比較|自然な声で選ぶ実務観点の選定指針

    日本語音声合成の比較で本当に見るべき4つの軸 音声合成サービスを選ぶ際、公式サイトに並ぶ「自然な音声」「高品質」といった表現は、実運用の判断基準にならない。日本...

  • 音声・音楽AIのイメージ

    VOICEVOX 使い方|インストールから音声生成まで【2026】

    VOICEVOXは無料?商用利用・クレジット表記の結論 VOICEVOXは、商用・非商用を問わず無料で使える音声合成ソフトです。ただし「VOICEVOXを利用し...

View more