音声・音楽の AI の比較(2026 年 10 月)
公開 8 分で読めます
文章の読み上げ、音声の文字起こし、音楽や効果音の生成に使う AI を比べます。比べる観点は、対応する言語、1 回で扱える長さ、出力の形式、API の料金です。どの値も 2026 年 10 月 9 日時点で各社の公式のページに載っている情報で、音質の順位は付けていません。
比べた AI
YOBITSUGI AI で使える音声・音楽の AI を対象にしました。
- OpenAI: 読み上げの gpt-4o-mini-tts と、文字起こしの gpt-4o-transcribe。
- Google: 読み上げの Gemini 3.8 Flash TTS、文字起こしの Gemini 3.5 Transcribe、音楽の Lyria 3.5。
- ElevenLabs: 読み上げの Eleven v3・Eleven Multilingual v2・Eleven Flash v2.5、音楽の Eleven Music、効果音、文字起こしの Scribe(現行は Scribe v2)。
比較表
読み上げ
| モデル | 言語の数 | 1 回の上限 | API の料金(2026 年 10 月時点) |
|---|---|---|---|
| gpt-4o-mini-tts | Whisper に準じる | 2,000 トークン | 文章の入力 $0.60・音声の出力 $12.00 / 100 万トークン |
| Gemini 3.8 Flash TTS | 130 以上 | 8,192 トークン | 文章の入力 $0.50・音声の出力 $9.00 / 100 万トークン |
| Eleven v3 | 70 以上 | 5,000 文字 | $0.08 / 1,000 文字 |
| Eleven Multilingual v2 | 29 | 10,000 文字 | $0.08 / 1,000 文字 |
| Eleven Flash v2.5 | 32 | 40,000 文字 | $0.04 / 1,000 文字 |
- 表の読み上げのモデルは、どれも対応する言語に日本語が含まれています。
- OpenAI は、読み上げの対応言語はおおむね Whisper(OpenAI の音声認識のモデル)に準じると説明しており、その一覧に日本語があります。声は alloy・marin・cedar などから選べ、品質を求めるときは marin か cedar を勧めています。出力は MP3・Opus・AAC・FLAC・WAV・PCM です。OpenAI は、読み上げの声が AI で作ったものであることを、聞く人に明確に伝えるよう求めています。
- Gemini 3.8 Flash TTS の料金は 2026 年 12 月 31 日までの値で、2027 年 1 月 1 日からは $1.00 / $18.00 です。言語は自動で判別します。1 回の依頼で複数の話し手を分けて読ませることができ、Google は声を作る機能(Voice design)と声を再現する機能(Voice replication)も挙げています。出力は WAV が既定です。
- ElevenLabs によると、Eleven Flash v2.5 の遅延(応答までの時間)は約 75 ミリ秒です(アプリとネットワークの遅れを除く)。Flash v2.5 の言語は、v2 のモデルの全言語にハンガリー語・ノルウェー語・ベトナム語を加えたものです。
文字起こし
| モデル | 言語の数 | 話している人の区別 | 1 回の上限 | API の料金(2026 年 10 月時点) |
|---|---|---|---|---|
| gpt-4o-transcribe | 公表なし | なし | 25 MB | $0.006 / 分(目安) |
| Gemini 3.5 Transcribe | 85 以上 | 8 人まで | 1 時間 | 入力 $0.003 / 分・出力 $0.002 / 分 |
| Scribe v2 | 90 以上 | 32 人まで | 3 GB・10 時間 | $0.22 / 時間 |
- Gemini 3.5 Transcribe と Scribe v2 は、対応する言語に日本語が含まれています。
- gpt-4o-transcribe の料金は、音声の入力 $2.50・文字の出力 $10.00(100 万トークンあたり)で、表の 1 分あたりの値は OpenAI の料金表にある目安です。OpenAI は、元の Whisper のモデルより言語の認識と精度を改善したモデルと説明しています。読めるファイルは mp3・mp4・mpeg・mpga・m4a・wav・webm です。話している人を区別するときは、別のモデル(gpt-4o-transcribe-diarize)を使うよう OpenAI は案内しています。
- Gemini 3.5 Transcribe の料金は、100 万トークンあたりでは入力 $2.00・出力 $12.00 です。話している人の区別や単語ごとの時刻を使うときは、1 回 30 分までです。言語は話の区切りごとに自動で判別し、専門用語などを登録して認識しやすくする機能もあります。
- Scribe v2 は、単語ごとの時刻や、笑い声などの音の出来事も書き起こせます。リアルタイムの Scribe v2 Realtime は $0.39 / 時間です。
音楽・効果音
| モデル | 長さ | 中身 | 出力 | API の料金(2026 年 10 月時点) |
|---|---|---|---|---|
| Eleven Music | 3 秒〜5 分 | 歌あり・伴奏だけ | MP3・WAV | $0.15 / 分 |
| Lyria 3.5 | 最大 3 分 | 歌あり・伴奏だけ | MP3・WAV | $0.08 / 曲 |
| ElevenLabs の効果音 | 0.1〜30 秒 | 効果音 | MP3・WAV | $0.12 / 分 |
- Eleven Music は、英語・スペイン語・ドイツ語・日本語などの歌詞に対応しています。ElevenLabs は、Eleven Music で作った曲は「ほぼすべての商用の用途で使える」としています。API は有料のプランで使えます。
- Lyria 3.5 の長さは、Google DeepMind のページでは最大 3 分、Gemini API のページでは「数分」と書かれています。指示した言語で歌詞を作ります。文章に加えて、画像を 10 枚まで入力できます。音質は 44.1 kHz のステレオです。特定の歌手の声や既存の歌詞を求める指示は受け付けません。作った音声には SynthID の透かしが入ります。
- ElevenLabs の効果音は、つなぎ目なく繰り返し再生できる(ループ)効果音も作れます。
目的ごとの選び方
各社の公式のページにある説明と機能をもとにまとめました。
- 日本語のナレーションを作りたい: 日本語に対応していると書かれているのは、表の読み上げのモデルすべてです。長い原稿を 1 回で読ませるときは、1 回の上限が 40,000 文字の Eleven Flash v2.5 や 10,000 文字の Eleven Multilingual v2 が対象になります。
- 掛け合いの音声を作りたい: Gemini 3.8 Flash TTS は、1 回の依頼で複数の話し手を分けて読ませることができます。
- すぐに返事をする音声(会話など): ElevenLabs は Eleven Flash v2.5 の遅延を約 75 ミリ秒としています。
- 会議の録音を文字にしたい: 話している人を区別できるのは、8 人までの Gemini 3.5 Transcribe と、32 人までの Scribe v2 です。長い録音は、Gemini 3.5 Transcribe が 1 回 1 時間まで、Scribe v2 が 1 ファイル 10 時間まで扱えます。
- 字幕を作りたい: 単語ごとの時刻を出せるのは、Gemini 3.5 Transcribe と Scribe v2 です。
- 歌のある曲を作りたい: Eleven Music と Lyria 3.5 は、歌詞のある曲も伴奏だけの曲も作れます。日本語の歌詞は、ElevenLabs が対応言語に挙げており、Lyria 3.5 は指示した言語で歌詞を作ります。
- 曲を商用に使いたい: ElevenLabs は、Eleven Music の曲をほぼすべての商用の用途で使えるとしています。Lyria 3.5 の商用利用の条件は、確認したページには書かれていません。
- 短い効果音を作りたい: ElevenLabs の効果音は 0.1〜30 秒で、ループにも対応しています。
YOBITSUGI AI で使えるか
YOBITSUGI AI では、この記事で比べた AI を使えます(2026 年 10 月時点)。OpenAI は読み上げ(gpt-4o-mini-tts)・文字起こし(gpt-4o-transcribe)、Google は読み上げ(Gemini 3.8 Flash TTS)・文字起こし(Gemini 3.5 Transcribe)・Lyria 3.5、ElevenLabs は Eleven v3・Eleven Multilingual v2・Eleven Flash v2.5・Eleven Music・効果音・Scribe です。なお、ElevenLabs のモデルの一覧には Eleven v4 もありますが、現時点の YOBITSUGI AI の対応モデルには含まれていません。YOBITSUGI AI での料金は料金ページに載っています。
出典
- Text to speech(OpenAI・2026-10-09 確認)
- GPT-4o Mini TTS(OpenAI・2026-10-09 確認)
- File transcription(OpenAI・2026-10-09 確認)
- GPT-4o Transcribe(OpenAI・2026-10-09 確認)
- Pricing(OpenAI・2026-10-09 確認)
- Gemini 3.8 Flash TTS(Google・2026-10-09 確認)
- Gemini 3.5 Transcribe(Google・2026-10-09 確認)
- Models | Gemini API(Google・2026-10-09 確認)
- Generate music with Lyria 3.5(Google・2026-10-09 確認)
- Lyria 3.5(Google・2026-10-09 確認)
- Lyria 3.5 — Google DeepMind(Google・2026-10-09 確認)
- Gemini Developer API pricing(Google・2026-10-09 確認)
- Models(ElevenLabs・2026-10-09 確認)
- ElevenAPI Pricing for creators and businesses of all sizes(ElevenLabs・2026-10-09 確認)
- Eleven Music(ElevenLabs・2026-10-09 確認)
- Sound effects(ElevenLabs・2026-10-09 確認)
- Transcription(ElevenLabs・2026-10-09 確認)
