お店の BGM やナレーションを作るなら
公開 6 分で読めます

店内で流す BGM や、店内アナウンス、商品紹介の動画のナレーションなどを、AI で作る方法をまとめました。この記事では、YOBITSUGI AI で使える音楽と読み上げの AI と、その頼み方を、実際に作った作例とあわせて紹介します(2026 年 10 月時点)。
このページでは音声を再生できないため、作例は、作った音声の形式・長さと、BGM の波形の図で示します。
向いている AI
YOBITSUGI AI では、音楽は Google の Lyria 3.5 と ElevenLabs の Eleven Music、読み上げは ElevenLabs(Eleven v3・Eleven Multilingual v2・Eleven Flash v2.5)と OpenAI の読み上げを使えます。各社の公式の説明は次のとおりです。
BGM(音楽)
| AI・モデル | 提供元 | 公式に書かれている主な特徴 |
|---|---|---|
| Lyria 3.5 | 文章から 44.1 kHz のステレオの音楽を作る・長さはプロンプトで調整できる(数分まで)・歌ありも歌なしも作れる・作った音声には聞こえない電子透かし(SynthID)が入る | |
| Eleven Music | ElevenLabs | 文章で指示して、さまざまなジャンルの曲を作る・歌ありも歌なしも作れる・日本語を含む複数の言語に対応・曲の一部分だけを直せる |
ナレーション(読み上げ)
| AI・モデル | 提供元 | 公式に書かれている主な特徴 |
|---|---|---|
| Eleven Multilingual v2 | ElevenLabs | 日本語を含む 29 言語・感情の細かな表現が求められる場面に向く・企業の動画や e ラーニング、オーディオブックの制作に向く |
| Eleven v3 | ElevenLabs | 70 以上の言語・感情の表現が豊かな読み上げ |
| Eleven Flash v2.5 | ElevenLabs | 32 言語・約 75 ミリ秒の短い遅延・すぐに応答が要るアプリやゲーム向け |
| OpenAI の読み上げ(gpt-4o-mini-tts) | OpenAI | なまり・感情の幅・抑揚・話す速さ・トーンなどを文章で指示できる・日本語に対応 |
店内アナウンスや動画のナレーションのように、決まった文を落ち着いて読み上げる用途では、日本語への対応が公式に書かれている Eleven Multilingual v2 か OpenAI の読み上げから試すと選びやすくなります。
頼み方の例
YOBITSUGI AI のアプリで、次のように日本語で頼みます。
店内で流す BGM
Lyria 3.5 で、小さなカフェの店内で流す BGM を 1 曲作ってください。
歌なし(インストゥルメンタル)、アコースティックギターとピアノ、テンポは BPM 80 前後、明るく落ち着いた雰囲気、長さは 1 分ほどでお願いします。
店内アナウンス
ElevenLabs の Eleven Multilingual v2 で、次の文を落ち着いた女性の声で読み上げてください。
「いらっしゃいませ。本日は、季節のフルーツタルトをご用意しております。お会計の際に、ポイントカードをお出しください。」
話し方を指示して読み上げる
OpenAI の読み上げで、同じ文を「やわらかく、ゆっくり、ていねいに」読み上げてください。
BGM とナレーションを 1 つの音声にまとめる
さっき作った BGM を小さめの音量で流しながら、ナレーションを重ねた 30 秒の音声を作ってください。
形式は MP3 でお願いします。
作例
この記事のために、YOBITSUGI AI で、架空のカフェの BGM と店内アナウンスを作りました。依頼の文は、上の「頼み方の例」の最初の 3 つとほぼ同じです。
| 作ったもの | AI・モデル | 形式・長さ |
|---|---|---|
| BGM(歌なし) | Lyria 3.5 | MP3・約 62 秒 |
| アナウンス | Eleven Multilingual v2 | MP3・約 8 秒 |
| アナウンス(指示つき) | gpt-4o-mini-tts | MP3・約 9 秒 |


「1 分ほど」と頼んだ BGM は約 62 秒で、最後は音が小さくなって終わる曲になりました。同じ文の読み上げでも、ElevenLabs は約 8 秒、「ゆっくり」と指示した OpenAI の読み上げは約 9 秒で、話す速さに違いが出ています。
うまくいかないとき
- 歌が入ってしまう: 「歌なし(インストゥルメンタル)」と最初に書きます。
- 長さが合わない: 「60 秒」のように秒数で書きます。Google は、Lyria 3.5 の曲の長さはプロンプトで調整できると説明しています。
- 雰囲気が違う: 楽器・テンポ(BPM)・調・雰囲気・曲の構成を具体的に書きます。Google のガイドでも、これらを書くとよいと案内しています。
- 読み方を間違える: 店名や商品名、数字には読み方をひらがなで添えます(例: 「本日(ほんじつ)」)。
- 声の感じが合わない: ElevenLabs では声を変えて、OpenAI の読み上げでは話し方の指示を変えて、作り直してもらいます。
- お店で使う前に: 使う AI の利用規約で、商用の利用の条件を確認してください。ElevenLabs は、Eleven Music で作った曲の商用の利用の範囲が、契約のプランによって違うと説明しています。また OpenAI は、読み上げの声が AI で作ったものであることを、聞く人に分かるように伝えることを利用ポリシーで求めています。
料金の目安
YOBITSUGI AI は月額の費用がなく、使った分だけクレジットが減る仕組みです。音楽は、生成が完了したときだけ料金がかかります。モデルごとの金額は 料金とシミュレーション で確認できます。
この作例では、BGM 1 曲(Lyria 3.5)が約 14 クレジット、読み上げ 2 本が合わせて約 1 クレジット、表紙の画像 1 枚(Nano Banana 2)が約 16 クレジットで、依頼のやり取りやワークスペースの稼働の分を合わせて約 44 クレジットでした(2026 年 10 月時点)。
出典
- Generate music with Lyria 3.5(Google・2026-10-09 確認)
- Models(ElevenLabs・2026-10-09 確認)
- Text to Speech(ElevenLabs・2026-10-09 確認)
- AI Music Generator | Free Song Maker & Music Creator(ElevenLabs・2026-10-09 確認)
- Text to speech(OpenAI・2026-10-09 確認)
- 料金とシミュレーション | YOBITSUGI AI(呼継AI)(株式会社Game・2026-10-09 確認)
