本文へ移動
YOBITSUGI AIメディア
〇〇をするならAI により執筆

お店の BGM やナレーションを作るなら

公開 6 分で読めます

共有XFacebookLINEはてブ
朝の光が入るカフェのカウンターに置いた、木の小さなスピーカーと白いマグカップ(Nano Banana 2 で作成)

店内で流す BGM や、店内アナウンス、商品紹介の動画のナレーションなどを、AI で作る方法をまとめました。この記事では、YOBITSUGI AI で使える音楽と読み上げの AI と、その頼み方を、実際に作った作例とあわせて紹介します(2026 年 10 月時点)。

このページでは音声を再生できないため、作例は、作った音声の形式・長さと、BGM の波形の図で示します。

向いている AI

YOBITSUGI AI では、音楽は Google の Lyria 3.5 と ElevenLabs の Eleven Music、読み上げは ElevenLabs(Eleven v3・Eleven Multilingual v2・Eleven Flash v2.5)と OpenAI の読み上げを使えます。各社の公式の説明は次のとおりです。

BGM(音楽)

AI・モデル 提供元 公式に書かれている主な特徴
Lyria 3.5 Google 文章から 44.1 kHz のステレオの音楽を作る・長さはプロンプトで調整できる(数分まで)・歌ありも歌なしも作れる・作った音声には聞こえない電子透かし(SynthID)が入る
Eleven Music ElevenLabs 文章で指示して、さまざまなジャンルの曲を作る・歌ありも歌なしも作れる・日本語を含む複数の言語に対応・曲の一部分だけを直せる

ナレーション(読み上げ)

AI・モデル 提供元 公式に書かれている主な特徴
Eleven Multilingual v2 ElevenLabs 日本語を含む 29 言語・感情の細かな表現が求められる場面に向く・企業の動画や e ラーニング、オーディオブックの制作に向く
Eleven v3 ElevenLabs 70 以上の言語・感情の表現が豊かな読み上げ
Eleven Flash v2.5 ElevenLabs 32 言語・約 75 ミリ秒の短い遅延・すぐに応答が要るアプリやゲーム向け
OpenAI の読み上げ(gpt-4o-mini-tts) OpenAI なまり・感情の幅・抑揚・話す速さ・トーンなどを文章で指示できる・日本語に対応

店内アナウンスや動画のナレーションのように、決まった文を落ち着いて読み上げる用途では、日本語への対応が公式に書かれている Eleven Multilingual v2 か OpenAI の読み上げから試すと選びやすくなります。

頼み方の例

YOBITSUGI AI のアプリで、次のように日本語で頼みます。

店内で流す BGM

Lyria 3.5 で、小さなカフェの店内で流す BGM を 1 曲作ってください。
歌なし(インストゥルメンタル)、アコースティックギターとピアノ、テンポは BPM 80 前後、明るく落ち着いた雰囲気、長さは 1 分ほどでお願いします。

店内アナウンス

ElevenLabs の Eleven Multilingual v2 で、次の文を落ち着いた女性の声で読み上げてください。
「いらっしゃいませ。本日は、季節のフルーツタルトをご用意しております。お会計の際に、ポイントカードをお出しください。」

話し方を指示して読み上げる

OpenAI の読み上げで、同じ文を「やわらかく、ゆっくり、ていねいに」読み上げてください。

BGM とナレーションを 1 つの音声にまとめる

さっき作った BGM を小さめの音量で流しながら、ナレーションを重ねた 30 秒の音声を作ってください。
形式は MP3 でお願いします。

作例

この記事のために、YOBITSUGI AI で、架空のカフェの BGM と店内アナウンスを作りました。依頼の文は、上の「頼み方の例」の最初の 3 つとほぼ同じです。

作ったもの AI・モデル 形式・長さ
BGM(歌なし) Lyria 3.5 MP3・約 62 秒
アナウンス Eleven Multilingual v2 MP3・約 8 秒
アナウンス(指示つき) gpt-4o-mini-tts MP3・約 9 秒
BGM の音声の波形。最後は音が小さくなって終わる
Lyria 3.5 で作ったカフェの BGM(約 62 秒)の波形。図は、できた音声のファイルから描いたもの
朝の光が入るカフェのカウンターに置いた、木の小さなスピーカーと白いマグカップ
記事の表紙用に、Nano Banana 2 で作った画像

「1 分ほど」と頼んだ BGM は約 62 秒で、最後は音が小さくなって終わる曲になりました。同じ文の読み上げでも、ElevenLabs は約 8 秒、「ゆっくり」と指示した OpenAI の読み上げは約 9 秒で、話す速さに違いが出ています。

うまくいかないとき

  • 歌が入ってしまう: 「歌なし(インストゥルメンタル)」と最初に書きます。
  • 長さが合わない: 「60 秒」のように秒数で書きます。Google は、Lyria 3.5 の曲の長さはプロンプトで調整できると説明しています。
  • 雰囲気が違う: 楽器・テンポ(BPM)・調・雰囲気・曲の構成を具体的に書きます。Google のガイドでも、これらを書くとよいと案内しています。
  • 読み方を間違える: 店名や商品名、数字には読み方をひらがなで添えます(例: 「本日(ほんじつ)」)。
  • 声の感じが合わない: ElevenLabs では声を変えて、OpenAI の読み上げでは話し方の指示を変えて、作り直してもらいます。
  • お店で使う前に: 使う AI の利用規約で、商用の利用の条件を確認してください。ElevenLabs は、Eleven Music で作った曲の商用の利用の範囲が、契約のプランによって違うと説明しています。また OpenAI は、読み上げの声が AI で作ったものであることを、聞く人に分かるように伝えることを利用ポリシーで求めています。

料金の目安

YOBITSUGI AI は月額の費用がなく、使った分だけクレジットが減る仕組みです。音楽は、生成が完了したときだけ料金がかかります。モデルごとの金額は 料金とシミュレーション で確認できます。

この作例では、BGM 1 曲(Lyria 3.5)が約 14 クレジット、読み上げ 2 本が合わせて約 1 クレジット、表紙の画像 1 枚(Nano Banana 2)が約 16 クレジットで、依頼のやり取りやワークスペースの稼働の分を合わせて約 44 クレジットでした(2026 年 10 月時点)。

出典

共有XFacebookLINEはてブ

YOBITSUGI AI を使ってみる

日本語で頼むと、Claude エージェントが得意な AI と組んで実際に作り、ファイルで届けます。料金は使った分だけです。

YOBITSUGI AI

日本語で頼むだけで、
画像・動画・資料まで。

中心の Claude エージェントが、得意な AI と組んで実際に作り、ファイルで届けます。料金は使った分だけで、月額費用はかかりません。