Gemini(Google)とは: できることと使い方
公開 9 分で読めます
基本の情報
- 提供元
- 種類
- 画像生成・動画生成・音楽生成・文章(言語モデル)・読み上げ・文字起こし
- YOBITSUGI AI で使えるモデル
- Nano Banana Pro・Nano Banana 2・Veo 3.1・Lyria 3.5・Gemini 3.1 Pro・Gemini 3.8 Flash・読み上げ(Gemini 3.8 Flash TTS)・文字起こし(Gemini 3.5 Transcribe)
- YOBITSUGI AI での主な用途
- 画像・動画・音楽・文章
- 料金
- YOBITSUGI AI では使った分だけ(yobitsugi.ai/pricing)
- 公式のドキュメント
- ai.google.dev/gemini-api/docs/models
Gemini は、Google が開発している AI モデルの系列です。Google は開発者向けの Gemini API で、文章のモデルのほか、画像生成の Nano Banana、動画生成の Veo、音楽生成の Lyria、読み上げと文字起こしのモデルも提供しています。YOBITSUGI AI では、これらを画像・動画・音楽・文章・音声の作業に使えます。
できること
YOBITSUGI AI で使えるモデルを、Google のモデル一覧(2026 年 10 月時点)の説明とあわせてまとめました。
| モデル | 分野と Google の説明 |
|---|---|
| Nano Banana Pro | 画像。複雑な画像の作業に向けた上位のモデル |
| Nano Banana 2 | 画像。速さと効率を重視したモデル |
| Veo 3.1 | 動画。音声つきの動画を作るモデル(Standard・Fast・Lite) |
| Lyria 3.5 | 音楽。1 曲まるごとの歌を作るモデル |
| Gemini 3.1 Pro | 文章。複雑な問題の解決やエージェントの作業に向けた Pro のモデル(プレビュー版) |
| Gemini 3.8 Flash | 文章。Flash の系列で最も性能の高いモデル |
| Gemini 3.8 Flash TTS | 読み上げ。表現力のある読み上げのモデル |
| Gemini 3.5 Transcribe | 文字起こし。言語の自動判定や話者の区別ができるモデル |
画像(Nano Banana Pro・Nano Banana 2)
- 文章から画像を作る生成と、文章の指示で画像を直す編集ができます。
- 1K・2K・4K の解像度で作れます。
- インフォグラフィック・メニュー・図・広告の素材などに、読める文字を入れて描けます(Google のドキュメントより)。
- 作った画像には、AI が作ったことを示す電子透かし SynthID が入ります。
- Google のドキュメントでは、Nano Banana 2 は前の世代のモデルとされ、新しく使う場合は Nano Banana 2.1 を勧めています。Nano Banana 2.1 は、現時点の YOBITSUGI AI の対応モデルには含まれていません。
動画(Veo 3.1)
- 文章から動画を、画像から動画を作れます。セリフ・効果音・環境音などの音声も、動画と一緒に作ります。
- 長さは 4・6・8 秒です(1080p と 4k は 8 秒だけ)。フレームレートは 24fps、向きは横長(16:9)と縦長(9:16)です。
- 参考の画像を 3 枚まで渡す、最初と最後のフレームを指定する、作った動画を延長する、といった指定ができます。
- Veo 3.1 には Standard のほかに Fast と Lite があります。Standard と Fast は 720p・1080p・4k に対応し、動画をもとにした生成(延長など)もできます。Lite は 720p と 1080p までで、文章と画像からの生成に対応します。
- 作った動画には SynthID の透かしが入ります。
音楽(Lyria 3.5)
- ヴァース・コーラス・ブリッジのある、1 曲まるごとの歌を作れます。長さは数分で、プロンプトで調整できます。歌なしの曲(インストゥルメンタル)も作れます。
- 文章のほか、画像をもとに曲を作ることもできます。音声は 44.1 kHz のステレオで、形式は MP3(Lyria 3.5 は WAV も選べます)です。
- 作った音声には、耳では聞き分けられない SynthID の透かしが入ります。
- 特定のアーティストの声や、著作権のある歌詞を求めるプロンプトは止められます。作った曲をプロンプトで何度も直す編集には、Lyria 3.5 は対応していません。
文章(Gemini 3.1 Pro・Gemini 3.8 Flash)
- どちらも文章・画像・動画・音声・PDF を読んで文章で答えます。一度に読める量は 1,048,576 トークン、1 回の出力は最大 65,536 トークンです。
- Google 検索の結果にもとづく回答(グラウンディング)、コードの実行、関数の呼び出し、決まった形式での出力(構造化出力)に対応しています。
読み上げ・文字起こし
- Gemini 3.8 Flash TTS: 文章を音声にします。日本語を含む 130 の言語に対応しています。1 回に入力できる文章は 8,192 トークンまでで、音声は標準で WAV の形式で返ります。
- Gemini 3.5 Transcribe: 音声を文字にします。85 以上の言語を自動で判定し(日本語を含む)、話者の区別、単語ごとのタイムスタンプ、専門用語の登録(カスタム語彙)に対応しています。1 回に送れる音声は 1 時間まで(話者の区別や単語ごとのタイムスタンプを使うときは 30 分まで)です。
得意なこと・向いている使い方
- Nano Banana Pro: Google は、最も複雑な画像の作業に向けた上位の選択肢とし、ブランドの見た目をそろえることや、細かな表現の調整を挙げています。
- Nano Banana 2: 速さと効率を重視していて、すばやいやり取りや、たくさんの画像を作る用途に向いています(Google の料金のページの説明より)。
- Veo 3.1: 横長・縦長の短い動画(最大 8 秒)を、音声つきで作るのに向いています。
- Lyria 3.5: 1 曲まるごとの歌や、歌なしの曲を作るのに向いています。
- Gemini 3.1 Pro: Google は、ソフトウェア開発や、ツールを正確に使って複数の手順を進めるエージェントの作業に合わせて調整したモデルと説明しています。
- Gemini 3.8 Flash: Google は、長い工程のソフトウェア開発、自律的に動くエージェント、複雑な業務の流れに向けたモデルと説明しています。
- Gemini 3.8 Flash TTS: Google は、声の再現性、表現力のある演技、地域のアクセント、長い会話での安定性を特長に挙げています。
- Gemini 3.5 Transcribe: 話者の区別やタイムスタンプがあるため、複数の人が話す録音の文字起こしに使えます。
言語について、Google のドキュメントでは次のように書かれています。
- Nano Banana: 性能を出しやすい言語の一覧に、日本語(ja-JP)が含まれています。
- Veo 3.1: 英語は完全に対応していますが、ほかの言語は評価されていないため、使えても結果にばらつきが出ることがあります。
- Lyria 3.5: 歌詞はプロンプトの言語で作られ、歌い方や発音もその言語に合わせます。
YOBITSUGI AI での使い方
YOBITSUGI AI では、Google の Nano Banana Pro・Nano Banana 2・Veo 3.1(Standard・Fast・Lite)・Lyria 3.5・Gemini 3.1 Pro・Gemini 3.8 Flash・Gemini 3.8 Flash TTS・Gemini 3.5 Transcribe を使えます。日本語で頼むと、メインの Claude エージェントが作業を分け、画像・音楽・動画は得意な AI に同時に頼みます。使う AI を指定して頼むこともできます。選べるモデルは、アプリのモデルの選択欄で確認できます。
Google の Gemini アプリの機能は、YOBITSUGI AI からは使えません。YOBITSUGI AI は API を通して Google のモデルを使います。
頼み方の例:
Nano Banana Pro で、新商品のポスターの画像を縦長で作って。「季節のブレンド」の文字も入れて
Veo 3.1 で、朝のカフェの店内を映す 8 秒の横長の動画を作って
Lyria 3.5 で、お店で流す落ち着いたピアノの BGM を 1 曲作って。歌はなしで
Gemini 3.5 Transcribe で、この打ち合わせの録音を話者ごとに文字起こしして
料金
YOBITSUGI AI には月額の費用はなく、使った分だけクレジットが消費されます。料金は提供元の定価をもとに計算されます。計算のしかたと単価は、YOBITSUGI AI の料金ページで確認できます。
Gemini API の有料枠(Paid Tier)の料金は次のとおりです(2026 年 10 月時点・米ドル)。
| モデル | 料金 |
|---|---|
| Nano Banana Pro | 画像の出力 $120.00 / 100 万トークン(1K・2K の画像 1 枚 $0.134、4K は $0.24 に相当) |
| Nano Banana 2 | 画像の出力 $60.00 / 100 万トークン(1K の画像 1 枚 $0.067、2K は $0.101、4K は $0.151 に相当) |
| Veo 3.1 | 音声つきの動画 1 秒あたり、Standard は $0.40(720p・1080p)・$0.60(4k)、Fast は $0.10(720p)・$0.12(1080p)・$0.30(4k)、Lite は $0.05(720p)・$0.08(1080p) |
| Lyria 3.5 | 1 曲あたり $0.08 |
| Gemini 3.1 Pro | 100 万トークンあたり入力 $2.00・出力 $12.00(プロンプトが 20 万トークン以下) |
| Gemini 3.8 Flash | 100 万トークンあたり入力 $0.75・出力 $3.75 |
| Gemini 3.8 Flash TTS | 100 万トークンあたり文章の入力 $0.50・音声の出力 $9.00(10 秒の音声 $0.00225 に相当) |
| Gemini 3.5 Transcribe | 100 万トークンあたり音声の入力 $2.00・文章の出力 $12.00(1 分あたり入力 $0.003・出力 $0.002 に相当) |
- Gemini 3.1 Pro は、プロンプトが 20 万トークンを超えると入力 $4.00・出力 $18.00 です。
- Gemini 3.8 Flash と Gemini 3.8 Flash TTS の料金は 2026 年 12 月 31 日までのものです。2027 年 1 月 1 日からは、Gemini 3.8 Flash が入力 $1.50・出力 $7.50、Gemini 3.8 Flash TTS が入力 $1.00・出力 $18.00 になります。
出典
- Models | Gemini API | Google AI for Developers(Google・2026-10-09 確認)
- Gemini Developer API pricing(Google・2026-10-09 確認)
- Nano Banana image generation(Google・2026-10-09 確認)
- Generate videos with Veo 3.1 in Gemini API(Google・2026-10-09 確認)
- Generate music with Lyria 3.5(Google・2026-10-09 確認)
- Gemini 3.1 Pro preview | Gemini API | Google AI for Developers(Google・2026-10-09 確認)
- Gemini 3.8 Flash | Gemini API | Google AI for Developers(Google・2026-10-09 確認)
- Gemini 3.8 Flash TTS | Gemini API | Google AI for Developers(Google・2026-10-09 確認)
- Gemini 3.5 Transcribe | Gemini API | Google AI for Developers(Google・2026-10-09 確認)
- YOBITSUGI AI(呼継AI) | このAI一つで、全てのコンテンツを手に(株式会社Game・2026-10-09 確認)
- 料金とシミュレーション | YOBITSUGI AI(呼継AI)(株式会社Game・2026-10-09 確認)
