本文へ移動
YOBITSUGI AIメディア
AI の紹介AI により執筆

Gemini(Google)とは: できることと使い方

公開 9 分で読めます

共有XFacebookLINEはてブ

基本の情報

提供元
Google
種類
画像生成・動画生成・音楽生成・文章(言語モデル)・読み上げ・文字起こし
YOBITSUGI AI で使えるモデル
Nano Banana Pro・Nano Banana 2・Veo 3.1・Lyria 3.5・Gemini 3.1 Pro・Gemini 3.8 Flash・読み上げ(Gemini 3.8 Flash TTS)・文字起こし(Gemini 3.5 Transcribe)
YOBITSUGI AI での主な用途
画像・動画・音楽・文章
料金
YOBITSUGI AI では使った分だけ(yobitsugi.ai/pricing)
公式のドキュメント
ai.google.dev/gemini-api/docs/models

Gemini は、Google が開発している AI モデルの系列です。Google は開発者向けの Gemini API で、文章のモデルのほか、画像生成の Nano Banana、動画生成の Veo、音楽生成の Lyria、読み上げと文字起こしのモデルも提供しています。YOBITSUGI AI では、これらを画像・動画・音楽・文章・音声の作業に使えます。

できること

YOBITSUGI AI で使えるモデルを、Google のモデル一覧(2026 年 10 月時点)の説明とあわせてまとめました。

モデル 分野と Google の説明
Nano Banana Pro 画像。複雑な画像の作業に向けた上位のモデル
Nano Banana 2 画像。速さと効率を重視したモデル
Veo 3.1 動画。音声つきの動画を作るモデル(Standard・Fast・Lite)
Lyria 3.5 音楽。1 曲まるごとの歌を作るモデル
Gemini 3.1 Pro 文章。複雑な問題の解決やエージェントの作業に向けた Pro のモデル(プレビュー版)
Gemini 3.8 Flash 文章。Flash の系列で最も性能の高いモデル
Gemini 3.8 Flash TTS 読み上げ。表現力のある読み上げのモデル
Gemini 3.5 Transcribe 文字起こし。言語の自動判定や話者の区別ができるモデル

画像(Nano Banana Pro・Nano Banana 2)

  • 文章から画像を作る生成と、文章の指示で画像を直す編集ができます。
  • 1K・2K・4K の解像度で作れます。
  • インフォグラフィック・メニュー・図・広告の素材などに、読める文字を入れて描けます(Google のドキュメントより)。
  • 作った画像には、AI が作ったことを示す電子透かし SynthID が入ります。
  • Google のドキュメントでは、Nano Banana 2 は前の世代のモデルとされ、新しく使う場合は Nano Banana 2.1 を勧めています。Nano Banana 2.1 は、現時点の YOBITSUGI AI の対応モデルには含まれていません。

動画(Veo 3.1)

  • 文章から動画を、画像から動画を作れます。セリフ・効果音・環境音などの音声も、動画と一緒に作ります。
  • 長さは 4・6・8 秒です(1080p と 4k は 8 秒だけ)。フレームレートは 24fps、向きは横長(16:9)と縦長(9:16)です。
  • 参考の画像を 3 枚まで渡す、最初と最後のフレームを指定する、作った動画を延長する、といった指定ができます。
  • Veo 3.1 には Standard のほかに Fast と Lite があります。Standard と Fast は 720p・1080p・4k に対応し、動画をもとにした生成(延長など)もできます。Lite は 720p と 1080p までで、文章と画像からの生成に対応します。
  • 作った動画には SynthID の透かしが入ります。

音楽(Lyria 3.5)

  • ヴァース・コーラス・ブリッジのある、1 曲まるごとの歌を作れます。長さは数分で、プロンプトで調整できます。歌なしの曲(インストゥルメンタル)も作れます。
  • 文章のほか、画像をもとに曲を作ることもできます。音声は 44.1 kHz のステレオで、形式は MP3(Lyria 3.5 は WAV も選べます)です。
  • 作った音声には、耳では聞き分けられない SynthID の透かしが入ります。
  • 特定のアーティストの声や、著作権のある歌詞を求めるプロンプトは止められます。作った曲をプロンプトで何度も直す編集には、Lyria 3.5 は対応していません。

文章(Gemini 3.1 Pro・Gemini 3.8 Flash)

  • どちらも文章・画像・動画・音声・PDF を読んで文章で答えます。一度に読める量は 1,048,576 トークン、1 回の出力は最大 65,536 トークンです。
  • Google 検索の結果にもとづく回答(グラウンディング)、コードの実行、関数の呼び出し、決まった形式での出力(構造化出力)に対応しています。

読み上げ・文字起こし

  • Gemini 3.8 Flash TTS: 文章を音声にします。日本語を含む 130 の言語に対応しています。1 回に入力できる文章は 8,192 トークンまでで、音声は標準で WAV の形式で返ります。
  • Gemini 3.5 Transcribe: 音声を文字にします。85 以上の言語を自動で判定し(日本語を含む)、話者の区別、単語ごとのタイムスタンプ、専門用語の登録(カスタム語彙)に対応しています。1 回に送れる音声は 1 時間まで(話者の区別や単語ごとのタイムスタンプを使うときは 30 分まで)です。

得意なこと・向いている使い方

  • Nano Banana Pro: Google は、最も複雑な画像の作業に向けた上位の選択肢とし、ブランドの見た目をそろえることや、細かな表現の調整を挙げています。
  • Nano Banana 2: 速さと効率を重視していて、すばやいやり取りや、たくさんの画像を作る用途に向いています(Google の料金のページの説明より)。
  • Veo 3.1: 横長・縦長の短い動画(最大 8 秒)を、音声つきで作るのに向いています。
  • Lyria 3.5: 1 曲まるごとの歌や、歌なしの曲を作るのに向いています。
  • Gemini 3.1 Pro: Google は、ソフトウェア開発や、ツールを正確に使って複数の手順を進めるエージェントの作業に合わせて調整したモデルと説明しています。
  • Gemini 3.8 Flash: Google は、長い工程のソフトウェア開発、自律的に動くエージェント、複雑な業務の流れに向けたモデルと説明しています。
  • Gemini 3.8 Flash TTS: Google は、声の再現性、表現力のある演技、地域のアクセント、長い会話での安定性を特長に挙げています。
  • Gemini 3.5 Transcribe: 話者の区別やタイムスタンプがあるため、複数の人が話す録音の文字起こしに使えます。

言語について、Google のドキュメントでは次のように書かれています。

  • Nano Banana: 性能を出しやすい言語の一覧に、日本語(ja-JP)が含まれています。
  • Veo 3.1: 英語は完全に対応していますが、ほかの言語は評価されていないため、使えても結果にばらつきが出ることがあります。
  • Lyria 3.5: 歌詞はプロンプトの言語で作られ、歌い方や発音もその言語に合わせます。

YOBITSUGI AI での使い方

YOBITSUGI AI では、Google の Nano Banana Pro・Nano Banana 2・Veo 3.1(Standard・Fast・Lite)・Lyria 3.5・Gemini 3.1 Pro・Gemini 3.8 Flash・Gemini 3.8 Flash TTS・Gemini 3.5 Transcribe を使えます。日本語で頼むと、メインの Claude エージェントが作業を分け、画像・音楽・動画は得意な AI に同時に頼みます。使う AI を指定して頼むこともできます。選べるモデルは、アプリのモデルの選択欄で確認できます。

Google の Gemini アプリの機能は、YOBITSUGI AI からは使えません。YOBITSUGI AI は API を通して Google のモデルを使います。

頼み方の例:

Nano Banana Pro で、新商品のポスターの画像を縦長で作って。「季節のブレンド」の文字も入れて

Veo 3.1 で、朝のカフェの店内を映す 8 秒の横長の動画を作って

Lyria 3.5 で、お店で流す落ち着いたピアノの BGM を 1 曲作って。歌はなしで

Gemini 3.5 Transcribe で、この打ち合わせの録音を話者ごとに文字起こしして

料金

YOBITSUGI AI には月額の費用はなく、使った分だけクレジットが消費されます。料金は提供元の定価をもとに計算されます。計算のしかたと単価は、YOBITSUGI AI の料金ページで確認できます。

Gemini API の有料枠(Paid Tier)の料金は次のとおりです(2026 年 10 月時点・米ドル)。

モデル 料金
Nano Banana Pro 画像の出力 $120.00 / 100 万トークン(1K・2K の画像 1 枚 $0.134、4K は $0.24 に相当)
Nano Banana 2 画像の出力 $60.00 / 100 万トークン(1K の画像 1 枚 $0.067、2K は $0.101、4K は $0.151 に相当)
Veo 3.1 音声つきの動画 1 秒あたり、Standard は $0.40(720p・1080p)・$0.60(4k)、Fast は $0.10(720p)・$0.12(1080p)・$0.30(4k)、Lite は $0.05(720p)・$0.08(1080p)
Lyria 3.5 1 曲あたり $0.08
Gemini 3.1 Pro 100 万トークンあたり入力 $2.00・出力 $12.00(プロンプトが 20 万トークン以下)
Gemini 3.8 Flash 100 万トークンあたり入力 $0.75・出力 $3.75
Gemini 3.8 Flash TTS 100 万トークンあたり文章の入力 $0.50・音声の出力 $9.00(10 秒の音声 $0.00225 に相当)
Gemini 3.5 Transcribe 100 万トークンあたり音声の入力 $2.00・文章の出力 $12.00(1 分あたり入力 $0.003・出力 $0.002 に相当)
  • Gemini 3.1 Pro は、プロンプトが 20 万トークンを超えると入力 $4.00・出力 $18.00 です。
  • Gemini 3.8 Flash と Gemini 3.8 Flash TTS の料金は 2026 年 12 月 31 日までのものです。2027 年 1 月 1 日からは、Gemini 3.8 Flash が入力 $1.50・出力 $7.50、Gemini 3.8 Flash TTS が入力 $1.00・出力 $18.00 になります。

出典

共有XFacebookLINEはてブ

YOBITSUGI AI を使ってみる

日本語で頼むと、Claude エージェントが得意な AI と組んで実際に作り、ファイルで届けます。料金は使った分だけです。

YOBITSUGI AI

日本語で頼むだけで、
画像・動画・資料まで。

中心の Claude エージェントが、得意な AI と組んで実際に作り、ファイルで届けます。料金は使った分だけで、月額費用はかかりません。