2026年9月28日

Google Cloud(Agent Platform)で「Veo」を使い倒す完全ガイド


Content

― 非エンジニアのお試し利用から、エンジニアの開発利用まで ―

0. まえがき:なぜこの記事を書いたのか

まず、この記事を書いたきっかけからお話しします。ことの始まりは、あるお客様に対して 「Google Cloud 上での Veo の利用方法」を紹介する という仕事でした。

正直に言うと、私自身も Veo を触ったことがありませんでした。そこで「まずは説明できる程度に理解しよう」と考え、情報を集め始めます。ところが、ここで最初の壁にぶつかりました。

ぶつかったのは「情報が見つからない」という壁

Google Cloud(Agent Platform)を前提にした記事が、ほとんど見つからない。

実際、世の中にある Veo の解説記事は、そのほとんどが Gemini アプリや Google Flow といった コンシューマー向けサービスを前提 にしたものでした。一方、Google Cloud のコンソール上にある Media Studio は完全にエンジニア向けの UI です。そのため、次のような戸惑いが続きます。

  • どのタスクを選べば何ができるのか、名前から直感的に分からない
  • パラメータの意味が分からないまま「なんとなく」動かしてしまう
  • 生成はできたが、これが正しい使い方なのか確信が持てない

とくに三つ目の不安は、最後までついて回りました。もっとも、公式ドキュメントは正確です。ただし API リファレンス寄りの記述が中心で、「画面のこの項目は何か」という疑問には答えてくれません。

だからこそ、同じところでつまずく人を減らしたい と考え、この記事を書くことにしました。

この記事の想定読者

そこで、読者を次の2種類に絞って書いています。

読者 この記事の読み方
非エンジニア:まず Google Cloud 上で Veo を試したい 0〜2章、4章を中心に。画面操作とパラメータの意味が分かれば十分です
エンジニア:業務システムやアプリに Veo を組み込みたい 全章。特に 2-7 の API 利用と 4章の回避策アーキテクチャを

注意(執筆時点の情報について)

本記事は 2026年9月時点 の情報をもとにしています。というのも、生成AI領域は変化が非常に速く、モデル名・料金・UI の項目名が頻繁に変わるからです。そのため、とくに料金とモデルIDは必ず公式ドキュメントで最新値をご確認ください。

また、従来「Vertex AI」と呼ばれていた基盤は 「Agent Platform(Gemini Enterprise Agent Platform)」 へと呼称が変わっています。Google Cloud コンソールの左メニューにも「Agent Platform」として表示されます。古い記事の「Vertex AI」は、おおむねこれと読み替えてください。


1. Veo とは何か

1-1. ひとことで言うと

テキストや画像から、高品質な映像を生成できる Google の動画生成モデル

Google DeepMind が開発した動画生成AIです。なお、Google Cloud 上では Agent Platform のモデルの一つとして提供されています。

1-2. Veo の4つの強み

まず、Veo の特徴を押さえておきましょう。大きく次の4点に集約されます。

① 高精細な「4K解像度」と多様なアスペクト比

720p / 1080p での生成に対応し、さらにアップスケーリング機能により 4K 相当まで解像度を引き上げられます。加えて、アスペクト比も横長(16:9)と縦長(9:16)を選べます。そのため YouTube などの横型コンテンツと、TikTok / Reels / Shorts などの縦型コンテンツを同じモデルで作り分けられます。

②「音声(音響・対話)」の同時生成

これが Veo 3 系以降の最大の進化点です。従来の動画生成AIは「無音の映像」しか作れず、音は別途用意して後から合成する必要がありました。一方、Veo は 映像と同時に、環境音・効果音・BGM・さらにはキャラクターのセリフまで生成 します。しかも、映像と音がズレません。なぜなら、同じモデルが両方を同時に作っているからです。

③ 高いプロンプト理解力と一貫性

たとえば「カメラをゆっくりズームアウトしながら」「夕暮れの逆光で」といった 映像制作の専門的な指示を理解 します。また、同一ショット内で被写体の見た目が崩れにくいという一貫性の高さも特徴です。

④ 高度な映像の「コントロール・編集」機能

さらに、単にゼロから生成するだけではありません。既存の動画を延長する・動画内のオブジェクトを追加/削除する・参照画像でキャラクターや画風を固定する といった編集的な操作も可能です。実際、この点こそが後述する Gemini Omni との重要な差別化要素になります。

補足:生成物の識別について

Veo で生成された動画には、Google の電子透かし技術 SynthID が埋め込まれます。加えて Veo 3.1 では C2PA(Content Credentials) にも対応しており、「AIが生成したコンテンツである」ことを技術的に追跡できる仕組みが備わっています。したがって、商用利用時のコンプライアンス観点では覚えておくと良いポイントです。

1-3. Veo 3.1 / Fast / Lite ― 3つのモデルの違い

次に、モデルの選択です。ここが最初に迷うポイントになります。というのも、Veo 3.1 には 同じ世代で3つのグレード が用意されているからです。

Veo 3.1(標準) Veo 3.1 Fast Veo 3.1 Lite
位置づけ 最高品質 品質と速度のバランス型 最も低コスト
生成速度 遅い 速い 速い
コスト 高い 中 安い
音声生成 対応 対応 対応
向いている用途 最終納品用のカット、クライアント提出物 通常の制作ワークフロー、社内共有用 大量生成、プロンプトの試行錯誤、A/Bテスト

ただし、重要なのは「Lite = 機能が少ない」ではない という点です。実際、3つとも ネイティブ音声生成に対応 しています。つまり違いは、主に 出力品質と、それに伴う生成時間・コスト なのです。

料金の目安

モデル 1秒あたりの目安 8秒動画1本あたりの目安
Veo 3.1(標準) 約 $0.40 約 $3.2(500円前後)
Veo 3.1 Fast 約 $0.10 〜 $0.15 約 $0.8 〜 $1.2
Veo 3.1 Lite 約 $0.03 〜 $0.05 約 $0.24 〜 $0.4

⚠️ この料金はあくまで目安です。 解像度や音声生成の有無によって変動し、改定も頻繁です。そのため、必ず Google Cloud の生成AI料金ページ で最新の正確な金額をご確認ください。

なお、ここで強調したいのは 絶対額よりも「10倍近い価格差がある」という事実 です。標準モデルで100本試行錯誤すると数万円かかりますが、Lite なら数千円で済みます。

実務的なモデルの選び方

そこでお勧めしたいのが、フェーズでモデルを使い分ける やり方です。

【探索フェーズ】 Veo 3.1 Lite

まず、プロンプトの方向性を探ります。構図・動き・尺感の当たりをつける段階です。失敗して当然なので、とにかく安く数を打ちます。

↓ プロンプトが固まったら

【確認フェーズ】 Veo 3.1 Fast

次に、固まったプロンプトで品質を確認します。なお、社内レビュー用はここで十分なことも多いです。

↓ OKが出たら

【納品フェーズ】 Veo 3.1(標準)

最後に、同じプロンプト(+seed固定)で最終品質を出力します。

逆に、いきなり標準モデルで試行錯誤を始めると、コスト効率が非常に悪くなります。したがって 「試行錯誤は Lite、仕上げは標準」 を合言葉にしてください。


2. Agent Platform(Google Cloud)上での使い方・機能紹介

さて、ここからが本題です。以下、実際の画面に沿って説明します。

2-1. 事前準備①:プロジェクトの作成

まず、Google Cloud はすべての作業が 「プロジェクト」 という単位で管理されます。課金も権限もリソースもプロジェクト単位です。そのため、最初にここから始めます。

  1. Google Cloud コンソール にアクセスする
  2. 画面上部の 「プロジェクトの選択」 をクリック
  3. ダイアログ右上の 「新しいプロジェクト」 をクリック
  4. プロジェクト名 を入力して「作成」

💡 非エンジニアの方へ:プロジェクトを分ける意味

たとえば「既存のプロジェクトで試せばいいのでは?」と思うかもしれません。ただし、検証用は専用プロジェクトを作ることを強くお勧めします。 理由は2つあります。

まず コストが分離できる 点です。Veo の利用料がいくらかかったか、プロジェクト単位で一目で分かります。

また 片付けが簡単 です。検証が終わったらプロジェクトごと削除すれば、課金も残骸もきれいに消えます。

なお、プロジェクトには自動採番された プロジェクトID(例:sample-502213-i3)が付きます。これは後から変更できず、API を叩く際に必ず使う識別子なので、メモしておいてください。画面上の「プロジェクト名」とは別物です。

2-2. 事前準備②:請求先アカウントの紐づけ

次に、課金の設定です。ここを飛ばすと、Veo は動きません。 というのも、Veo は無料枠の対象外となる有料モデルだからです。したがって、請求先アカウントが紐づいていないプロジェクトでは生成を実行できません。

  1. 左メニュー(ハンバーガーメニュー)から 「課金」 を選択
  2. 「請求先アカウントをリンク」 をクリック
  3. 既存の請求先アカウントを選択、またはクレジットカード情報を登録して新規作成
  4. 対象プロジェクトに紐づけて完了

⚠️ 最初のつまずきポイント

「Media Studio でプロンプトを入れたのにエラーが出る / ボタンが押せない」というトラブルの大半は、請求先アカウントの未紐づけ か API の未有効化 が原因です。エラーメッセージを読み込む前に、まずこの2点を疑ってください。

また、コスト暴走が怖い場合は、課金メニューから 予算アラート を設定しておくと安心です。「月$50を超えたらメール通知」といった設定が数分でできます。

2-3. Media Studio を開く

さて、準備ができたら、いよいよ Veo の画面へ進みます。

  1. 左メニューから 「Agent Platform」 を選択
    (旧称 Vertex AI。表示が見つからない場合は、画面上部の検索窓に「Agent Platform」または「Media Studio」と入力するのが最短です)
  2. メニュー内の 「メディアを生成(Media Studio)」 を選択
  3. 動画のタブ/「Veo Generate video」 を選択

なお、初回は API の有効化を求められることがあります。ただし、表示された「有効にする」ボタンを押せば進みます。

そして、画面の構成はざっくり次のようになっています。

Google Cloud Agent Platform の Media Studio で Veo 3.1 の動画生成画面を開いた状態。右側に Video playground の設定パネル、中央にプレビュー領域、下部にプロンプト入力欄が並ぶ。
Media Studio で Veo 3.1 を開いた画面。左=履歴、中央=プレビュー領域とプロンプト入力欄、右=設定パネル(Video playground)

まず、右側の設定パネルは上から Model settings(タスク・モデル・音声の生成)、パラメータ(結果の件数・アスペクト比・動画の長さ・出力解像度・出力ディレクトリ)、安全性(人物生成)、高度(リージョン・シード)という構成になっています。

つまり 先に右側の設定パネルを確認してから、下のプロンプト入力欄に書く。 このように順番を習慣づけると、設定ミスによる無駄な生成(=無駄な課金)を減らせます。

2-4.【最重要】タスクの種類と、その使い分け

続いて、Media Studio で最初に戸惑うのが 「タスク」の選択 です。というのも、ここを理解していないと Veo の能力の半分も使えないからです。逆に言えば、ここさえ押さえれば Veo はほぼ制覇できます。

① Text-to-video(テキストから動画生成)

まず、入力したテキスト(プロンプト)の指示から動画を生成します。最も基本的で、最初に試すべきタスクです。

  • 使いどころ:ゼロからアイデアを形にする、イメージの叩き台を作る
  • 入力:テキストのみ

② Image-to-video(画像から動画生成)

次に、アップロードした静止画をベースに、動き(アニメーション)を加えた動画を生成します。

  • 使いどころ:構図を確実にコントロールしたい場合の最重要タスク
  • 入力:静止画+テキスト

💡 実務でいちばん使うのは、実はこれ

Text-to-video は「どんな絵が出てくるか分からない」ギャンブル性があります。一方 Image-to-video なら、先に画像生成AI(Nano Banana など)で納得のいく1枚を作り込んでから動かせる ため、狙った絵に圧倒的に近づけやすい。商品写真や既存のキービジュアルを動かしたいケースにも直結します。

③ Video extension(動画の延長)

すでに作成された動画の末尾から、さらに時間が続くように動画を延長します。

  • 使いどころ:1回の生成上限(8秒)を超える尺が欲しいとき
  • 入力:動画+テキスト

④ Reference-to-video (Subject)(被写体の参照生成)

最後に、特定の被写体(キャラクター、動物、物体など)の画像を参照用(リファレンス)として読み込ませます。すると、そのアイデンティティを維持した動画 を生成できます。

  • 使いどころ:複数カットにまたがる「キャラクターの一貫性」を保つ
  • 入力:参照画像(被写体)+テキスト

💡 複数カットを作るなら必須の機能

たとえば複数のカットを繋いで1本の動画にする場合、カットごとに主人公の顔や服装が変わってしまっては作品になりません。そこで、このタスクを使えば「同じ人物が別のシーンにいる」映像を作れます。なお、商品やマスコットキャラが登場するプロモーション動画でも同様です。

タスク選択チャート

手元に素材はある?

何もない(テキストだけ)

└─→ ① Text-to-video

静止画がある

├─ その画像そのものを動かしたい → ② Image-to-video

└─ その「被写体」を別シーンで使いたい → ④ Reference-to-video (Subject)

動画がある

└─ 続きを作りたい → ③ Video extension

2-5. 設定パラメータ徹底解説

続いて、設定パネルで指定できる各項目の意味を解説します。なお、UI の表示名と、API で使う場合のパラメータ名を併記しておきます(エンジニアの方は 2-7 と合わせて読んでください)。

基本設定 ― 出力の形を決める項目

まず、動画の見た目そのものを決める項目です。ここを間違えると作り直しになるため、生成前に必ず確認してください。

UI項目 APIパラメータ 取りうる値 解説とコツ
モデル model Veo 3.1 / Fast / Lite 1-3参照。試行錯誤は Lite から
アスペクト比 aspectRatio 16:9 / 9:16 後から変更できません。 最終的な掲載先(YouTube=16:9、Shorts/Reels=9:16)から逆算して最初に決める
解像度 resolution 720p / 1080p 検証は720pで十分。1080pは生成時間もコストも増える
動画の長さ durationSeconds 4 / 6 / 8 秒 これが最大値です。 1回の生成では8秒を超えられません(重要/後述)
生成数 sampleCount 1 〜 4 同じプロンプトで複数パターンを一度に生成。動画生成は「当たり外れ」が大きいので、2〜4にして当たりを選ぶのが効率的。ただし本数分課金されます
音声生成 generateAudio ON / OFF Veo の目玉機能。OFFにすると安くなる ので、映像だけ確認したい試行段階では切るのも手

仕上がりを詰める項目

次に、狙った映像に近づけるための項目です。とくにシードは、後述する再現性の問題に直結します。

UI項目 APIパラメータ 取りうる値 解説とコツ
ネガティブプロンプト negativePrompt 自由テキスト 「映ってほしくないもの」を指定。text, watermark, blurry, distorted hands などが定番
シード seed 整数 再現性のためのキモ。 同じシード+同じプロンプトなら、ほぼ同じ結果が出ます。「この動画の色味だけ変えたい」というとき、シードを固定してプロンプトを一語だけ変えると、変更箇所だけが変わりやすくなります
プロンプト拡張 enhancePrompt ON / OFF ONにすると、入力したプロンプトをAIが自動で詳細化してから生成します。初心者は ON が楽。ただし「意図しない要素が勝手に足される」ため、プロンプトを精密に制御したい場合は OFF 推奨

安全性と出力に関する項目

最後に、生成の可否や保存先を制御する項目です。なお、これらは業務利用でとくに重要になります。

UI項目 APIパラメータ 取りうる値 解説とコツ
人物の生成 personGeneration 許可する(成人のみ)/ 許可しない 等 人物描写の可否を制御するセーフティ設定。地域や利用形態によって選択肢が制限される場合があります
出力先 storageUri Cloud Storage の URI 生成物を指定の GCS バケットに直接保存。API 利用時は実質必須
圧縮品質 compressionQuality 最適化 / 可逆 等 ファイルサイズと画質のトレードオフ

💡「同じ結果が二度と出せない」問題への処方箋

実際、動画生成で最もフラストレーションが溜まるのが、「さっきの方が良かったのに、もう出せない」という状況です。これを防ぐには seed を必ず記録する 習慣をつけてください。良い結果が出たら「プロンプト+シード値+全パラメータ」をセットで手元に控える。これだけで制作効率が劇的に変わります。

(なお、この「記録」を Media Studio が自動でやってくれない点が、Veo の最大の弱点です。4章で詳述します)

2-6. プロンプトの書き方 ― 6つの構成要素

ところで、Veo のプロンプトは 日常会話のように書くより、映像の発注書のように書く ほうがうまくいきます。具体的には、以下の6要素を意識してください。

プロンプトを構成する6要素

要素 内容 記述例
① 被写体 誰が / 何が映るか 白いコックコートを着た30代の男性シェフ
② アクション 何をしているか フライパンを振り、炎が立ち上る
③ シーン どこで、いつ 深夜の業務用キッチン、湯気が立ち込める
④ カメラワーク どう撮るか ハンドヘルドのミディアムショット、ゆっくり右にパン
⑤ ライティング/画風 どう見えるか 暖色の間接照明、シネマティック、浅い被写界深度
⑥ 音声 何が聞こえるか 油のはぜる音、換気扇の低い唸り、BGMなし

6要素を組み立てた例

そこで、実際に6要素を並べると次のようになります。

深夜の業務用キッチンで、白いコックコートを着た30代の男性シェフが
フライパンを振り、炎が立ち上る。湯気が立ち込める空間を、
ハンドヘルドのミディアムショットでゆっくり右にパンしながら捉える。
暖色の間接照明、シネマティックな質感、浅い被写界深度。
音声:油のはぜる音と換気扇の低い唸り。BGMなし。

うまく書くための3つのコツ

  • まず、⑥の音声指定を省略しない。 というのも、Veo の強みは音声同時生成だからです。指定しないと、意図しないBGMが勝手に付くことがあります。なお、「BGMなし」と明示するのも立派な指示です。
  • 次に、8秒に詰め込みすぎない。 たとえば「AがBしてからCに移動してDする」は8秒では破綻します。したがって 1プロンプト=1アクション が鉄則です。
  • 最後に、否定形はネガティブプロンプトへ。 たとえば「〜が映っていない」と本文に書くと、逆にそれが映ることがあります。そのため、除外したいものは negativePrompt に書きましょう。

2-7.【エンジニア向け】API から Veo を呼び出す

さて、ここからは画面操作ではなくプログラムから使う場合のポイントです。

動画生成は「非同期」で動く

まず、動画生成は「長時間実行オペレーション(LRO)」である ことが最大の特徴です。つまり、テキスト生成 API のように「リクエストしたら即レスポンス」ではありません。

① 生成リクエスト(predictLongRunning)

即座に operation name が返る(動画はまだできていない)

↓

② ポーリング(fetchPredictOperation)

done: true になるまで数十秒〜数分、定期的に問い合わせる

↓

③ 完了

storageUri に指定した Cloud Storage に動画が出力される

実装上の5つの注意点

  • まず、同期処理として設計しない。 なぜなら、1本あたり数十秒〜数分かかるからです。したがって Web アプリなら、リクエストを受けたらジョブIDを返して非同期で処理し、完了後に通知する設計が必須です。
  • 次に、storageUri に Cloud Storage を指定する。 指定しない場合は Base64 エンコードされた動画データが返ります。ただし動画は容量が大きいため、GCS に直接吐かせるのが定石です。
  • また、認証は Application Default Credentials(ADC)またはサービスアカウント を使います。なお実行主体には、Agent Platform(Vertex AI)のユーザー権限と、出力先バケットへの書き込み権限が必要です。
  • さらに、クォータに注意。 Veo は従量課金の割り当てとは別に、固定クォータ / プロビジョニングされたスループット の枠組みで管理されます。大量生成を計画している場合は、事前にクォータの上限を確認し、必要なら引き上げ申請をしてください。バッチ推論には対応していません。
  • 最後に、リトライ設計を入れる。 実際、セーフティフィルタによるブロックや一時的なエラーは普通に発生します。そこで、エラー内容をログに残し、リトライ可能なものだけ再試行する実装にしておきましょう。

3. Gemini Omni との違い

ところで、2026年5月の Google I/O で発表された Gemini Omni(第一弾:Gemini Omni Flash)も、Veo と同じく動画を生成できるモデルです。そのため「結局どっちを使えばいいのか」がよく議論になります。そこで、ここで整理しておきます。

3-1. 根本的な設計思想の違い

  • Veo は「動画生成に特化した専用モデル」
  • 一方、Gemini Omni は「テキスト・画像・音声・動画を単一アーキテクチャで統合したマルチモーダルモデル」

つまり、Veo が 専門職 だとすれば、Gemini Omni は 何でもこなす万能型 です。そして、この性格の違いがそのまま得意・不得意に現れます。

3-2. 比較一覧

観点 Veo 3.1 Gemini Omni Flash
位置づけ 動画生成特化モデル 統合型マルチモーダルモデル
最大の長所 映像品質と精密なコントロール 会話による反復編集
マルチターン編集 ❌ 非対応(一発勝負) ✅ 対応(「背景を夕暮れに」等で段階修正)
最大の動画長 8秒/回(延長機能あり) 最大10秒程度
動画の延長 ✅ 対応(Video extension) ❌ 非対応
フレーム間補間 ✅ 対応 ❌ 非対応
インペイント(追加/削除) ✅ 対応 ❌ 非対応
参照画像による一貫性制御 ✅ 被写体・画風の両方に対応 △ 限定的
パラメータの細かい制御 ✅ シード、解像度、尺、音声等を明示指定 ❌ ほぼ指定不可
音声生成 ✅ 映像と同時生成 ✅ 対応(ただし音声のみの編集は不可)
入力の自由度 テキスト・画像・動画 テキスト・画像・音声・動画を自由に組み合わせ可能
日本語の安定性 △(特に音声) △(完全サポートは英語中心)
提供形態 API / Media Studio Gemini アプリ / API
料金の目安 標準 約 $0.40/秒 動画出力 約 $0.10/秒

3-3. 使い分けの結論

それでは、実際の選び方を整理します。

Veo を選ぶべきケース

  • まず、映像品質が最優先の案件(クライアント納品物、広告本番素材)
  • 同じキャラクター・同じトンマナで複数カットを作りたい
  • また、既存の動画を編集したい場合(延長、オブジェクト追加/削除)
  • 同じ結果を再現したい(シード固定が必要)
  • 業務システムに組み込み、パラメータを制御したい

Gemini Omni を選ぶべきケース

  • 何度も修正を重ねながら、対話的に詰めていきたい
  • また、企画段階のイメージ共有や素早いプロトタイピング
  • テキスト+画像+音声を複合的に入力したい
  • さらに、SNS向けの短尺コンテンツ

💡 実務的には「併用」が正解

結論としては、「Gemini Omni で方向性を対話しながら探り、決まった仕様を Veo で精密に作り込む」 という併用が最も現実的です。

つまり、Gemini Omni は「あーでもないこーでもない」の壁打ちが得意です。一方 Veo は「仕様が決まったものを高品質に量産する」のが得意です。したがって、どちらが優れているかではなく、制作プロセスのどのフェーズにいるか で選んでください。


4. 利用する上での注意点

ここまで Veo の強力さを説明してきました。しかし、実際に使ってみて明確に「弱点」と感じた点 もあります。そこで、正直に共有します。なぜなら、事前に知っておけば対策が打てるからです。

4-1. マルチターンの会話ができない

これが最大の制約です。

まず、Veo は 一発勝負 です。たとえば ChatGPT や Gemini のように、「さっきの動画の、空をもう少し青くして」と会話で修正することができません。したがって修正したい場合は、プロンプトを書き直して、最初から生成し直す しかありません。

そして生成し直すと、修正したかった箇所以外も変わってしまう のが厄介なところです。実際、「空の色だけ直したかったのに、人物の顔まで別人になった」ということが普通に起こります。

回避策

方法 内容
① Gemini Omni を使う 対話的な修正が必要な工程は、そもそも Veo を使わない。 Gemini Omni なら「背景を夕暮れに変えて」「カメラをもう少し引いて」といった会話型の段階修正ができ、前の文脈を引き継いでキャラクターの外観や声のトーンを保ったまま調整できます
② seed を固定する Veo 内で粘る場合の次善策。シードを固定したうえでプロンプトを 一語だけ 変えると、変更箇所以外のブレを比較的抑えられます
③ インペイントで部分修正 「特定のオブジェクトを足したい/消したい」だけなら、生成し直さず Video inpaint で直接編集する

4-2. プロンプトの保存・管理ができない

地味ですが、業務利用では深刻な問題です。

また、Media Studio には プロンプトの履歴管理機能がありません。 そのため、ブラウザをリロードしたり、別のタスクに切り替えたりすると、それまで試行錯誤したプロンプトは消えます。

つまり、

  • 「先週うまくいったプロンプトをもう一度使いたい」→ 残っていない
  • 「チームメンバーに成功プロンプトを共有したい」→ 手作業でコピペするしかない
  • 「どのパラメータの組み合わせが良かったか比較したい」→ 記録が残っていない

回避策(非エンジニア):ツール側の解決策はない、手動記録あるのみ

残念ながら、手動で記録する以外の方法はありません。 ただし、これを軽視すると必ず後悔します。最低限、次の項目をスプレッドシート等に控える運用をお勧めします。

記録項目 理由
プロンプト全文 言うまでもなく最重要
ネガティブプロンプト 忘れがちだが結果に効く
シード値 これがないと再現できない
モデル / 解像度 / 尺 / アスペクト比 条件を揃えて比較するため
生成物のファイル名・保存先 プロンプトと成果物を紐づけるため
成否のメモ(何が良くて何がダメだったか) 次の試行の精度が上がる

地味な作業です。しかし、この記録が溜まってくると、自社の「勝ちパターン集」という資産になります。

回避策(エンジニア):アプリケーション化で解決できる

一方、こちらには明確な解があります。つまり API 経由で Veo を呼び出し、リクエストした文章(プロンプト)とパラメータを自前で保存するアーキテクチャのアプリ として形にすれば、Veo で生成しつつプロンプトの保存・管理も実現できます。

構成イメージ

具体的には、次のような構成になります。

フロントエンド

プロンプト入力 / 生成結果の一覧

↓

バックエンド API(Cloud Run など)

  1. リクエスト受信
  2. プロンプト+全パラメータを DB に保存 ★ここが肝
  3. Veo API を呼び出し(predictLongRunning)
  4. operation name を保存し、非同期でポーリング
  5. 完了後、生成物の GCS パスを DB に追記

↓

DB(Firestore / Cloud SQL)

  • プロンプト
  • パラメータ一式
  • シード値
  • 生成日時 / 実行者
  • GCSパス
  • 評価 / タグ

Veo API(Agent Platform)

Cloud Storage

生成された動画ファイル

このアプリが持つべき5つの機能
  1. まず、プロンプトのバージョン管理 ―「v1 → v2 でどこを変えたか」の差分が見えると、改善が加速します
  2. 次に、お気に入り / タグ付け ― 成功したプロンプトに「商品紹介」「人物」等のタグを付けて再利用
  3. さらに、ワンクリック再生成 ― 保存済みのパラメータをそのまま再投入できる
  4. 加えて、チーム共有 ― メンバーの成功プロンプトを全員が検索できる
  5. 最後に、コスト集計 ― 誰がどれだけ生成したかを記録し、予算管理に使う

なお、構築自体は Cloud Run + Firestore + Cloud Storage といった構成で比較的シンプルに実現できます。したがって Veo を組織として継続利用するなら、この仕組みへの投資は確実に回収できます。

4-3. その他、押さえておくべき注意点

制作を進めるうえでの注意点

まず、実際に動画を作る場面で効いてくる注意点です。いずれも事前に知っておけば、手戻りを防げます。

項目 内容
1回8秒の壁 長尺が必要な場合は、カットを分割して生成し、最後に結合するという工程設計が前提になります。「Veo だけで CM を1本作る」という期待値設定は危険です(長尺動画の作り方は別記事で詳しく解説予定です)
日本語音声の品質 日本語のセリフは英語ほど安定しません。日本語音声は Gemini TTS で別途生成し、後乗せする のが実務的です。また、映像内の日本語テロップも崩れやすいため、テロップは編集ソフトで載せるほうが確実です
セーフティフィルタ 人物描写や特定の表現はブロックされることがあります。業務フローに組み込む場合、「ブロックされた場合の代替手順」 を想定しておいてください
コストの見積もり 「8秒で数百円」は安く感じますが、試行錯誤で1カットあたり10回生成すれば数千円 です。カット数が20あれば数万円。必ず予算アラートを設定 してください

システムに組み込むときの注意点

一方、アプリケーションに組み込む場合は、次の3点も押さえておく必要があります。

項目 内容
プレビュー機能の扱い アップスケーリング等、プレビュー段階の機能は仕様変更・提供終了の可能性があります。本番システムの前提にするのは避けましょう
モデルの提供終了 旧世代モデル(Veo 3 系など)には提供終了日が設定されています。アプリに組み込む場合は モデルIDを設定値として外出しし、差し替え可能にしておく ことを強くお勧めします
権利とコンプライアンス 生成物には SynthID / C2PA が付与されます。商用利用時は、自社のガイドラインや利用規約と照らし合わせて確認してください

5. まとめ

最後に、長くなったので要点を整理します。

Veo とは

  • まず、テキストや画像から、音声つきの高品質な映像を生成できる Google のモデル である
  • また、強みは「4K/多様なアスペクト比」「音声の同時生成」「高いプロンプト理解力と一貫性」「高度な編集機能」の4点
  • そして 標準 / Fast / Lite の3グレード があり、機能差ではなく品質とコストの差。したがって 試行錯誤は Lite、仕上げは標準 が鉄則

Agent Platform 上での使い方

  • 事前準備(プロジェクト作成 → 請求先アカウントの紐づけ)を飛ばさない。 初期トラブルの大半はここが原因
  • 次に、Agent Platform → メディアを生成 → Veo Generate video と進む
  • そのうえで タスクの使い分けが最重要。「手元に何があるか」「何をしたいか」でタスクを選ぶ
  • また seed は必ず記録する。 なぜなら再現性の生命線だからです
  • 最後に、エンジニアは 長時間実行オペレーション(非同期)である ことを前提に設計する

Gemini Omni との違い

  • まず Veo = 品質と精密なコントロール / Gemini Omni = 会話による反復編集
  • つまり、どちらが優れているかではなく 制作フェーズで使い分ける
  • したがって、探索・壁打ちは Gemini Omni、仕様が固まったら Veo で作り込む、が現実的な解

注意点と回避策

  • まず マルチターン会話ができない → 対話的修正が必要な工程は Gemini Omni を使う。Veo 内で粘るならシード固定+一語だけ変更
  • また プロンプトの保存・管理ができない → 非エンジニアは 手動でスプレッドシート記録(シード値を必ず含める)。エンジニアは API 経由で Veo を呼び出し、プロンプトとパラメータを DB に保存するアプリとして形にする ことで解決できる
  • なお、8秒の壁、日本語音声の品質、コストの膨らみやすさは 事前に期待値を調整しておく

最後に

正直なところ、Google Cloud 上の Veo は 決して親切な UI ではありません。 実際、私自身も最初は「これで合っているのか」と不安なまま触っていました。

しかし、パラメータの意味とタスクの使い分けさえ分かってしまえば、Gemini アプリ経由では到底できない精密なコントロールができる のも事実です。特に、業務システムへの組み込みや、ブランドのトンマナを守った量産を考えるなら、Agent Platform 上で使う意味は非常に大きいと感じています。

とはいえ、勘所さえ掴めば怖くありません。この記事が、かつての私と同じところでつまずいている方の助けになれば幸いです。


参考リンク

システムサポートでは、Google Cloudの導入や活用を支援しております。

Google Cloudを導入したい・導入したけど使いこなせていない…という方は、お気軽にご相談ください!

Google Cloud 導入・活動支援に関するご相談はこちら

2026年9月28日 Google Cloud(Agent Platform)で「Veo」を使い倒す完全ガイド

Category Google Cloud

ご意見・ご相談・料金のお見積もりなど、
お気軽にお問い合わせください。

お問い合わせはこちら