Googleは2026年5月19日(現地時間)、開発者向けカンファレンス「Google I/O 2026」で、新しいAIモデル「Gemini Omni」を発表しました。
まずは動画の生成・編集に対応し、テキストや画像、音声、映像を組み合わせた指示から作品を作れるほか、自然言語で内容を修正できます。
Gemini Omniは「生成して終わり」ではない動画AI
Gemini Omniは、Geminiの推論能力と創造能力を組み合わせたモデルです。
Googleは、動画をはじめとするさまざまな入力から、多様なコンテンツを生み出せるモデルとして紹介しています。
動画制作では、画像・音声・映像・テキストを入力として組み合わせ、Geminiが持つ実世界に関する知識を活用しながら動画を生成できます。
生成後も、会話するように指示を加えて、見た目や動き、効果などを調整できます。
Googleは、自然言語で画像を生成・編集する「Nano Banana」の動画版にあたるものと位置づけています。
自然言語で動画を段階的に編集
編集のたびに専門的なソフトの操作を覚えるのではなく、「背景を夕暮れにする」「登場する物を別のものに変える」といった言葉で変更を指示できるのが特徴です。
入力した動画の見た目や動作、効果を変えるほか、画像をもとに動画を編集したり、絵を動きのある映像にしたりする使い方も想定されています。
一度の指示で完成させるだけでなく、複数回に分けて手を加えながら、作品の一貫性を保つ機能も挙げられています。
| 主な機能 | できること |
|---|---|
| 動画の生成・編集 | 画像やテキストなどをもとに動画を作り、自然言語で変更する |
| 要素の置き換え | 動画内のオブジェクトや文字を別のものに差し替える |
| スタイル・動きの転送 | 参照画像などを使って、見た目や動きを反映する |
| 複数入力の活用 | テキスト、画像、音声、映像を組み合わせて制作する |
| 段階的な編集 | 複数回の修正を重ねながら、作品の一貫性を保つ |
物理法則や背景知識を生かした動画生成
Googleが強調するもう一つの特徴は、現実世界の物理や背景知識を動画生成に活用する点です。
重力や運動エネルギー、流体力学への理解を高めることで、ビー玉が軌道を転がる連鎖反応のような、複数の動きが連続する場面をより自然に表現できるとしています。
単に指定された物体を画面に配置するだけではなく、動きのつながりや、その後に起こることを推論して映像を構成することを目指しています。
また、歴史・科学・数学・文化に関する知識を活用し、クレイアニメーションでタンパク質の折り畳みを解説する動画など、説明と映像表現を組み合わせた制作例も示されました。
テキストと画面上の動きを同期させる機能も掲げられており、解説動画や教材など、情報を伝える映像への応用が期待されます。
複雑なアイデアを映像にする狙い
動画制作では、頭の中にあるイメージを具体的な指示へ落とし込むことが難しい場合があります。
Gemini Omniは、複数の素材や自然言語による修正を組み合わせることで、アイデアを段階的に映像へ反映しやすくすることを狙っています。
ただし、発表された機能があらゆる指示や素材で常に意図どおりに動作することを意味するわけではなく、実際の仕上がりは入力内容や編集の進め方によって変わります。
提供開始時期と対応サービス
Omniファミリーの最初のモデルとして発表された「Gemini Omni Flash」は、2026年5月19日(現地時間)から提供が始まります。
提供先や対象は段階ごとに異なり、Googleは次のように案内しています。
- 「Gemini」アプリと「Google Flow」では、Google AI Plus、Pro、Ultraの加入者を対象に提供
- YouTube ShortsとYouTube Createアプリでは、同週から無料で提供
- 開発者・企業向けには、APIを通じて今後数週間以内に提供予定
なお、発表時点でまず提供されるのは動画に関する機能です。
Googleは、今後、画像や音声など動画以外の出力形式にも対応する予定としています。
生成動画の識別とコンテンツ認証
Gemini Omniで作成した動画には、目に見えないデジタル透かし「SynthID」と、コンテンツの来歴を示す「C2PA」の認証情報が含まれます。
Googleは、GeminiアプリやChrome版Gemini、Google検索を使って、動画がGemini Omniで生成されたものか確認する機能を近日中に提供する予定です。
生成AIによる映像が広がるなか、作品の出所を確認しやすくする仕組みは、視聴者がコンテンツの背景を判断するうえで重要になります。
まとめ
Gemini Omniは、自然言語による動画生成・編集に加え、物理法則や科学などの知識を映像づくりに取り込むことを目指した新モデルです。
まずはGemini Omni Flashが提供され、アプリや動画関連サービス、APIを通じて利用範囲が広がる予定です。
複数の素材を使った制作や段階的な修正がどこまで実用的になるか、提供開始後の実際の性能と対応範囲が注目されます。
