日本語

モデル発表GoogleGemini Omni

Google、Gemini Omniで動画の自然言語編集と多様な入力からの生成に対応

Googleは、AI動画編集モデル「Gemini Omni」を発表しました。同社はGemini Omniを、動画版の「Nano Banana」と位置付けています。ユーザーは自然言語による対話を通じて、動画の美しさ、アクション、エフェクトなどを段階的に編集できます。各編集は前回の状態を踏襲し、一貫性と整合性を保ちながらシーンが進む仕組みです。

Gemini Omniは、直感的な物理理解とGeminiの歴史・科学・文化的文脈に関する知識を組み合わせます。これにより、フォトリアリズムから意味あるストーリーテリングまでのギャップを埋めるとしています。画像、テキスト、動画、音声などの任意のリファレンスを入力として、単一の統合された出力に変換することが可能です。

具体例として、人物が鏡に触れた際に鏡が液体のように波打ったり、人物の腕が反射する鏡面素材に変化したりするプロンプトが紹介されています。また、指で動物のおもちゃに触れた際にその動物の鳴き声が再生される、といったインタラクティブな編集も可能です。参考画像に基づいて、手のひらの上に3D建築構造や太陽、飛行機などが現れる演出も作成できます。

さらに、特定のキャラクターやオブジェクトを置き換えたり、カメラアングルを変更したり、環境を別の画像のものと切り替えたりすることもできます。Gemini Omniは、Geminiの推論能力と創造性を組み合わせることで、世界理解・マルチモーダル性・編集能力において飛躍的な向上をもたらすと主張しています。


出典: Gemini Omni(HN 323pt・146コメント)(HN Search (backfill)、2026-05-20)