長尺AI動画は「AI制作チーム」へ――Googleの4研究

長尺AI動画は「AI制作チーム」へ――Googleの4研究

記事
IT・テクノロジー


短いAI動画は驚くほどきれいになりました。けれど、数分の物語に伸ばすと、同じ人物の服が変わる、部屋の配置がずれる、小道具が別物になる――そんな「長尺ならではの崩れ」が起きやすくなります。

Google Researchは2026年9月24日、長尺動画を一本のモデルに一気に作らせるのではなく、役割の違う複数のAIを制作チームとして動かす4つの研究をまとめて発表しました。

先に大切な境界を示します。これは新しい一般向け動画サービスの発売ではありません。公式発表は研究紹介で、土台となる4本の論文は2026年3〜5月にarXivへ提出済みです。公式ページには、一般向けAPI、料金、地域、利用開始日の案内はありません。


何が変わったのか
diagram_01_ai_production_team.png


中心にあるのは、映画制作のような分業や、制作中の状態を保つ仕組みです。以下は一つの統合製品の工程ではなく、それぞれの研究が扱う役割です。

1. Co-Directorが作品全体の創作戦略、物語形式、画調を選ぶ
2. CANVASが人物・場所・小道具の状態を記憶し、絵コンテの連続性を保つ
3. A²RDが映像を区間ごとに生成し、過去の映像記憶を参照しながら次の区間を作る
4. VQQAが完成映像へ質問し、見つけた不整合を言葉のフィードバックとしてプロンプトへ戻す

Co-Directorでは、オーケストレーターが全体方針を決め、プリプロダクション、キーフレーム、映像、音声の各エージェントへ共有します。最後にマルチモーダルLLMの審査役が完成版を評価し、その結果を次の生成ループへ戻します。

ポイントは、単にAIを複数並べたことではありません。全体方針、制作状態、評価結果を共有し、局所的な修正で物語全体を壊さないようにしたことです。

「前の場面を覚える」が長尺化の鍵
diagram_02_continuity_memory.png


CANVASは、人物の外見、場所の構造、小道具の状態を持続的な視覚メモリとして管理します。A²RDは、映像を「取り出す→生成する→改善する→記憶を更新する」という閉ループで区間ごとに伸ばします。

研究チームは、A²RDで1〜10分の動画を評価し、既存手法より一貫性が最大30%、物語の整合性が最大20%向上したと報告しています。CANVAS論文では、最良の比較手法に対し、背景の連続性21.6%、人物の一貫性9.6%、小道具の一貫性7.6%の改善を報告しています。

ただし、これらは著者らのベンチマークと人手評価による主張です。独立した第三者検証とは分けて受け取る必要があります。

AIが自分の映像へ質問する

VQQAの発想も面白いところです。評価AIは、映像に合わせて「人物は場面転換後も同じ楽器を持っているか」「物体の材質は指示どおりか」といった質問を作り、その答えを改善方向として使います。

画素を直接修正するのではなく、問題を言葉で説明し、生成プロンプトを調整して作り直します。さらに最後の版を無条件で採用せず、生成した候補を元の指示と照合し、最も良いものを選ぶ設計です。

VQQA論文は、通常生成に対してT2V-CompBenchで11.57ポイント、VBench2で8.43ポイントの絶対改善を報告しています。ここも同じく、現時点では研究チームによる評価です。

diagram_03_evidence_boundary.png

MORIにとって面白い理由

これは動画生成だけのニュースではありません。

MORIが進めている「人は目的と最終判断を持ち、AIは役割分担して制作し、別のAIがEvidenceを確かめる」という形に近いからです。特に重要なのは次の3点です。

- 一つのAIへ全部を任せず、企画・制作・評価を分ける
- 長い仕事では、人物や目的などの状態を外部記憶として持つ
- 評価結果を次の実行へ戻し、最後の出力だけでなく改善の循環を設計する

「強いモデルを一つ選ぶ」より、「複数の役割が同じ目標と状態を共有できるか」が成果を左右する。今回の研究は、その考え方が長尺動画制作にも広がっていることを示しています。

まとめ

Google Researchが2026年9月24日に紹介した4研究は、長尺AI動画を一発生成の問題から、制作工程と検証ループの設計問題へ置き換えました。

人物や場所の記憶、専門AIの分業、完成映像への質問、候補全体からの再選択。どれも、AI制作を長く・複雑にするほど重要になる仕組みです。

ただし現在確認できるのは研究成果とデモであり、一般向け製品の提供開始ではありません。ワクワクする進展だからこそ、研究結果、製品化、実際の利用可能性を分けて追いかけるのがよさそうです。

出典

- Google Research, “Automating coherent long-form video generation” (2026-09-24)  
- Co-Director: Agentic Generative Video Storytelling (arXiv:2604.24842, submitted 2026-04-27)  
- CANVAS: Continuity-Aware Narratives via Visual Agentic Storyboarding (arXiv:2604.13452, submitted 2026-04-15)  
- A²RD: Agentic Autoregressive Diffusion for Long Video Consistency (arXiv:2605.06924, submitted 2026-05-07)  
- VQQA: An Agentic Approach for Video Evaluation and Quality Improvement (arXiv:2603.12310, submitted 2026-03-12)  


サービス数40万件のスキルマーケット、あなたにぴったりのサービスを探す