研究tldr-ai2026-07-14
動画AIが画像認識もこなす
Video Generators as General-Purpose Vision Models

DeepMindは動画を作るAIを画像認識に転用し、テキスト指示で様々な画像タスクをこなせる万能AIとして活用できる可能性を示しました。
DeepMindの研究者たちはGenCeptionを発表しました。これは、事前に学習された動画生成モデルを、テキスト指示によって制御される統一されたビジョンシステムとして再利用するものです。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。