動画生成AI比較 ~Sora vs Veo vs Grok~
⚔️ 3つを比較し、Grokに決めました
オリジナルの推しキャラ「GEMu」で YouTube のショート動画を制作するにあたり、3つの動画生成AI「Sora 2 / Veo 3.1 / Grok」で検証してみました。そして、検証の結果は以下に整理し、リトライを前提として狙いに寄せやすい「Grok」を活用し制作していくことに決めました。
😽 Sora 2:キャラ画像は忠実だが、日本語の画像生成が難しい
Sora 2 は OpenAI が発表した動画生成AIモデルで、利用の際は招待コードが必須であり、既存のユーザからの招待や、公式サイトのウェイトリスト登録を通じて順次提供されているようです。
👍Pros:キャラの見た目は元の画像を忠実に再現でき、声もカワイイ
😵Cons:書籍の表紙画像の日本語テキストが崩れ、必ず「文字っぽい何か」になってしまう
🔠 Veo 3.1:文字に強いが、アメリカっぽい雰囲気
Veo 3.1 は Google が提供する最新の動画生成AIモデルで、テキストや複数の画像から、音声と映像が同期した、長尺かつ高品質(1080p/4K)な動画を生成できるのが特徴です。
👍Pros:書籍の表紙画像の日本語テキストを高確率で忠実に再現できる
😵Cons:キャラの見た目や話し方がアメリカっぽい雰囲気、しばしば音声が英語になる
⚖️ Grok 4.1:リトライ前提の総合バランスで優位
Grok 4.1 は xAI が提供する対話AI「Grok」のモデル世代のひとつで、文章生成だけではなく、用途によっては画像生成や制作支援などクリエイティブ寄りの作業にも活用されています。
👍Pros:(何度か試せば)Sora 2 や Veo 3.1 の弱点を克服できるという総合バランスで優位
😵Cons:キャラの見た目は Sora 2 に敵わず(しばしば耳から白い毛が生える)、日本語テキストを再現する率は Veo 3.1 に敵わず、コストが高い(¥5,000 / 月額)💸
