【朗報】全クリエイターに告ぐ!高価な機材もPCも不要になるかもしれない…無料の動画AI『Wan2.2』が業界の常識を破壊しにきた件
どうも皆さん! 葉加瀬あい(ハカセアイ) です!

まず、今回のNote記事の内容は 「YouTube動画版」 でも見ることができますので、映像でサクッと情報をインプットしたい!という方はこちらからどうぞ!
AI動画生成の歴史が変わる!映画級の映像を誰もが作れる「Wan2.2」が凄すぎる!
ついに、この日が来ました⋯!
「7月28日に何かすごいものがリリースされるらしい⋯」と、プレリリース情報が出てからというもの、世界中のクリエイターが待ち望んでいた、あの次世代の動画生成AI 『Wan2.2』 が、私たちの期待を遥かに超える、とんでもない性能でついに登場したんです!
これはもう、私たちクリエイターにとって「革命」です!!

Wan2.2が実現する革命的な機能とは?
何がそんなに革命的なのかって⋯?
まるでプロのカメラマンを雇ったかのような "自由自在なカメラワーク" 、
思わず息をのむハリウッド映画に匹敵する "シネマティックな映像美" 、
そして何よりも驚きなのが⋯なんと "VRAM 8GBのPCでも動くかもしれない" という、信じられないくらいの手軽さなんです!

今回のリリースは、Alibabaさんが開発を主導する「Wan-AI」プロジェクトの大きな成果で、あのComfyUIもリリース初日からネイティブサポートするという、まさに神対応っぷりなんです!
AIでの動画生成は「高スペックなPCがないと無理⋯」と諦めていた、皆さん!
今回の『Wan2.2』は、そんな常識を根底から覆してくれるかもしれません!
参考:ComfyUI公式によるWan2.2サポート発表
https://x.com/ComfyUI/status/1949802127066628370

今回の記事で解説する内容
ということで今回お話しする内容はこんな感じです!
1. 【革命的な表現力】AIが映画監督に?! Wan2.2が実現する"シネマティック"な映像表現とは?
2. 【驚異の手軽さ】ComfyUIに即日対応!VRAM8GBでも動く?! 導入ハードルが劇的に下がった秘密
3. 【無限の将来性】高品質を支える"MoE"技術の舞台裏&オープンソースで進化し続ける未来

それと、Youtube では note の内容をAIで動画に変換して公開しているので、まだの方は noteのフォロー や YouTubeのチャンネル登録 もお願いします!

なお、 全体公開バージョン は動画のレンダリングが終了し次第、こちらのリンクからアクセスできるので、よかったら見てみてください!
それでは、本日もよろしくお願いします!
Wan2.2の技術革新:なぜ「革命」と呼ばれるのか?
さて、ここからは「Wan2.2がなぜこれほどまでに"革命的"だと言われているのか?」その秘密の核心に、ググっと迫っていきたいと思います!
この技術の背景を知ると、そのすごさがもっともっと実感できるはずです!

開発元:Alibabaが生み出したオープンソースの革命
まず、この素晴らしいAIを開発したのは、Alibabaグループが主導する 「Wan-AI」 という研究プロジェクトなんです。
参考:Wan-AIプロジェクトのHugging Faceページ
https://huggingface.co/Wan-AI

そして、ここが本当に重要なポイントなんですけど⋯この『Wan2.2』は、 「Apache-2.0ライセンス」という形式でオープンソースとして公開されているんです!

「オープンソース⋯?なんだか難しそう⋯」って思いますよね?
大丈夫です!これはものすごく簡単に言うと、 「このAIの設計図を、世界中の誰でも自由に見たり、使ったり、自分好みに改造したりしていいです!しかも商用利用もOKです!」 という、とっても懐の深いライセンスなんです!
参考:Wan2.2のGitHubリポジトリ(設計図が見られます!)
https://github.com/Wan-Video/Wan2.2

これって、私たちクリエイターや開発者にとっては、まさに夢のような話なんです⋯!
世界中の才能あるエンジニアたちが、このWan2.2をベースに、もっとすごい機能を追加したり、新しい使い方を発見したり⋯!コミュニティ全体の力で、ものすごいスピードで進化していくことが約束されているようなものなんです!

革新的アーキテクチャ:天才的な「専門家AIチーム」の連携プレー
では、Wan2.2の圧倒的なクオリティは、一体どんな技術から生まれているのでしょうか?

その心臓部とも言えるのが、 「MoE(Mixture of Experts)」アーキテクチャ という、世界で初めて動画生成モデルに採用された革新的な仕組みなんです!

これを例えるなら、 AIの中に「動画制作の専門家チーム」がいる ようなイメージですね!
監督役(高ノイズ担当エキスパート)
動画全体の構成や、キャラクターの大きな動き、カメラのレイアウトといった、「ざっくりとした骨格」を作るのが得意な専門家です。最初に「こんな感じの映像にしよう!」という大きな方向性を決めてくれる、頼れる監督さんですね!仕上げ職人役(低ノイズ担当エキスパート)
監督が決めた骨格に、美しい肉付けをしていく専門家です。キャラクターの服の質感や、肌のツヤ、キラキラ光る水面の反射、繊細な表情の変化といった「細部のクオリティ」を極限まで高めてくれる、まさに神業を持つ職人さんなんです!

この 「監督」と「職人」が超高速で連携プレー をすることで、動画全体の構成はしっかり保ちつつ、ディテールまで美しい、驚くほど高品質な動画が効率的に生み出されるんです!賢すぎますよね⋯!

シネマティックカメラワークの実現
この技術のおかげで、これまでのAI動画生成がずっと苦手としてきた、

滑らかなカメラワーク が、ついに実現可能になりました。

これまでのAIだと、カメラが不自然にガタガタ揺れたり、意図しない方向に動いたりすることがありましたよね⋯?

でもWan2.2なら、プロのカメラマンが使う 「パン(左右に振る)」

「ドリー(前後に動く)」「チルト(上下に振る)」

といった複雑なカメラの動きを、プロンプトで指示するだけで、驚くほど正確に、

そして美しく再現してくれるんです!これが最大の進化点と言っても過言ではありません!

公式発表:達成された3つの技術的偉業
この「専門家AIチーム」の活躍によって、Wan2.2は公式に3つの偉業を成し遂げた、と発表しています。

1. 映画レベルの美的制御(Cinematic-level Aesthetic Control)
ただリアルなだけじゃないんです。光と影のコントラスト、

夕暮れの切ない色合い、雨に濡れたネオンの輝き⋯。

そんな、人の感情を揺さぶるような 「雰囲気」や「空気感」までコントロール できるんです!

まるで映画監督のように、映像のトーンを思いのままに演出できるなんて、すごすぎます⋯!

2. 大規模で複雑な動きの生成(Large-scale Complex Motion)
馬の群れが草原を駆け抜けたり、大勢の人が市場を行き交ったり⋯。
そんな たくさんの要素が複雑に動くシーンも、破綻なく自然に生成 できるんです。躍動感あふれるアクションシーンや、壮大な風景の動画を作るのに、とてつもないパワーを発揮してくれます!

3. プロンプトへの正確な準拠(Precise Semantic Compliance)
「フードを被った女性が、猫を抱きながら、ゆっくりと右を向く」といった、 複数の要素が組み合わさった複雑な指示も、AIが正確に理解して映像化 してくれます。私たちの頭の中にあるイメージを、より忠実に再現してくれる。これはクリエイターにとって、本当に、本当に嬉しい進化ですよね!
しかも、その性能は折り紙付きで、例えば「NVIDIA RTX 4090」のような一般向けの高性能グラフィックボードがあれば、 720p解像度・24fpsという、テレビ放送並みに滑らかな動画が生成可能 と報告されています。もう、おもちゃのレベルじゃないんです⋯!

衝撃のベンチマーク結果:王者SOTA超え?!オープンソースの常識を破壊する性能比較
⋯と、ここまで公式の発表を中心にお話ししてきましたが、「他の有名なAIモデルと比べて、実際どうなの?」って、気になりますよね?
今回、とんでもない比較データが公開されているんです!これを見たら、皆さんもきっと声が出ちゃいますよ⋯!

まずはこちらのグラフをご覧ください!
これ、何がすごいか分かりますか?
このグラフは、私たちの『Wan2.2』を、あのOpenAIの 『Sora』 や、中国で非常に評価の高い 『KLING 2.0』 、そして「Googleの最新動画AI『Veo 3.0』以上の実力を持つのでは?」とまで噂される超高性能モデル 『Seedance 1.0』 といった、名だたるクローズドソースの商用モデルたちと、ガチンコで性能を比較した、まさに"異種格闘技戦"の結果なんです!
そして、一番右の濃い紫色のグラフが、私たちの 『Wan2.2』 の結果です。

特に注目してほしいのが、左端の 「Aesthetics Quality(映像の美しさ)」 という項目です。
なんと『Wan2.2』は、 他の全ての商用モデルを抑えて、堂々のトップスコア(85.3)を叩き出しているんです!
あの『Sora』や、最強クラスと名高い『Seedance 1.0』さえも上回る美的センスを持っている⋯!これはもう、事件です!
さらに!「自由自在なカメラワーク」の裏付けとなる 「Camera Control(カメラ制御)」 の項目でも、見事トップの成績を収めています!
「でも、これだけの性能なら、きっとクローズドで高価なサービスなんでしょ?」
いいえ、違うんです!
だからこそ『Wan2.2』は"革命"なんです。
これだけの性能を、誰でも自由に、しかも商用利用まで可能な「オープンソース」で実現している。
この事実が、どれだけ衝撃的なことか、クリエイターの皆さんならきっと分かってくれるはずです⋯!

【実践編】さあ、"未来"をその手で動かそう!Wan2.2の完全導入ガイド
「こんなに凄いなら、早く使ってみたい!」⋯そう思いませんか?
ご安心ください!ここからは、皆さんがWan2.2を実際に動かすための具体的なステップを、分かりやすく解説していきます!

アクセス方法:モデルはどこで手に入れる?
Wan2.2の心臓部であるモデルデータは、AI開発者の聖地 「Hugging Face」 で、誰でもダウンロードできるようになっています!太っ腹ですよね!
まずはここから!Wan-AI公式ページ
T2V(テキストから動画)モデルやI2V(画像から動画)モデル、そして性能の異なる5Bモデルや14Bモデルなど、様々な種類のモデルがここに集まっています!まずはここをチェックするのが基本ですね!
参考:Wan-AI 公式Hugging Faceページ
https://huggingface.co/Wan-AI

基本的な操作手順:ComfyUIで動かす最短ルート
今回は、多くのクリエイターさんが使い慣れている「ComfyUI」で動かす方法をメインにご紹介します!公式が即日サポートしてくれたおかげで、導入もとってもスムーズなんです!
参考:ComfyUIでの公式サポート発表
https://blog.comfy.org/p/wan22-day-0-support-in-comfyui

1. 必要なモデルをダウンロード
動画生成には、大きく分けて3種類のモデルが必要です。ComfyUIの公式解説ページに、ダウンロード先のリンクがまとめられているので、そこからそれぞれダウンロードしましょう!
Text encoder (テキストを理解するモデル)
VAE (映像の品質を決めるモデル)
Video Models (diffusion models) (動画生成のメインモデル)
参考:ComfyUI公式 Wan2.2モデル解説&ダウンロードページ
https://comfyanonymous.github.io/ComfyUI_examples/wan22/

2. 正しいフォルダに配置
ダウンロードしたモデルを、ComfyUI内の指定されたフォルダにそれぞれ配置します。お引越しさせてあげるイメージですね!
Text encoderモデルは → `ComfyUI/models/text_encoders/`
VAEモデルは → `ComfyUI/models/vae/`
Video Models (diffusion models)は → `ComfyUI/models/diffusion_models/`

3. 公式ワークフローを読み込むだけ
ここが神ポイント!なんと、ComfyUI公式が、すぐに使える 「ワークフロー(JSONファイル)」 を用意してくれているんです!
先ほどご紹介した公式解説ページから、使いたいモデル(T2VやI2Vなど)のワークフローファイルをダウンロードして、

そのJSONファイルをComfyUIの画面にドラッグ&ドロップするだけ!
たったこれだけで、複雑なノード接続が一瞬で完了しちゃうんです!

あとはプロンプトを入力して「Run」ボタンを押せば、皆さんも今日から映像監督です!

使いこなしのコツ【応用編】:プロの映像表現に挑戦
基本的な動かし方がわかったら、次はもっとクオリティを上げるための、ちょっとした応用テクニックをご紹介します!
ご紹介してきたように、これだけの性能を秘めたWan2.2ですが、そのポテンシャルを120%引き出すには、プロンプト、つまり AIへの"呪文"の唱え方 にちょっとしたコツがあるんです!

プロンプト作成のポイント:ショットオーダーを意識しよう
ポイントは 「ショットオーダー(撮影の順番)」 を意識すること!
「最初に何が映って、次にカメラがどう動いて、最後は何をアップで見せるか」のように、物語を組み立てるようにプロンプトを書くと、AIが意図を汲み取りやすくなるんです!ただ単語を並べるのではなく、短い脚本を書く気持ちで挑戦してみてください!

例えばこんな感じです
1. 良いプロンプトを書く
`A girl in a red dress is standing in a magical forest, the camera slowly dollys in on her face. `
(赤いドレスの女の子が魔法の森に立っている、 カメラは彼女の顔にゆっくりとドリーインする。 )
2. 効果的な"具体的なカメラワーク、動きなどの修飾子" を付け加える
カメラ言語 :
`pan left(左にパン)`, `tilt up(上にチルト)`, `crane shot(クレーンショット)`, `tracking shot(追跡ショット)`

動きのスタイル :
`slow-motion(スローモーション)`, `fast-paced(速いペースで)`, `rapid whip-pan(素早いウィップパン)`雰囲気(美的タグ) :
`volumetric lighting(光芒)`, `cinematic lighting(映画的な照明)`, `anamorphic bokeh(アナモルフィックレンズのボケ)`, `god rays(神の光)`

これらのコツを掴めば、皆さんの頭の中にあるイメージが、もっともっと豊かに、そして美しく映像として紡ぎ出されていきます!
参考:さらに詳しいプロンプトガイド
https://www.instasd.com/post/wan2-2-whats-new-and-how-to-write-killer-prompts

既存資産の活用:LoRAとの互換性
既存の「LoRA」資産が活きる
なんとWan2.2は、前のバージョン「Wan2.1」用に作られたLoRAとの互換性があるそうなんです!今まで丹精込めて育ててきた、皆さんだけのオリジナルキャラクターや、こだわりの画風を学習させたLoRAを、そのまま最新の動画生成で使えるなんて⋯!これはクリエイターにとって、最高に嬉しいポイントですよね!
参考:Wan2.1 LoRAとの後方互換性に関する言及

注意点・制限事項
ここで、いくつか知っておいてほしい注意点もお伝えします!
商用利用について
商用利用はOK?
はい!『Wan2.2』は 「Apache-2.0ライセンス」 なので、ライセンスのルール(クレジット表記など)を守れば、 商用利用も可能 です!これは本当に大きいですね⋯!自分の作品を販売したり、お仕事で活用したりする道も開かれています!

システム要件について
VRAM 8GBは万能?
「VRAM 8GBでも動く!」というのは、あくまで 「5Bモデル」でComfyUIの「オートオフロード機能」を使うなど、特定の条件下での可能性 です。
参考:VRAM 8GBでの動作可能性に関するReddit投稿
https://www.reddit.com/r/StableDiffusion/comments/1mbf9rz/wan_22_is_live_needs_only_8gb_of_vram/

より高画質な14Bモデルを使ったり、複雑な設定をしたりすると、もちろんもっと多くのVRAMが必要になります。
それでも、工夫次第で幅広い環境で動かせるようになったのは、間違いなく大きな進歩です!ぜひ、ご自身の環境に合わせて色々試してみてください!

おわりに
いかがだったでしょうか!今回は、まとめると AI動画生成が、一部の専門家のものではなく、ついに私たちクリエイター自身の手に渡った、歴史的な革命! ということでした!

1. 【革命的な表現力】 テキスト指示だけで、まるでプロが撮ったような自由自在なカメラワークと、映画級の美しい映像が作れちゃう!
2. 【驚異の手軽さ】 みんな大好きComfyUIに即日対応!しかもVRAM 8GBのPCでも動く可能性があり、導入のハードルが信じられないくらい低い!
3. 【無限の将来性】 高品質を支える「MoE」という賢い技術と、オープンソースで世界中のみんなと進化させていける未来が待っている!
ぜひこの革命の波に乗って、皆さんの素晴らしいアイデアを映像にしてみてください!きっと、想像以上の作品が生まれるはずです!

今回の記事と動画、楽しんでいただけましたか?
さて、今回の記事と動画、いかがでしたでしょうか?「参考になった!」と思っていただけたら、 Note のフォロー・いいね・グッドボタンの3つも是非よろしくお願いします!

Youtubeのほう も、まだの方は チャンネル登録 をしていただけると嬉しいです!
https://www.youtube.com/%40AI-Hakase

海外のAI関連書籍をオーディオブック形式で分かりやすく要約してご紹介
また、最近は、 海外のAI関連書籍をオーディオブック形式で分かりやすく要約してご紹介 しています⋯!「海外の最新トレンドを知りたい!」という方や、「AI技術のマネタイズ方法に興味がある!」という方には、特におすすめの内容です!
最新のAI技術やマネタイズノウハウ を知りたい方は、ぜひこちらのまとめもチェックしてみてください!
https://note.com/ai_hakase/m/m48b2fac7359a

それと、Note掲示板では、 Noteのメンバーシップ の入門者さん限定で、質問対応なども行っています。
https://note.com/ai_hakase/membership/boards

『質問したいNote記事のURL』 を添えていただくと、結構丁寧にご対応しているので、よかったらご利用ください!

なお、 マガジン でもジャンルごとに記事や動画をまとめているので、質問の前にご覧になってからお聞きいただけますと幸いです!
https://note.com/ai_hakase/magazines

それでは、また次回の記事か動画でお会いしましょう!
葉加瀬あいでした!バイバイ!
ComfyUI公式X (Twitter) - Wan2.2サポート発表
🔗:https://x.com/ComfyUI/status/1949802127066628370ハカセ アイ - YouTube動画版 (Note)
🔗:https://note.com/ai_hakaseHugging Face - Wan-AI プロジェクト
🔗:https://huggingface.co/Wan-AIGitHub - Wan-Video/Wan2.2
🔗:https://github.com/Wan-Video/Wan2.2ハカセ アイ (AI-Hakase) - YouTubeチャンネル
🔗:https://www.youtube.com/%40AI-Hakaseハカセ アイ (Note) - マガジン一覧
🔗:https://note.com/ai_hakase/magazinesハカセ アイ (Note) - 海外・バズり本 & オーディオブック
🔗:https://note.com/ai_hakase/m/m48b2fac7359aComfyUIブログ - Wan2.2 Day-0 Support
🔗:https://blog.comfy.org/p/wan22-day-0-support-in-comfyuiComfyUI公式 - Wan2.2 モデル解説 (ComfyUI examples)
🔗:https://comfyanonymous.github.io/ComfyUI_examples/wan22/Instasd.com - Wan2.2 プロンプトガイド
🔗:https://www.instasd.com/post/wan2-2-whats-new-and-how-to-write-killer-promptsReddit - Wan2.2のVRAM 8GB動作について
🔗:https://www.reddit.com/r/StableDiffusion/comments/1mbf9rz/wan_22_is_live_needs_only_8gb_of_vram/Reddit - Wan2.2とLoRAの互換性について
🔗:https://www.reddit.com/r/StableDiffusion/comments/1mbo9sw/psa_wan22_8steps_txt2img_workflow_with/
ここから先は
この記事が気に入ったらチップで応援してみませんか?
