【AI動画の新常識】ついに来た“音”入力。Wan S2V (Sound-to-Video)が、MV制作やリップシンクの概念を根本から変えてしまう件。
どうも皆さん! 葉加瀬あい(ハカセアイ) です!
ということで今回ご紹介するのは、私たちの「声」や「音楽」から、まるで 映画のような映像を自動で生み出す 、とんでもない最新AI技術、 `Wan S2V (Sound-to-Video)` です!

Wan 2.2 Speech-to-Video 14B just landed
— Linoy Tsaban🎗️ (@linoy_tsaban) August 26, 2025
> audio-driven cinematic video generation
> weights & demo on the hub
> apache 2.0 license
+ looks like it could be compatiable with Wan 2.x LoRAs out-of-the-box pic.twitter.com/kqKhfMyZlr
「AIで動画を作る」というと、これまではテキストで指示(プロンプト)を書くのが当たり前でしたよね?
でも、もし…皆さんの ハミングがミュージックビデオ になったり、 読み上げた物語がアニメーション になったり、 ペットの鳴き声から可愛いショートムービー が生まれたりしたら…?
そんな、まるでSF映画のような未来が、もうすぐそこまで来ているんです!

今回の記事を読めば…
「え、喋り声やBGMから、AIが自動で動画を作ってくれるの!?」と驚く、 “音”が映像になる 最新技術の全貌がわかります!
まるでAIが 感情を理解しているかのような、超リアルな表情や口パク の秘密が理解できます!

この革命的技術が オープンソース で登場し、私たちの創作活動をどう変えるのか、その 無限の可能性 に触れることができます!

ということで今回お話しする内容はこんな感じです!
1. 【衝撃】 “音”が主役の新時代!`Wan S2V`が拓く、魔法みたいな動画生成の世界!
2. 【なぜ凄い?】 AIが感情を“聴き取る”!?映画品質を支える`MoE`技術の秘密
3. 【未来はどうなる?】 ComfyUIにも対応?オープンソースが加速させる、これからの動画制作

なお、Youtube では note の内容をAIで動画に変換して公開しているので、まだの方は noteのフォロー や YouTubeのチャンネル登録 もお願いします!
https://www.youtube.com/%40AI-Hakase

今回の内容のフル動画版は、動画のレンダリングが終了し次第、Noteのマガジンにて公開していますので、ぜひご覧ください!
https://note.com/ai_hakase/m/m093618cdf798
それでは、本日もよろしくお願いします!
Wan S2V - すべての声が、ビジョンを見つける場所
`Wan S2V`のティーザーサイトには、こんな素敵な言葉が書かれていました。
「WHERE EVERY VOICE FINDS ITS VISION(すべての声が、そのビジョンを見つける場所)」
まさに、この技術が目指す未来を完璧に表した言葉ですよね!ここからは、その驚くべき技術の秘密に迫っていきましょう!

`S2V`ってなぁに?から始めよう!
まず、`S2V`という言葉、初めて聞いた方も多いかもしれません!
これは `Sound-to-Video` の略で、その名の通り、AIが 「音」を理解して、それに合った映像を自動で生成する 、魔法みたいな技術のことなんです!

これまでのAI動画生成は、テキストで「こんな動画を作って!」とお願いするのが主流でした。でも`S2V`は、もっと直感的!
皆さんが歌った鼻歌 から、オリジナルのミュージックビデオが生まれたり…
読み聞かせした物語の声 から、絵本がアニメーションになったり…
録音した雨の音 から、しっとりとした雰囲気の風景動画が作られたり…
そんな、私たちの想像力をどこまでも広げてくれる、夢の技術なんです!

Wan S2Vの“ここが革命的!”な3つのポイント
`S2V`技術の中でも、今回登場した`Wan S2V`は、まさに革命児!そのすごさを3つのポイントに絞ってご紹介します!

①【映画品質の映像美】
「音から作られる動画って、クオリティはそれなりなんじゃ…?」なんて思ったら、大間違いです!
`Wan S2V`は、`Wan2.2`シリーズが持つ、 照明や構図、色彩に徹底的にこだわった「シネマティックな映像表現」 の能力を、そのまま受け継いでいるんです!

まるでプロの映像クリエイターが音に合わせて作ったかのような、息をのむほど美しい動画が生まれるんですよ…!

②【感情を“聴き取る”表現力】
この技術の本当に恐ろしいところは、ただ音に合わせて口をパクパクさせるだけじゃないんです!

なんと、入力された 音声のトーンや抑揚から、話している人の「感情」までニュアンスを読み取って 、それをキャラクターの表情に反映させることができるんです!

楽しそうな声なら笑顔に、悲しそうな声なら憂いを帯びた表情に…。まるでAIに魂が宿ったかのような、生命感あふれる表現が可能になるんです!

③【賢くて効率的!`MoE`アーキテクチャ】
この驚異的な品質を支えているのが、 `Mixture-of-Experts (MoE)` という、とっても賢いAIの仕組みです!
これを分かりやすく例えるなら、 「動画生成ドリームチーム」 みたいなものなんです!


動画を作るという大変な作業を、 「構成を考えるのが得意な専門家」「キャラクターの動きを描くのが得意な専門家」「背景の細かい部分を仕上げるのが得意な専門家」 といった、それぞれのプロフェッショナルたちが協力して分担作業するんです。
これによって、AI全体の脳みそ(パラメータ)は巨大化させつつも、実際に動かす部分は専門家一人一人なので、計算コストは抑えられるという、まさに一石二鳥の画期的な仕組みなんですね!

【発見!】Wan S2Vの“実力”を示すベンチマーク情報まとめ
「葉加瀬さん、`Wan S2V`がすごいのは分かったけど、具体的にどれくらい凄いの?」
そんな皆さんの疑問にお答えする、具体的な性能データや比較情報も、ちゃんと見つけてきましたよ!

【性能編①】脳みそはケタ違い!140億パラメータの怪物
まずは、このAIの基本的なポテンシャルを示す数字からです!
モデル規模 : 140億パラメータ (14B)
これは、AIがどれだけ多くの知識を学習したかを示す、いわば「脳みその大きさ」みたいなもの!140億というのは、オープンソースの動画生成モデルとしては、まさにトップクラスの規模なんです!
モデルの重さ : 約32GB
これだけ巨大なモデルだからこそ、あの映画品質の映像美が生み出せるんですね…!
対応解-像度 : 480p、720pに対応
情報によると、720pの高画質な動画を、 秒間24フレーム(24fps) という、テレビや映画と同じくらい滑らかな動きで生成できるそうです!AIが作ったとは思えない自然な動きの秘密は、ここにもあるんですね!

【性能編②】ライバルはGoogle!?オープンソースの革命児
他の有名なAIモデルと比べてどうなの?という点も、とっても気になりますよね!

vs Google Veo 3 : なんと、一部のコミュニティでは 「Google Veo 3に匹敵する、初のオープンソースモデルだ!」 とまで言われているんです!これはもう、最大級の賛辞ですよね…!
https://www.reddit.com/r/LocalLLaMA/comments/1n0pkhj/wan_s2v_reelased_1st_opensourced_ai_video/

vs 既存のリップシンク技術 : これまでの「InfiniteTalk」や「LipSync」といった技術と比べても、 性能はさらに進化している と評価されています。

ただ口を動かすだけじゃない、感情表現までできる`Wan S2V`の表現力は、まさに次世代レベルと言えそうですね!

【性能編③】意外と身近?皆さんのPCでも動くかも!
「でも、そんなすごいAI、特別なスーパーコンピューターがないと動かせないんじゃ…?」
そんな心配も、少し和らぐ情報がありました!

動作環境 : なんと、 RTX 4090のような、一般向けの高性能なゲーミングPC でも動かすことができるそうです!

高速化 : ComfyUIのワークフローでは、 たった4ステップ で動画を生成できるものも登場しています!
軽量化版も登場! : さらに嬉しいことに、 GGUF や FP8 といった、AIモデルを軽量化して、VRAM(ビデオメモリ)が少ないPCや、CPUでも動かしやすくするバージョンの開発も進んでいるんです!これなら、もっと多くのクリエイターさんが、この神技術を体験できる未来が近いかもしれません!

参考情報: このモデルの技術的な詳細は、Hugging Faceのページで詳しく解説されています!
https://huggingface.co/Wan-AI/Wan2.2-S2V-14B

【要注意】現在の課題・弱点は…?
もちろん、登場したばかりの`Wan S2V`は、まだ発展途上のダイヤモンドの原石のようなもの。海外の先進的なユーザーさんたちの報告によると、こんな可愛らしい弱点もあるみたいです!
https://www.reddit.com/r/StableDiffusion/comments/1n1r7x9/foar_everywun_frum_boxxy_wan_22_s2v/

一貫性の課題 : 長い動画を生成すると、キャラクターが途中でこっそり 別人に変身しちゃう ことがあるそうです…!AIさん、ちょっと集中力が切れちゃうんでしょうか?可愛いですね!
品質の課題 : なぜか動画の始まりが 「パッ!」と白飛び したみたいになってしまうことがあるとのこと。これも今後のアップデートで改善されそうですね!
指示の理解度 : 口パクや表情の再現は“神レベル”なのですが、「ピースサインをして!」といった、 体全体の複雑な動きの指示は、まだちょっと苦手 みたいです。今はまだ、お顔の表現に全集中!ということなのかもしれません!

【作例紹介】“音”から生まれる、驚きの映像世界
「じゃあ、実際にどんな動画が作れるの?」
皆さんのそんな声が聞こえてきそうです!`Wan S2V`を使って、世界中のクリエイターたちがどんな素晴らしい動画を生み出しているのか、具体的な作例をいくつか見ていきましょう!

①音声とテキストで作る、ファンタジーな世界
`Wan S2V`は、音だけでなく、テキスト(プロンプト)も組み合わせることで、その表現力を最大限に発揮します!
例えば、ファンタジー全開のプロンプトと、軽快な音楽を組み合わせれば…あっという間に、オリジナルのアニメーションのワンシーンが作れちゃうんです!

②実在する街の“音”から、リアルな風景を再構築
`Wan S2V`のすごいところは、キャラクターだけじゃないんです!
「東京の街を歩いている」というプロンプトに、 街の環境音(アンビエントサウンド) を組み合わせることで、まるで本物と見間違うような、リアルな夜の繁華街の映像を生成したクリエイターさんもいるんです!
音の情報が、映像のリアリティをここまで高めてくれるなんて、本当に驚きですよね…!

③AIが歌い出す!?音声クローン技術との融合
さらに、他のAI技術と組み合わせることで、可能性は無限大に広がります!
あるクリエイターさんは、ご自身の声をAIに学習させる 「音声クローン」技術 と`Wan S2V`を組み合わせて、AIが生成したクリスマスアルバムのアートワークが、 ご自身の声で歌い出す という、驚きの動画を制作されていました!

もう、自分が作ったキャラクターに、自分の声で歌ってもらう…なんて夢のようなことが、現実になっているんですね!

おわりに
いかがだったでしょうか!今回は、AI動画生成の常識を塗り替える、まさに“未来”の技術、`Wan S2V`の無限の可能性について、ご紹介しました!

今回のポイントをぎゅぎゅっとまとめると、こういうことでした!
1. `Wan S2V`は、 “音”から“映画”を生み出す 、革命的なAI動画技術!
2. 感情まで読み取る 超リアルな表現力と、 映画品質の映像美 が魅力!
3. オープンソース で公開され、 ComfyUI対応 も進んでおり、未来の可能性は無限大!

テキストだけでなく、「音」という、より直感的で、感情豊かな情報から映像が生まれる…。そんな新しいクリエイティブの時代が、もうすぐそこまで来ているんですね!

皆さんは、この`Wan S2V`の魔法を使って、どんな“音”から動画を作ってみたいですか?
皆さんの大好きな一曲から、どんなミュージックビデオが生まれるでしょう?皆さんの優しい語り声は、どんな物語を紡ぎ出すでしょう?考えるだけで、ワクワクが止まりません!

今回の記事と動画、楽しんでいただけましたか?
さて、今回の記事と動画、いかがでしたでしょうか?「参考になった!」と思っていただけたら、 Note のフォロー・いいね・グッドボタンの3つも是非よろしくお願いします!

Youtubeのほう も、まだの方は チャンネル登録 をしていただけると嬉しいです!
https://www.youtube.com/%40AI-Hakase

また、最近は、 海外のAI関連書籍をオーディオブック形式で分かりやすく要約してご紹介 しています⋯!「海外の最新トレンドを知りたい!」という方や、「AI技術のマネタイズ方法に興味がある!」という方には、特におすすめの内容です!
最新のAI技術やマネタイズノウハウ を知りたい方は、ぜひこちらのまとめもチェックしてみてください!
https://note.com/ai_hakase/m/m48b2fac7359a

なお、 マガジン でもジャンルごとに記事や動画をまとめているので、よかったら見てみてください!
https://note.com/ai_hakase/magazines

それでは、また次回の記事か動画でお会いしましょう!
葉加瀬あいでした!バイバイ!
Ai-Hakaseのnote - これからの動画制作
🔗:https://note.com/ai_hakaseAi-HakaseのYouTubeチャンネル - これからの動画制作
🔗:https://www.youtube.com/%40AI-HakaseAi-Hakaseのnote - マガジン一覧
🔗:https://note.com/ai_hakase/magazinesAi-Hakaseのnote - 海外AI関連書籍オーディオブック
🔗:https://note.com/ai_hakase/m/m48b2fac7359aHugging Face - Wan-AI/Wan2.2-S2V-14B
🔗:https://huggingface.co/Wan-AI/Wan2.2-S2V-14BReddit - Wan S2Vの現在の課題・弱点
🔗:https://www.reddit.com/r/StableDiffusion/comments/1n1r7x9/foar_everywun_frum_boxxy_wan_22_s2v/Reddit - Wan S2V vs Google Veo 3
🔗:https://www.reddit.com/r/LocalLLaMA/comments/1n0pkhj/wan_s2v_reelased_1st_opensourced_ai_video/Reddit - Wan S2Vと音声クローン技術
🔗:https://www.reddit.com/r/StableDiffusion/comments/1n0y94z/tried_making_a_s2v_with_the_new_wan_model_and_my/Reddit - Wan S2Vと街の環境音
🔗:https://www.reddit.com/r/StableDiffusion/comments/1n0pwyg/wan_s2v_outputs_and_early_test_info_reference_code/
ここから先は
この記事が気に入ったらチップで応援してみませんか?
