[本物公開!]さようならガチャ地獄:nano-bananaでAIアニメを最速生成をする方法
5分の1の制作時間でクオリティ10倍を狙う nano-banana 最速レポート
正式名称:Gemini 2.5 Preview Image Generation(以下、便宜的に nano-banana と表記)
提供状況:Google AI Studioに登場!!Krea でも利用可能。
更新日:2025-08-26
TL;DR(まず結論)
MVがつくれても本編アニメが難しい最大要因は「一貫性 × カット割り」。
nano-banana は 同一シーンを別アングルで量産し、複数キャラ参照や部分修正(表情・衣装)を高品位のまま、ガチャ最少でこなせるのが圧倒的に強い。
1分=20カットの想定で総制作時間は約 5時間 → 1時間に(ざっくり試算・詳細は本文)。
高品位でガチャ最小というのが最も重要です。まずは比較してみましょう。


どうでしょうか。一目瞭然ですね。ではこれが特に本編アニメにおいてどれだけ重要なのか語りたいと思います。
nano-banana話題だけど、それで何が変わるの?って思う方に伝われば。
1. なぜMV/PVは作れても「本編アニメ」は難しいのか
短尺のMVやPVは「一発絵の強さ」「盛り上がりの瞬間」を切り取る設計で成立します。例えば僕の事例で恐縮ですが、この動画みたいなのは比較的簡単です。よく見てください。同じ人物ほとんど登場しませんw 登場してても細かいところ結構違います。
存在しない架空のアニメ
— yachimat - AI Short Anime (@yachimat_manga) March 16, 2025
「記憶銀行」
記憶を個人から切り離し、知識やスキル、経験を必要とされる人へ融通される時代。
体から離れた記憶が人格を持ち、元の持ち主へと接触しようとする「蝶」と呼ばれる存在が生まれ始めた。… pic.twitter.com/gttvseUY5s
一方で本編アニメは、
同一人物が物語を通じて登場(髪・顔・体格・小物・衣装の一貫性)
空間的整合(位置関係・奥行き・立ち位置の連続)と時間的整合(前後の因果・感情線)
カット割り(フリ→キメ→ウケ/導入→葛藤→解決)で情報や感情を言外に伝達
が不可欠。既存の画像生成では、同じキャラを別アングルや別ショットで破綻なく出すことが難しく、“当たりが出るまでのガチャ”が作業のボトルネックになっていました。
最近ではこの辺のイノベーションが激しく、例えばSeedanceやRunway Alephは救世主的な役割でした。しかし、アニメの絵柄の一貫性、品質という点では妥協せざるを得ないところがありました。
存在しない架空のアニメの1シーン
— yachimat - AI Short Anime (@yachimat_manga) March 26, 2025
「AIの時代が良い時代とは、私は思わない」
GPT4oで向きを変えながらシーンををつくりました。
車の中で右左後ろとアングルを変えるのって今まで本当にしんどかったんですが(しかも複数人)、GPT4oでできるようになりました。… pic.twitter.com/GHxyznRd8Y
コント: 鉄巨人と泥棒とマコーレー・カルキンみたいに不死身な相棒
— yachimat - AI Short Anime (@yachimat_manga) August 15, 2025
HiggsFieldのDraw2Video
Seedance マルチショット
Runway Aleph
を活用して作りました!
音声はGemini 2.5 Pro TTS
それぞれのモデル一長一短あったのでリプ欄に簡単にまとめます pic.twitter.com/sbI1Q0T7qS
2. nano-banana(= Gemini 2.5 Preview Image Generation)の「圧倒的にすごい」三つの柱
2-1. 同じシーンを“別アングル・多様なカメラショット”で出せる
正面→肩越し→サイド→俯瞰→煽り……といった連続ショットを、絵柄とキャラIDを崩さず量産。
カメラワークの設計意図(パン/トラック/ドリーに相当する視点差)を画像段階で先取りでき、後段のI2Vで破綻が少ない。
AIアニメコント: A Girl From Kansai
— yachimat - AI Short Anime (@yachimat_manga) August 21, 2025
nano-banana (画像)
midjourney (動画)
gemini tts(音声)
LMArenaでnano-bananaだったら瞬殺なカット割りが、運悪く全然引けないせいで1時間くらい画像生成してた
nano-bananaちゃんと選んで使えたら制作時間半分以下になる自信ある pic.twitter.com/LlHTcg4WyL
大体いままで元画像から派生させたのってクオリティで一目瞭然だったんですが、nano-bananaはもうどれが元画像かわからないくらいですね pic.twitter.com/ASsco3EzWl
— yachimat - AI Short Anime (@yachimat_manga) August 22, 2025
AIアニメコント: 小人の街の大洪水
— yachimat - AI Short Anime (@yachimat_manga) August 22, 2025
nano-banana
Vidu / Seedance
にじボイス/gemini tts
nano-bananaの綺麗な差分はキーフレームに最適ですね! pic.twitter.com/u7u9a95qu9
2-2. 複数キャラの“同時参照”に強い
A・B・Cの**キャラ参照(身長差/衣装差/小物)**を保ったまま、相互の位置関係を含めたショットを出力しやすい。
会話・対決・並走など対人シーンの整合性が取りやすく、レイアウト修正の手戻りが激減。
この動画は元はそれぞれ一枚絵をnano-bananaに渡して生成してもらいました
AIアニメコント:関西弁翻訳機
— yachimat - AI Short Anime (@yachimat_manga) August 25, 2025
nano-banana
Vidu Q1
Gemini 2.5 Pro TTS
会話劇だと動きも少ないので僕はViduがおすすめ!今やnano-bananaでアングルグリグリ動かせるので、カット数も多くなっても怖くない。Vidu Q1はなんなら元の画像よりも美麗にしてくれたりするのでうれしい。 pic.twitter.com/nbMCeVioK3
AIアニメコント:要件違いの竜殺し
— yachimat - AI Short Anime (@yachimat_manga) August 19, 2025
nano-banana
gemini 2.5 pro tts
HiggsField SeeDance, Hailuo 02
これHiggsFieldがまさかの無制限生成キャンペーン中なので、ほぼ無料でつくりました😀
要件外の難癖でめっちゃ値引き要求してくる商人
みなさん、要件定義はちゃんとやりましょうw pic.twitter.com/9XLoTLQW2X
2-3. 画像の“部分修正”(表情・衣装など)がキレイに通る
「表情だけを変える」「上着だけ差し替える」「髪房の乱れを直す」など、必要最小限の変更が可能。
全面再生成に頼らないので、キャラクターの細部や絵柄を維持したまま、**少ない試行回数(ガチャ)**でゴールに到達しやすい。
表情の変更
すんとした顔(1枚目)
— yachimat - AI Short Anime (@yachimat_manga) August 18, 2025
残りはnano-banana pic.twitter.com/fm4crw0lgT
これをつなげるとこうなります
nano-bananaとgemini ttsで泣いてもらいました。
— yachimat - AI Short Anime (@yachimat_manga) August 18, 2025
元画像はすんとした顔(リプ欄)です😂
すすり泣く声、まぁまぁいいんじゃないでしょうか?
Geminiは演技が大根っぽいのと声がちょっと年齢高めなとこだけ不満🤣
でも感情表現はとても良い pic.twitter.com/N995azkIgd
服装の変更


2-4. 構図を棒人間で指定できる
nano-bananaは3枚画像渡せますが、一枚を棒人間にしてみましょう。いけちゃいます。
nano-bananaもちろん棒人間いけちゃうよねぇ pic.twitter.com/dkcveXd214
— yachimat - AI Short Anime (@yachimat_manga) August 26, 2025
要は:「絵柄を変えず・キャラを壊さず・高品質のまま・ガチャ少なく」——この4点が同時に成立するところが決定的に強い。
3. ざっくり試算:1分(約20カット)を作る場合の時間比較
前提は筆者の実務感覚に近いモデルケースです
1分=20カット
旧来フロー:
原画あたり 平均 4枚の再生成(リロール)
1生成の往復(プロンプト調整+生成+確認+ファイル整理):約 2.5 分
I2Vは 平均 2テイク(生成で約 2.5 分/テイク)
nano-banana フロー:
原画あたり 平均 1.2枚(“1発OKが多い”体感を保守的に平均化)
1生成の往復:約 2.0 分(局所修正が効く分、調整が短い)
I2Vは 平均 2テイク (いや、もっといくよな・・まあでも短いOKテイクとかも含めたらこれくらい)
計算
旧来:
原画:20カット × 4枚 × 2.5分 = 200分(3時間20分)
I2V:20カット × 2テイク × 2.5分 = 100分(1時間40分)
合計 ≈ 300分(約 5時間)
nano-banana:
原画:20カット × 1.2枚 × 1.0分 ≈ 24分
I2V:20カット × 2テイク × 2.5分 = 100分
合計 ≈ 1時間24分
上記はあくまで生成の時間のことを言っています。
結果: 約 5時間 → 1時間24分(△3時間36分 / 70%短縮)。
“当たり前の修正”を部分編集で閉じられることと、別アングルの当たり率が高いことが主因。
4. ワークフローとコツ
ワークフロー:
ChatGPTであらすじを生成(登場人物・舞台・テーマ・感情線を明文化)
あらすじを絵コンテ化(カット表:ショット目的/被写体/アングル/カメラ動作/台詞/小道具/光源)
登場人物(キャラシート)と背景(レイアウト/背景板)を並行生成
絵コンテの各Cutごとのプロンプトを作成し、初回のみベース画像を生成
以降の修正・差分はnano-bananaで部分編集(表情・衣装・小物・ポーズ補正/別アングル量産)
生成と並行して連番整理(乱数・モデルバージョン・約束事・差分履歴の記録)
動画生成(I2V)へ順次投入(得意分野ごとにモデルを使い分け:モーション強/顔保持強など)
破綻箇所のみ部分修正→再I2V、最後にグレーディングで色温度・影方向を整合
動画生成はモデルごとに向き不向きがあるのでこちらを参照してみてください!
コツ(抜粋):
“約束事シート”(髪・小物・衣装・体格・左右情報)を全ショットで共有
段階編集:大幅変更は「髪→衣装→小物」の順で分解
アングル跨ぎは中間アングル(3/4正面など)で橋渡し
背景の固定要素(柱・窓・看板)を最初に定義して空間の座標軸を作る
この辺はどちらかというと映像制作の基礎知識によるものが大きいです。僕のおすすめはこちら!
これは基礎かつ、めっちゃ重要!カメラが下なのか上なのか、人物が右を向いているのか左を向いているのかでどれだけ印象が変わるのか、映像を人間はどう見てしまうのかっていう超重要ポイント。下地としては絶対持っておいたほうがいい知識。AIとの会話もはずむ。
これも必読。上のマスターショットがショットごとの話なら、こちらの富野監督の本は映像全体の流れのような話。まさに今回のnano-bananaで使える教養で、映像という「人の時間を奪ってみさせるもの」を最後まで見させるために、どのようにカットを「繋ぐ」のか。つなぎ方の本。つながるのはどういう時か、つながってないのは?それはなぜそう感じる?
みたいな話のオンパレード!読んでは自分を振り返って「あーできていないなあ」と感慨にふけること請け合いです
マスターショット、富野監督の映像の原則がかなり教養に近いものだとすると、こっちはかなり実践的。具体的なカット割りのパターンがこれでもかってくらい書いてあります。
これ、Kindleになってなかったので僕わざわざ日本帰って書店で買ったんですよ。。思い出深い一冊!買って間違いありませんでした!
9. まとめ
本編アニメを難しくしていた“一貫性 × カット割り”の壁に対し、nano-banana は
別アングル量産、2) 複数キャラ参照、3) 部分修正を高品質&低ガチャで実現。
その結果、1分(20カット)動画で約 70% の時間短縮という実務上のインパクトが見込める。
まずは自分のキャラで3アングル+表情差分から試し、ワークフローに段階導入するのが近道。
僕は確信しています。今回のnano-bananaで一気にAIアニメのストーリーテリング的コンテンツが増えることを。
Sunoのv4.0, 4.5の時にもMVが今後めっちゃふえるだろうなと感じましたが、今回のnano-bananaは僕らがずっと抱えてきた一貫性問題に最終決着をつけに来ているのです。
みんなで面白い物語、僕らにしか語れない物語をガンガンつくっちゃいましょう!!
