こんにちは、健ちゃんです。
先週、AI動画コンテストへ初めて作品を出しました。「空の技(そらのわざ)」という2分7秒の動画です。CryptoNinjaの体術大会で、去年ボロ負けした咲耶が、今年こそハヤテに一矢報いようというストーリーです。
作り終えて、生成した動画を数えてみました。85本作って、本編に残ったのは26本でした。
はっきり没にしたのが50本。残る9本は、判定を保留したまま使いませんでした。捨てた割合は7割です。
結論から言うと、カットを3つ以上つないで1本にするなら、ストーリーボードは必須です。無しで作るのは、お金を捨てるようなものだと思ってください。
今日は、その数字と、僕がどう回したかをお見せしますね。
生成動画は、いまだに7割が捨て札になります
まず、捨てた量を見てください。
水色が本編に残った1本、濃い灰色が没、薄い灰色が保留です。1カットあたり3本作って、2本以上を捨てている計算になります。
生成動画は、昔に比べれば確実に進歩しています。参照画像を渡せば、そこそこ忠実に作ってくれます。それでもこれです。思ったとおりの画は、そう簡単には出ません。
ここで大事なのは、この7割はストーリーボードを使った上での数字だということです。使わずに作っていたら、目も当てられない歩留まりになっていたはずです。10回引いて1本当たる、くらいまで落ちても不思議ではありません。
お金に置き換えると分かりやすいですね。生成に1万円かけていたら、7千円ぶんは捨てているわけです。
もちろん、1カットだけの動画や、その場のノリで作るものにストーリーボードを持ち出すのは過剰でしょう。でも3カット、4カットとつなぐなら話は別です。 10秒の動画でも、4秒のカットが3つ入りますからね。
まず、動画を作りません
では何をするのか。静止画です。 カット割りの絵を、徹底的に作り込みます。
今回の作品は、絵コンテが24枚。1カットに1枚の絵で足りるなら、24枚あればいいことになります。
ところが実際に作った静止画は、223枚でした。
自分でも把握していませんでした。数えてみて「そんなに作っていたのか」と驚いたくらいです。ざっくり1カットあたり10枚。ああでもない、こうでもないと言いながら、一番いいものを選んでいった結果です。
工程はこうなります。
- 脚本を書く
- カットごとの絵コンテを1枚ずつ描く(ストーリーボード)
- 場所ごとに、人のいない背景を作る(背景プレート。17枚)
- その背景の上に、カットの開始と終了のキーフレームを作る(104枚)
- キーフレーム2枚を渡して、動画を生成する
キーフレームというのは、カットの最初の1枚と最後の1枚です。「この絵からこの絵へ動いてください」と渡します。ここが決まっていれば、動画側が発明する余地は減るわけです。
決めカットは、もっと作りました。咲耶が高いところから着地する、あの1枚だけで20〜30枚は生成しています。
画像を9割捨てるほうが、動画を7割捨てるより安い
「静止画を9割捨てる」と聞くと、無駄が多いように思えますよね。僕も最初はそう感じました。
でも、動画を7割捨てるのに比べたら、画像を9割捨てるほうが断然マシです。
理由は2つあります。お金と時間です。
画像生成は、月額のプランに入っていれば実質は無制限に近く回せます。今回もチャット側の画像生成で作りましたが、コストはまったく問題になりませんでした。一方、動画生成は1本ごとにお金がかかります。
時間はもっと違います。動画は1本作るだけで数分かかりますし、できたものを頭から見て確かめる必要もあります。画像なら数十秒で出て、一目で良し悪しが分かるんです。
同じ「捨てる」でも、捨てる場所を前へ持ってくるほど安くなります。 これが今回いちばん体で分かったことでした。
作りたい1カットから、逆算します
もう1つ、ストーリーボードには大きな価値があります。設計できることです。
正直に言うと、僕は最初から2分の物語を作りたかったわけではありません。咲耶が砂煙とともに着地する、あの決めカットが作りたかったんです。
作りたい絵が先にあって、そこへ向かって逆算していきました。どうすればここへ辿り着くのか、その前に何が要るのか。それを静止画の段階で並べて、確かめられます。
いきなり動画から作っていたら、この設計はできません。流れが目で見えるので、迷いなく進められるんですね。
さらに効いたのが、生成AIとストーリーボードの直結でした
ストーリーボードという考え方自体は、昔からあるものです。誰かが最近発明したわけではありません。
ただ、生成AIで作るなら、AIと直結したストーリーボードであることが大事です。
僕が作ったのは、こういう画面です。
「空の技」の1つ目と2つ目のカットを開いたところです。1枚のカードには、次の5つが入っています。
- 絵コンテのパネル(動画ができたら、テイクの動画に差し替わります)
- 何が起きるカットか、どのカメラで撮るか
- 開始状態と終了状態(直前のカットの終わりと、必ず一致させます)
- ネガティブ指定(崩れたら没にする点)
- 採用・検討・没のボタンと、修正コメントの入力欄
大事なのは、やり取りが双方向になっていることです。僕からAIへ投げられて、AIからストーリーボードへ結果が入って、ストーリーボードからまたAIへ渡せます。押した結果はすべて1つのJSONファイルに集まるので、AIはそれを読んで次のテイクを作ってくれます。
生成AIのチャット欄でこれをやろうとすると、効率が上がりません。「カット12はこう、カット13はこう」を会話で回すと、番号と修正内容ですぐ混乱するんですよ。どのテイクが最新かも分からなくなります。この画面から送ったダメ出しは50件になりましたが、1つ残らず、対応した記録とセットで残っています。
静止画が決まってからの動画生成は、超絶楽です
ここまで来ると、あとは楽になります。
僕の場合はClaudeと直結しているので、「ストーリーボードの順に動画を生成してください」の一言で動き始めます。実際には1カットずつ生成して確かめる進め方ですが、やっていることは単純作業です。
時間はかかります。動画の生成そのものが遅いですからね。でも、時間がかかることと、しんどいことは別なんです。淡々と進むだけでした。
肝は、最初の静止画とストーリーを作るところにあります。 ここさえ納得いくまでやれば、後半は流れます。
歩留まりを落としたのは、背景を先に決めなかったからでした
今回、自分でミスったと分かっていることが1つあります。ストーリーボードの背景を間違えたまま、動画を作ってしまったんです。
2つ目のカットで起きました。1つ目のカットと同じ稽古場のはずなのに、建物の配置がまるで違う場所になっていたんです。原因ははっきりしていて、場所の参照画像を渡さずに生成していました。渡さなければ、AIはその場で辻褄の合う背景を作ります。手元に無いものは発明するしかないので、悪気はありません。
そこで手順を変えました。1つ目のカットから人物を消した無人の背景を1枚作り、これを「稽古場の正しい姿」として先に採用します。以後、稽古場が写る生成には毎回この1枚を渡す。
さらに、新しい場所や新しいカメラ位置を使うときは、人を動かす前に背景だけを先に作って、採用を出すようにしました。
さらに、途中から背景を間違えていました。それに気づかず生成を進めてしまったので、10本弱ほど無駄になっています。 これがなければ、もう少し歩留まりを上げられたかもしれません。
それでも崩れるときが、2つあります
静止画を固めても、AIは崩してきます。今回はっきり型が見えたものが2つありました。
1つ目は、元のキャラの姿へ引き戻されることです。
咲耶の頭には、藤色の布のはちまきを巻いています。金属の額当ては着けていません。ところが、生成するとこうなりました。
紋章の入った金属の額当てが生え、布の色まで黒く変わっています。渡した参照画像には、こんなものは1つも写っていません。ハヤテには鷹が勝手に出てきますし、咲耶には頼んでいない荷物が生えました。
なので、実際に崩れた点だけを書いたルールブックを作って、生成のたびに渡しています。「猫耳の内側はグレー。ピンクにしない」といった調子で、事故った箇所だけを並べた1枚です。設定の全量ではありません。長い資料ほど効きが薄まりますし、そのカットに写らないキャラの記述を渡すと、いないはずのキャラが画面に出てくるからです。
2つ目は、指示そのものに無理がある場合です。
さっきの着地のカットは、7テイクかかりました。奥に立つハヤテが日除けのように手をかざすポーズで、その腕が毎回おかしくなったんです。「腕がもげてます」と言っても直りませんでした。
原因は精度ではありませんでした。ハヤテは画面の高さの15%ほどしかない遠景です。そこへ「肘を曲げて顔の前へかざした腕」を描かせていました。指示のほうに無理があったんですね。
そこで、日除けのポーズ自体をやめました。両腕を下ろした後ろ姿へ変えて、上半身を30度ひねる動きを足しています。同じ場所を3回直して直らないなら、疑うのは絵ではなく自分の指示のほうです。
没にした50本を、1本も消しませんでした
最後に、地味ですが効いたことを1つ。
捨てたテイクを、僕は消していません。テイク番号を増やして追加するだけで、上書きも削除もしない運用にしました。それぞれに「なぜ没にしたか」のメモが付いています。ここまでメモを残せたのも、今回作ったストーリーボード添削システムのおかげです。
理由は単純です。生成物は、同じものが二度と出ないからなんです。同じ指示を投げても、同じ絵は返ってきません。消したら復元できません。
僕はこれで一度失敗しています。効果音を作り直したとき、採用済みだった着地音を上書きで消してしまいました。もちろん元には戻せませんでした。
残しておけば、比べられます。判定を保留した9本が手元にあるのも、そのおかげです。
動画が完成したら、そこで過去の生成物は消してしまって構いません。ストレージを無駄に食うこともなくなります。とにかく作業中は、履歴も含めて残しておくのがお勧めです。
まとめ
今日の話を3つにまとめますね。
1つ目。3カット以上つなぐなら、ストーリーボードを使ってください。 10秒の動画でも、カットは3つ入ります。無しで作るのは、生成費を捨てながら進むのと同じです。
2つ目。動画を作る前に、静止画で納得いくまで粘ってください。 画像を10枚作って9枚捨てるほうが、動画を作って捨てまくるより、お金も時間も安く済みます。
3つ目。ストーリーボードは、AIと直結させてください。 採否とダメ出しがその場に残って、AIがそれを読んで次を作る。ここまで来ると、後半は淡々と進みますよ。
コストの読み方も置いておきますね。カット数 × 3倍が、作ることになる動画の本数の目安です。24カットの作品なら、70本前後は生成する前提で見積もってください。
僕は動画の専門家ではありません。それでも、静止画で粘る順番に変えただけで、2分7秒を最後まで作り切れました。次はもっと歩留まりを上げられると思っています。
まずは静止画から、1カットずつ並べてみましょう!
この記事で使った仕組みを、そのままお渡しします
途中でお見せした画面、あれをそのまま無料であなたにお渡しします。
AI動画ストーリーボード添削システムという名前で、無料でお配りします。条件は、僕のメルマガに登録していただくことだけです。
- 1カットに何本テイクがあっても、最新と採否が一目で分かります
- 採否と修正コメントは1つのJSONに集まるので、AIがそのまま読んで次のテイクを作れます
- 曲を置けば、カットの尺だけを鳴らす区間再生が使えます
- Pythonの標準ライブラリだけで動きます。追加のインストールは要りません
ソースごとお渡しします。 AIに頼んで、自分の使いやすいように作り替えてもらって全然構いません。
動画の生成そのものは入っていません。見て、決めて、残すところを担当する道具です。
元エンジニアがAIについて、実践を元に発信しているメルマガです! こちらから登録して、お受け取りください。





