こんにちは、健ちゃんです。
AIにYouTubeのURLを渡したのに、要約が薄い。動画と違う内容が返る。結局、文字起こしをコピーして貼り直している。
そんな経験があるなら、原因はAIの要約力だけではないかもしれません。字幕だけを材料にした要約では、画面にしか出ていない情報を拾えないからです。
すべてのYouTube要約AIが字幕だけを使うわけではありません。今回は、36分22秒のBlender講座を、YouTube自動字幕と、音声・映像の両方を分析するvideo2mdで比べました。
結論は明確です。
- YouTube文字起こしは「何を話したか」を確認するもの
video2mdは「何を話し、画面で何をしたか」を探すもの
video2mdは約74秒で、字幕にはない画面情報を46件抽出しました。
字幕では消えた「レベル1」が残った
対象にしたのは、ふさこさんの「Blenderでキャラクターモデル制作!01|顔のモデリング(前編)」です。
ふさこさんの動画は、僕自身Blenderの勉強で、何度も拝見しています。ありがとうございます!
で、この動画の15分前後で、話者はモデルの表面を滑らかにするSubdivision Surfaceを追加します。
YouTube自動字幕に残ったのは、次の発話です。
サブディビジョンサーフェイスを追加して見てみます。うん、今こんな感じですね。
機能を追加したことは分かります。しかし、設定値は分かりません。
同じ場面をvideo2mdで分析すると、こうなりました。
[15:10] Add ModifierでSubdivision Surface(レベル1)を適用し、曲面状態を確認。
「レベル1」は話者が読み上げていません。Blenderの画面に表示されていた情報です。
字幕だけで要約すると「Subdivision Surfaceを追加した」で終わります。映像まで分析すると「レベル1で追加した」と、再現に必要な情報まで残せます。
36分の動画から、設定と操作を46件拾えた
video2mdはYouTube動画の音声と映像を分析し、概要、画面情報、整形した発話をMarkdownへまとめるCLIツールです。Markdownは、見出しと時刻が付いた検索しやすいテキストファイルです。
今回の結果は次の通りでした。
- 動画の長さ: 36分22秒
- 処理時間: 約74秒(1回の実測)
- 画面情報: 46件
- 整理された発話: 124区間
画面情報には、次の設定や操作が時刻順に残りました。
- 05:37 MeshからCircleを選び、頂点数を8にする
- 08:11 Mirrorモディファイアーを追加し、Clippingを有効にする
- 15:10 Subdivision Surfaceをレベル1で適用する
- 27:34 透視投影へ切り替え、焦点距離を80mmにする
- 30:28 Slide Relaxで頂点の偏りをならす
動画を最初から見直さなくても、Clippingや80mmで検索すれば、必要な場面へ絞り込めます。
出力MarkdownをAIへ渡す具体例
video2mdが作ったMarkdownは、そのままAIチャットへ添付できます。ファイル添付に対応していない場合は、「映像・画面の内容」の部分だけを貼り付けます。
たとえば、次のように頼みます。
添付したMarkdownの「映像・画面の内容」だけを使って、
Blenderの操作と設定値を時刻順に整理してください。
- 表の列は「時刻 / 操作 / 設定値」
- 推測は加えない
- 数値やON/OFFが書かれていない場合は「記載なし」と書く
今回のMarkdownをこの形式で整理すると、次の5件を取り出せます。
| 時刻 | 操作 | 設定値 |
|---|---|---|
| 05:37 | MeshからCircleを追加 | 頂点数8 |
| 08:11 | Mirrorモディファイアーを追加 | Clippingを有効化 |
| 15:10 | Subdivision Surfaceを適用 | レベル1 |
| 27:34 | 透視投影へ切り替え | 焦点距離80mm |
| 30:28 | Slide Relaxで頂点密度を均等化 | Shiftを押しながらストローク |
AIへ任せるのは、video2mdが拾った情報の並べ替えです。元のMarkdownにない手順を考えさせるわけではありません。
これで、36分の動画を見直す前に「どの設定が、何分ごろに出たか」を一覧にできます。ただし、video2mdの時刻は概算で、誤った補正もあります。実際に操作するときは、必要な場面だけ元動画で確認します。
YouTube文字起こしとの違い
video2mdは、YouTube文字起こしの高精度版ではありません。役割が違います。
| 知りたいこと | 適した方法 |
|---|---|
| 実際に何と話したか | YouTube文字起こし |
| 発話の細かな時刻 | YouTube文字起こし |
| 画面に出た設定や操作 | video2md |
| 動画全体の流れと手順 | video2md |
発話だけで内容が伝わる対談やポッドキャストなら、YouTube文字起こしで十分です。
一方、ソフトウェア操作、スライド講義、ゲーム解説、制作工程のように、画面が情報の一部になっている動画では、文字起こしだけでは重要な部分が抜けます。
video2mdにも間違いはある
video2mdの出力を、そのまま正確な記録にはできません。生成AIが内容を読みやすく整えるため、誤った補正も入るからです。
今回、YouTube字幕では正しかった「終わりよければ全て良し」を、video2mdは「割りよければ全て良し」と変えていました。直前までメッシュの「割り」を説明していたため、文脈へ寄せすぎたと考えられます。
時刻も概算です。比較できた44区間では、YouTube字幕とのずれは中央値2.5秒、最大26.0秒でした。
そのため、直接引用、数値、ショートカット、正確な時刻は元動画で確認します。
実務では「探す」と「確認する」を分ける
僕なら次の順で使います。
video2mdで動画全体の流れ、操作、設定値を探す- 必要な場面だけ元動画を再生する
- 引用と正確な時刻は、YouTube文字起こしと元動画で確認する
video2mdに「探す仕事」を任せ、人は見つかった場面だけ確認する。この分担なら、長い動画を全部見直す時間を減らしながら、AIの間違いもそのまま通さずに済みます。
まず1本で、画面情報が何件出るか試す
使用したツールはvideo2mdです。今回は次のように動画単体URLを指定しました。
python3 video2md.py \
"https://www.youtube.com/watch?v=pk8POJpBkVs" \
--lang ja \
-o output
最初からすべての動画へ使う必要はありません。まず操作動画やスライド講義を1本だけ分析し、字幕になかった設定や手順が何件残るかを見てください。
発話だけで足りるならYouTube文字起こし。画面も必要ならvideo2md。この判断ができれば、YouTube要約ツールを次々に試す前に、何が足りないのかを切り分けられます。
※数値は2026年8月28日に1本の動画で取得した結果です。モデルやYouTube自動字幕の更新により、同じ動画でも結果が変わる可能性があります。
