ブログ/

YouTubeをAIで要約すると「操作手順」が抜ける。video2mdなら解決できる

YouTube動画の画面情報46件をvideo2mdでMarkdown化した結果

こんにちは、健ちゃんです。

AIにYouTubeのURLを渡したのに、要約が薄い。動画と違う内容が返る。結局、文字起こしをコピーして貼り直している。

そんな経験があるなら、原因はAIの要約力だけではないかもしれません。字幕だけを材料にした要約では、画面にしか出ていない情報を拾えないからです。

すべてのYouTube要約AIが字幕だけを使うわけではありません。今回は、36分22秒のBlender講座を、YouTube自動字幕と、音声・映像の両方を分析するvideo2mdで比べました。

結論は明確です。

video2mdは約74秒で、字幕にはない画面情報を46件抽出しました。

字幕では消えた「レベル1」が残った

対象にしたのは、ふさこさんの「Blenderでキャラクターモデル制作!01|顔のモデリング(前編)」です。

ふさこさんの動画は、僕自身Blenderの勉強で、何度も拝見しています。ありがとうございます!

で、この動画の15分前後で、話者はモデルの表面を滑らかにするSubdivision Surfaceを追加します。

YouTube自動字幕に残ったのは、次の発話です。

サブディビジョンサーフェイスを追加して見てみます。うん、今こんな感じですね。

機能を追加したことは分かります。しかし、設定値は分かりません。

同じ場面をvideo2mdで分析すると、こうなりました。

[15:10] Add ModifierでSubdivision Surface(レベル1)を適用し、曲面状態を確認。

「レベル1」は話者が読み上げていません。Blenderの画面に表示されていた情報です。

字幕だけで要約すると「Subdivision Surfaceを追加した」で終わります。映像まで分析すると「レベル1で追加した」と、再現に必要な情報まで残せます。

36分の動画から、設定と操作を46件拾えた

video2mdはYouTube動画の音声と映像を分析し、概要、画面情報、整形した発話をMarkdownへまとめるCLIツールです。Markdownは、見出しと時刻が付いた検索しやすいテキストファイルです。

今回の結果は次の通りでした。

画面情報には、次の設定や操作が時刻順に残りました。

動画を最初から見直さなくても、Clippingや80mmで検索すれば、必要な場面へ絞り込めます。

出力MarkdownをAIへ渡す具体例

video2mdが作ったMarkdownは、そのままAIチャットへ添付できます。ファイル添付に対応していない場合は、「映像・画面の内容」の部分だけを貼り付けます。

たとえば、次のように頼みます。

添付したMarkdownの「映像・画面の内容」だけを使って、
Blenderの操作と設定値を時刻順に整理してください。

- 表の列は「時刻 / 操作 / 設定値」
- 推測は加えない
- 数値やON/OFFが書かれていない場合は「記載なし」と書く

今回のMarkdownをこの形式で整理すると、次の5件を取り出せます。

時刻 操作 設定値
05:37 MeshからCircleを追加 頂点数8
08:11 Mirrorモディファイアーを追加 Clippingを有効化
15:10 Subdivision Surfaceを適用 レベル1
27:34 透視投影へ切り替え 焦点距離80mm
30:28 Slide Relaxで頂点密度を均等化 Shiftを押しながらストローク

AIへ任せるのは、video2mdが拾った情報の並べ替えです。元のMarkdownにない手順を考えさせるわけではありません。

これで、36分の動画を見直す前に「どの設定が、何分ごろに出たか」を一覧にできます。ただし、video2mdの時刻は概算で、誤った補正もあります。実際に操作するときは、必要な場面だけ元動画で確認します。

YouTube文字起こしとの違い

YouTube自動字幕とvideo2mdで残る情報の比較

video2mdは、YouTube文字起こしの高精度版ではありません。役割が違います。

知りたいこと 適した方法
実際に何と話したか YouTube文字起こし
発話の細かな時刻 YouTube文字起こし
画面に出た設定や操作 video2md
動画全体の流れと手順 video2md

発話だけで内容が伝わる対談やポッドキャストなら、YouTube文字起こしで十分です。

一方、ソフトウェア操作、スライド講義、ゲーム解説、制作工程のように、画面が情報の一部になっている動画では、文字起こしだけでは重要な部分が抜けます。

video2mdにも間違いはある

video2mdの出力を、そのまま正確な記録にはできません。生成AIが内容を読みやすく整えるため、誤った補正も入るからです。

今回、YouTube字幕では正しかった「終わりよければ全て良し」を、video2mdは「割りよければ全て良し」と変えていました。直前までメッシュの「割り」を説明していたため、文脈へ寄せすぎたと考えられます。

時刻も概算です。比較できた44区間では、YouTube字幕とのずれは中央値2.5秒、最大26.0秒でした。

そのため、直接引用、数値、ショートカット、正確な時刻は元動画で確認します。

実務では「探す」と「確認する」を分ける

僕なら次の順で使います。

  1. video2mdで動画全体の流れ、操作、設定値を探す
  2. 必要な場面だけ元動画を再生する
  3. 引用と正確な時刻は、YouTube文字起こしと元動画で確認する

video2mdに「探す仕事」を任せ、人は見つかった場面だけ確認する。この分担なら、長い動画を全部見直す時間を減らしながら、AIの間違いもそのまま通さずに済みます。

まず1本で、画面情報が何件出るか試す

使用したツールはvideo2mdです。今回は次のように動画単体URLを指定しました。

python3 video2md.py \
  "https://www.youtube.com/watch?v=pk8POJpBkVs" \
  --lang ja \
  -o output

最初からすべての動画へ使う必要はありません。まず操作動画やスライド講義を1本だけ分析し、字幕になかった設定や手順が何件残るかを見てください。

発話だけで足りるならYouTube文字起こし。画面も必要ならvideo2md。この判断ができれば、YouTube要約ツールを次々に試す前に、何が足りないのかを切り分けられます。


※数値は2026年8月28日に1本の動画で取得した結果です。モデルやYouTube自動字幕の更新により、同じ動画でも結果が変わる可能性があります。

この続きは、メールで。

AIに任せて作り切るための、道具と考え方が届きます。

無料で続きを受け取る →

登録は無料です。いつでも解除できます。

ブログ一覧へ戻る