STUDIO US Community
EDIT YOUR FUTURE
EDIT YOUR FUTURE
  • CATEGORY
  • TOOLS
  • TAGS
TAGS
Claudeで広告動画を作ってみた|10分で完成した30秒動画をプロが本音レビュー
AI

[生成AI]Claudeで広告動画を作ってみた|10分で完成した30秒動画をプロが本音レビュー

ogami

ogami

2026/10/03

動画生成AIが作るのは「素材」まで

動画生成AIが作るのは「素材」まで

今やVeoやKling、Firefly Videoなど、動画生成AIは次々と登場しています。文章を入力するだけで、数秒のリアルな映像を誰でも作れるようになりました。

ただ、動画生成AIが作るのは数秒の「動画素材」です。その素材を並べて構成を組み、ナレーションやBGM、字幕を付けて「伝わる1本」に仕上げる。この動画編集は、今も人間の仕事です。

ところが今回、2026年9月に登場したClaude Opus 5.5に頼んだところ、届いたのは素材ではありませんでした。構成・ナレーション・BGM・字幕・キャラクターまでそろった、30秒の「広告動画」そのものだったのです。

素材を作るAIではなく、完成した広告動画を作ったAI。つまり、これまで人間にしかできなかった動画編集の領域に、AIが一歩踏み込んできたということです。

では、その仕上がりはプロの目から見てどうなのか?映像制作者のリアルな視点でチェックします。

そもそもClaude Opus 5.5とは?

そもそもClaude Opus 5.5とは?

Claude Opus 5.5は、AI企業のAnthropic(アンソロピック)が2026年9月22日に発表したAIモデルです。新しい「Claude 5.5」シリーズの最初のモデルで、Claudeのアプリや、プログラミング向けのClaude Codeなどで使えます。

🧠 性能:多くの作業で、上位モデル「Claude Fable 5.1」と同じレベル
💰 コスト:前のモデル(Opus 5)より約40%安く使える
⚡ 速さ:文章などを出力する速さが、Opus 5より30%以上速い
🛠️ 得意なこと:プログラミング、パソコンの操作、調べ物や資料づくりなどの知的作業

注目したいのは、公式発表で映像制作は得意分野として挙げられていないことです。得意なのは、プログラミングと、自分で段取りを組んで作業を進める力。今回の広告動画は、その力を映像制作に向けた結果と言えます。

✒️一言メモ:ちなみに、Opus 5.5は有料プラン向けのモデルですが、無料版で使えるSonnet 5.5でも動画を作れます。

出した指示(プロンプト)はこれだけ

出した指示はこれだけ

実際に送ったプロンプトは、次のとおりです。

💬 https://studio-us.org/
当スクール(STUDIO US) のサービスを紹介する30秒の広告動画として、信じられないほど魅力的な2Dアニメーションを制作してください。日本語の音声を含めてください。そして私を驚かせてください。人々が想像すらしなかったような、本当に可能な能力を存分に披露してください。必要なAgentや必須のツールはすべてインストールして使用してください。

絵コンテも、使ってほしい素材も、色の指定もしていません。「何を伝えるか」から自分で考えてもらう形です。

完成した30秒の動画

STUDIO US 紹介動画|横型(16:9)

VOICEVOX:春日部つむぎ

STUDIO US 紹介動画|縦型(9:16)

VOICEVOX:春日部つむぎ

驚いたのは、そのスピードです。横型の30秒動画は約10分で完成。さらに縦型への変換は約5分で終わりました。縦型は横型を引き伸ばしたものではなく、文字やキャラクターの配置を縦の画面に合わせて組み直しています。

✍️追加コメント:なお、最初に出力された動画には「修了後」という表現がありましたが、STUDIO USには修了がない(永久に学べる)ので、一度だけ修正を依頼しています。約10分は、最初の動画が完成するまでの時間です。

それでは、先に私が驚いた点からお伝えします。

驚いたのは「細かいところの作り込み」

驚いたのは「細かいところの作り込み」

Claudeの報告によると、この動画は画像や音の素材を使わず、すべてプログラムで作ったそうです。そのうえで、次のような作り込みがされていました。

👄 キャラクターの口が声に合わせて「あ・い・う・え・お」の形に動く
🟡 字幕が話した部分から順に着色される
🌊 画面下のタイムラインに、ナレーションの本物の波形を表示
🎵 テンポ120のBGMを作曲して、カット切り替えと小節に合わせている(いわゆる音ハメ)
⚡ 23.5秒で一瞬すべてを止めて暗くして、24秒でロゴを出す(意図的に溜めを作っている)

口の動きと字幕は、音声合成ソフトから「どの音を何秒に発音したか」のデータを取り出して作ったそうです。Premiereで言えば、リップシンクと字幕のタイミング合わせを全部自動でやったようなものです。その他には、映像制作者として受講期間を示す横のラインが無制限(無限大)とつながる表現は素晴らしいと思いました。

人がやれば何時間もかかる地道な作業を、短いプロンプトだけでここまで仕上げてきた。素直に「すごい!」と思いました。

誤解しないために:Claudeは「動画を生成」していない

誤解しないために:Claudeは「動画を生成」していない

Opus 5.5の発表直後、SNSでは「Opus 5.5がミュージックビデオをワンショットで作った」という投稿が話題になりました。ただ、この話は誤解されやすいので、ここで整理しておきます。元になった公開データを調べた、次の記事がとても参考になります。

参考:https://www.orcarouter.ai/ja/blog/claude-opus-5-5-video-plan-one-shot

ポイントは、Claudeが映像そのもの(ピクセル)を生成しているのではなく、映像を描くプログラムを書いていることです。つまり、VeoやKlingのような「動画生成AI」ではありません。

私が生成した30秒動画も同じ仕組みです。ただし、動画を作るために私が送ったプロンプトは1回だけです。Claudeはその1回の指示から、キャラクター作り・作曲・仕上がりの確認を3つのAIエージェントに分けて進めました。さらに、確認役のエージェントから出た「ナレーションが無音の場面に食い込んでいる」という指摘も、Claudeが自分で直してから書き出しています。

でも、プロの視点で見ると演出はまだまだ

プロの視点で見ると演出はまだまだ

ここからが本題です。「作り込みはすごい!」ですが、広告として人の心を動かせるかと聞かれると、正直まだまだだと感じました。気になった点をいくつか挙げていきます。

① 構成が「特徴を並べただけ」

未経験OK → ソフトの数 → 受講期間 → 仲間の数 → ロゴ。スクールの特徴を順番に並べているだけで、見る人の悩みや気持ちの変化が描かれていません。情報は伝わっても、「自分ごと」として心に残る瞬間がないのです。

② 同じ見せ方のくり返し

大きな文字が1文字ずつ出てくる演出が、ほぼ全部の場面で使われています。最初は目を引きますが、何度も続くと単調になります。どこで強く見せて、どこで引くか。メリハリの設計がありません。

例えばプロの動画編集者であれば、Premiere等で文字の出現タイミングをあえて0.5秒ずらしたり、意図的なタメを作ったりすることで、視聴者の目を引くメリハリを生み出します。

③ 1つの画面に情報を詰め込みすぎて、視線誘導の設計が皆無

広告アニメーションでは、本当に伝えたいポイントにアニメーションを限定して、シームレスにカットを繋げてユーザーを惹きこむ設計が求められます。

一方、Claudeが生成した動画は「なんでも動かせばよい」と思っているとしか思えない情報量で、視線が定まりません。一時停止しないと理解できない量です。何を見せて何を捨てるか、情報の取捨選択はまだ人の方が上手です。

✒️一言メモ:誰に、何を、どう感じてほしいのか。広告で一番大事なこの判断が、今のAIには足りていません。

「できないこと」は正直に教えてくれた

「できないこと」は正直に教えてくれた

一方で、良かった点もあります。完成報告と一緒に、確認してほしいことが届きました。

🔇 音は耳で聞いていない(音量や長さは数値で確認済み)
🎨 ロゴとブランドカラーは公式データが取れず、自分で作ったもの
💬 案件の金額や講師とのチャットは、雰囲気を出すための例
📝 ナレーションの声(VOICEVOX)はクレジット表記が必要

「全部できました」で終わらせず、人が確認すべきところをはっきり伝えてくれる。仕事を任せる相手として、ここは信頼できると感じました。

逆に言えば、音の良し悪しを耳で判断すること、ブランドを守ること、表現が正しいかを確かめることは、人の仕事です。

動画の良し悪しを判断できるのは人。そこに差が出る

動画の良し悪しを判断できるのは人。そこに差が出る

今回の動画を、動画編集を学んだことがない人の視点で見たらどうでしょうか。おそらく「すごい!これで完成だ」と思うはずです。

でも、プロの視点で見ると直すべき点がいくつも見えます。構成、メリハリ、視線誘導、情報の取捨選択。どれも、学んで経験を積まないと気づけないポイントです。「修了」という表現の間違いも、サービスをよく知る人だから見つけられました。

AIを使えば、誰でも10分で動画が作れる時代になりました。だからこそ「動画を作れること」だけでは差がつきません。

差が出るのは、できあがった動画の良し悪しを判断し、良くするために直せるかどうかです。そしてこの判断力は、AIではなく人の側にしか育てられない力です。

まとめ:AI時代こそ「映像の良し悪しを判断する力」が武器になる

今回の検証を整理すると、以下の3つです。

1. リップシンク・字幕・音合わせの作り込みは驚くほど高い。しかも横型は約10分、縦型への変換は約5分はまさに人外のタイムパフォーマンス
2. 構成・メリハリ・視線誘導・情報の取捨選択など、演出はまだまだ
3. 動画の良し悪しを判断できるのは人。最後は人で差が出る

個人的には、量産型のアプリ広告なら、これで十分だと思いました。だからこそ、映像制作、動画編集をしっかり学ばないと淘汰されるという危機感を抱いています。

一方で、私のクライアントからは「AIが作ったと思われると、企業のブランドを損なうのでは?お金をかけていいから、良いものを作ってください」という声がとても増えています。

クライアントワークでは、まだまだ人の力が必要です。そのための高いスキル。そして映像の良し悪しを判断する力が、今後より重要になる。そう実感している今日この頃です。

この記事を書いた人

ogami

ogami

STUDIO US講師。映画撮影→映像制作会社を経てiPhone元年にIT企業に転身しアプリ開発PMを担当。音響・モバイル・ITに明るいフリーの動画制作者。

コメントは受け付けていません。

!JOIN US

TAGS