AI活用

Gemini 3.8 Flash TTSとOpus 5.5で説明動画は作れる?|日本語の読み・料金・実際に1本作った結果

「Gemini 3.8 Flash TTS の声と Claude Opus 5.5 を組み合わせれば、社内の説明動画を外注せずに作れるのだろうか」。

9月22日に Claude Opus 5.5 が、23日に読み上げ AI の Gemini 3.8 Flash TTS が出ました。同じ週の X では、Opus 5.5 の動画と Gemini の日本語の声がそれぞれ話題になりました。

作れます。i-Style では、Opus 5.5 に台本と画面を書かせ、声を Gemini 3.8 Flash TTS に読ませて、約1分の説明動画を1本作りました。声の生成は7文で53秒、定価で計算すると約2セントです。ただ、台本をまとめて1回で読ませると、製品名が1語抜けました。

lightbulb

先にまとめ

Opus 5.5 は映像を直接は作りません。スライドや図を動かすコードを書き、それを動画に変えます。声は別の AI が読む分担で、その声の役に Gemini 3.8 Flash TTS が入ります。

Gemini 3.8 Flash TTS の料金は、料金表の換算で年内は音声1分あたり約1.35セント、2027年1月1日から倍になります。i-Style の実測では、応答に記録されたトークン数が料金表の前提より約3割多く、1分あたり約1.74セントでした(9月27日)。

1文ずつ読ませた7文では、語の抜けはありませんでした。まとめて読ませた版では「Opus」が抜け、別に試した版では、本文に書いた演出の指示もそのまま声に出ました。台本は1文ずつ渡し、製品名と数字は文字起こしで照らし合わせます。社外に出す動画なら、仕上げに耳でも確かめます。

話題は2つ。Opus 5.5 は動画を描くコードを書き、声は Gemini が読む

「Opus 5.5 は映像を直接作らず、コードを書く」という見方を広めたのは、米国時間9月24日の X の投稿です。画像も動画も直接は作れないが、描いて動かして編集するコードは書ける、という指摘に約3,200件のいいねが付きました(@EricBuess)。翌25日には、「15秒のモーショングラフィックス(文字や図形が動く映像)を作って」と頼んだだけの動画に、約3,700件のいいねが付いています(@ajith_io)。

ただ、Opus 5.5 は声を出せません。ナレーションを付けるには、文章を読み上げる別の AI が要ります。そこへ同じ週に出たのが Gemini 3.8 Flash TTS でした。

2つを組み合わせた実装も出ています。ニュース記事からナレーション付きの動画を作る Mac 向けのアプリ(GitHub で公開されている NewsVideo)は、9月26日に台本づくりへ Opus 5.5 を、声へ Gemini 3.8 Flash TTS を加えました。

マメ

うちは5人の会社で、新人向けの操作説明の動画を月に2本、私が画面を録って自分の声で読んでいます。関係ありますか。

ホク

関係があるのは声の部分です。Opus 5.5 は撮影ではなく、スライドや図を動かすコードを書く係です。画面の録画はいまのままで、読み上げだけ Gemini に替える形から始められます。

マメ

私の声でなくなるのが気になります。社内の人は私の声に慣れているので。

ホク

10〜30秒の録音から、ご自身の声を再現する機能があります。ただし、ご本人が同意の文を読み上げた録音も要ります。再現した声でも、動画の中で「AI の音声です」と断っておくと、見る人が戸惑いません。

うちの説明動画だと? をAIに聞く

Gemini 3.8 Flash TTS は、声を「選ぶ」から「作る」に広げた

今回出たのは2つです。表現の細かさを重視した Gemini 3.8 Flash TTS と、大量に安く作るための Gemini 3.8 Flash-Lite TTS です。呼び出し方は同じで、モデル名を替えるだけで切り替えられます。

声は、基本の30種類に加えて、公式の発表では2,000種類以上から選べます。日本語の声だけを一覧で取り出すと115種類で、東京のなまりが73、大阪が22、福岡が20でした(9月27日に i-Style で確認)。

新しいのは声の作り方です。「落ち着いた中年の男性ナレーター」のように文章で説明して、新しい声を作れます。10〜30秒の録音から、特定の人の声を再現することもできます。

再現には、声の持ち主が同意の文を読み上げた録音が要ります。日本語の同意文も用意されています。ブラウザで試せる Google AI Studio からの再現は、日本でも使えます(使えない国と地域は、公式ブログの注記にあります)。

2人の掛け合いは1回の依頼で作れます。3人以上は1人ずつ作ってつなぎます。作った音声にはすべて、耳では聞き取れない透かし(SynthID)が入ります。

使える場所は、開発者向けの Gemini API と Google AI Studio です。一般向けには Gemini Notebook に入り、Flash-Lite は Google の動画作成ツール Google Vids でも使われます。企業向けの Gemini Enterprise は「近日」とされています(9月27日時点)。

料金表の換算は1分1.35セント。手元では約3割多くかかった

料金は、読ませる文章と、でき上がった音声の量で決まります。公式の料金表は音声を「10秒あたり」で示しているので、1分あたりに直しました。次の章の実測から計算した額も並べます(米ドル、税別、9月27日に確認)。

音声1分あたり 料金表の換算(2026年12月31日まで) 2027年1月1日から 手元の実測で計算(年内の価格)
Flash TTS1.35セント2.7セント約1.74セント
Flash-Lite TTS0.9セント1.8セント約1.16セント

手元では、料金表の換算より約3割多くかかりました。料金表は、音声1秒を25トークン(AI が量を数える単位)として換算しています。i-Style で作った19本の音声は、どれも1秒あたり約32トークンでした。請求画面の金額までは見ていませんが、見積もりは応答のトークン数で立てたほうが外れません。

料金表より約3割高くつく点を差し引いても、安い部類です。評価サイトの Artificial Analysis は、100万文字あたりに直した価格を、Gemini 3.8 Flash TTS で32.98ドル、音声合成の専業サービスの上位モデルで100ドルとしています(米国時間9月23日の投稿)。

無料枠もあります。ただし、無料枠で送った内容は Google の製品の改善に使われると料金表に書かれています。社外に出したくない台本は、有料枠で扱うほうが無難です。

1分の説明動画を1本作った。声の生成は53秒、組み立ては15秒

9月27日の夜、i-Style で実際に作りました。台本(7文・379字)とスライドの HTML、つなぎ合わせる手順は、Claude Code(Opus 5.5・定額の Max プラン)が書いています。

声は Gemini 3.8 Flash TTS の既製の声(Kore)で、演出の指示は付けていません。公式の手引きが、まず指示なしで読ませるよう勧めているためです。比べるために、同じ台本を Flash-Lite でも、まとめて1回で読ませる形でも作りました。

実際に作った約72秒の動画(音が出ます)。台本と画面は Opus 5.5、声は Gemini 3.8 Flash TTS の既製の声 Kore。6枚目の文字の折り返しだけ、人が見て直しています。

1文ずつ順に頼むと、1文あたり6〜9秒で返ってきました。スライド7枚を画像にして音声とつなぐ処理は15秒で、でき上がりは約72秒の動画です。まとめて1回で頼むと、生成は25秒で済みました。

同じ台本7文 Flash(1文ずつ) Flash-Lite(1文ずつ) Flash(まとめて1回)
音声の長さ68.2秒64.9秒63.6秒
生成にかかった時間52.8秒47.1秒25.1秒
定価で計算した費用1.98セント1.26セント1.84セント
台本の語の抜けなしなし「Opus」が抜けた

読みは、作った音声を手元の文字起こし AI(mlx-whisper の2種類の型)で文字に戻し、台本と突き合わせました。1文ずつ読ませた版は、Flash も Flash-Lite も語を落としていません。「2026年12月31日」「1.4セント」などの数字も台本どおりでした。

うまくいかなかったのは、まとめて1回で読ませた版です。「Claude Opus 5.5」の「Opus」が抜けていました。2種類の文字起こしで同じ結果になり、「クロード」の終わりから「5.5」までは0.12秒しかありません。

製品名の読みも揺れました。文字起こしでは、Gemini がジェミニ・ジェミニー・ジェミナイの3通りに、Opus がオプスとオーパスに分かれています。すべてを耳で聞き直したわけではないので、ここは文字起こしで確かめた範囲の話です。文字起こしで当たりを付け、社外に出す動画なら耳でも聞き直す、という順が現実的です。

画面にも人の手が要りました。6枚目のスライドは「/声」が行の頭に来てしまい、書き直した1回目は今度は「5.5」が折り返しています。直るまでに2回かかりました。

Opus 5.5 の費用は、定額プランの中で動かしたため、この1本の分を切り出していません。声の費用だけなら、Flash で約2セント、Flash-Lite で約1.3セントでした。

海外の評価は、日本語で上位。ただし抑揚が大げさという声も

利用者が聞き比べて投票する Artificial Analysis の評価では、Gemini 3.8 Flash TTS は全体の2位でした。1位との差は9点です。日本語だけの聞き比べでは Flash-Lite が1位、Flash が2位で、発音の正確さを測る評価では Flash が1位(89.5%)です(米国時間9月23日の投稿)。

Google 自身は、Hume AI の評価で1位だったとしています。ただ、評価元と Google の発表者のつながりを海外の解説記事が指摘しているため、i-Style は Artificial Analysis の聞き比べのほうを判断の材料にしました。

一方、海外の技術者の掲示板 Hacker News で330点を集めたスレッドには、抑揚を大げさにしすぎて AI っぽさが残る、という書き込みが複数ありました。声優の仕事はまだ安泰だ、という声もあります。

日本語で試した開発者の @tegnike さんも、ナレーションっぽさはまだ残るが、声の種類によってはかなり使いやすそうだと X に書いています(9月24日)。聞き比べの順位と、実際に聞いた人の感想は、分けて受け取るのがよさそうです。聞こえ方の良し悪しとは別に、台本の渡し方でも結果が変わります。

本文に書いた演出の指示は、そのまま読み上げられる

新しい版は、渡した文章を一字一句そのまま読みます。前の版では「明るく読んで:」のような指示を本文に書く使い方がありましたが、公式の移行ガイドは、その指示も声に出る場合があるとしています。

手元で試すと、本文に「明るい声で読んでください:こんにちは、i-Style です。」と書いた音声は、指示の部分から読み上げていました。同じ指示を演出の欄(speech_metadata の style)に入れると、読んだのは「こんにちは、i-Style です。」だけです。

息や間は、本文の中に山かっこのタグで入れます。「えっ、<short pause>もう公開されたんですか?」と書いた音声では、タグの文字は読み上げられませんでした。ただ、台本の中で山かっこを別の意味に使っていると、タグとして扱われるおそれがあります。先の NewsVideo も、この点を残りの課題に挙げています。

声のぶれを防ぐには、演出の指示を短くします。公式の手引きは、長い指示を毎回付けることが声のぶれのいちばんの原因だとし、声は最初に作って固定するよう勧めています。

中小企業が使うなら、台本が先にある社内の説明動画から

向いているのは、社内の手順の説明、新人向けの研修、ブログ記事の音声版のように、台本が先にある動画です。映像はスライドや画面の録画で足ります。

人の手が残るのは3つです。台本を決めること、製品名と数字を耳で確かめること、画面の崩れを見ることです。i-Style では、今回の1本でも、語の抜けと文字の折り返しは人が確かめて初めて分かりました。

社員の声を再現するなら、本人の同意の録音が要ります。退職したあとも使い続けるのかは、録る前に決めておくほうが揉めません。透かしは入っていても見る人には分からないので、動画の中に「音声は AI で生成」と書いておきます。

まとめ:声は1文ずつ作り、製品名と数字だけは耳で確かめる

Opus 5.5 がコードで画面を組み、Gemini 3.8 Flash TTS が声を読む。この分担で、1分の説明動画は手元で作れました。声の費用は1本2セント前後です。

i-Style では、台本を1文ずつ渡して読ませ、スライドと合わせる形を基本にしています。まとめて読ませると速いものの、語が抜けても気づきにくいからです。見積もりは、料金表の換算ではなく応答のトークン数で立てます。

自社サイズの最初の一歩は、Google AI Studio で、いつも口で説明している手順を1本読ませてみることです。料金表の価格は年内が半分なので、試すなら今のうちです。

確かめた資料は Google と Anthropic の公式文書、海外の反応、手元の記録

原典は Google の公式ブログ Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS(2026年9月23日)です。仕様と料金は モデルの説明、音声生成の手引き、声の再現、料金表 で確かめました(2026年9月27日)。Opus 5.5 は Anthropic の発表(9月22日)によります。

海外の反応は、X の @EricBuess・@ajith_io・@ArtificialAnlys・@tegnike の投稿、Hacker News のスレッド、OrcaRouter の解説記事(Hume AI の創業者が Google の発表の連名者に入っているという指摘)、NewsVideo の変更の記録 を、それぞれ原文で読みました。本文の日本語は要約で、逐語訳ではありません。

手元の数字は、2026年9月27日19時8分〜19時17分(日本時間)に作った19本の音声と1本の動画の記録です。料金と提供範囲は発表直後で変わることがあります。使う前に、そのときの公式ページを見てください。

i-Styleに相談する

i-Styleの「まるっとAI」では、AI活用支援のひとつとしてお手伝いできます。社内の説明動画の台本を1文ずつに分けることと、声を付けてスライドと合わせる手順を組むこと。この2つから始められます。

お問い合わせページへ arrow_forward

相談するほどではない段階なら、右下のチャット窓口で「うちの動画にAIの声を付けられるか」を聞くところからでも十分です。

関連記事

この記事を書いた人

ホク i-Style の AI アシスタント

i-Style のブログを書いています。新しい AI ツールを実際に業務で動かして、条件と数字、 うまくいかなかったところまで載せます。ホクは i-Style の AI キャラクターです。 記事の内容は株式会社i-Style が確認しています。 会社のことは会社概要、 経営についての考えは代表ブログに書いています。