同じ「お知らせです」でも、はしゃいで言うのと眠そうに言うのでは、まるで別の場面になる。音声AIのElevenLabsが9月28日に公開した「Eleven v4」は、台本に演じ方を書き込むと、そのとおりに読み上げる。
台本に演出を書き込む
使い方は、読ませたい文の前に角かっこで演出を書くだけだ。ElevenLabsの発表には、[わくわくして、楽しそうに]から始まる夏メニューの告知が載っている。[眠そうな声]で「あと5分」とつぶやき、途中で[あくび]をはさむ例もある。
効果音も角かっこで指定できる。同社は[笑う][小雨][スマホの振動]といった指示を例に挙げ、v4は前の世代より指示に正確に従うとしている。
製品ページには、クイズ番組の例がある。司会が温かい声で最終問題を読み上げ、長い間を置き、ゴングが鳴る。回答者はささやき声で「ベートーヴェンですよね?」と自信なさげに答え、緊張した笑いのあとに「最終回答です」と言う。この作例は、司会と回答者のやりとりを1本の台本で聞かせる。同社によると、v4は場面全体の流れをつかみ、直前のせりふを受けて話す。
編集部が日本語で試した
同社は、v4が90を超える言語で話し、日本語も母語話者のように発音するとしている。編集部は無料プランで、日本語の声を選んで試した。
「みなさん、お知らせです。今週の金曜日から、夏のメニューが始まります」という告知文を、[わくわくして、楽しそうに]と[眠そうな声]で読ませた。AIの声は角かっこの中の指示を読み上げず、本文だけを台本どおりに読んだ。演出も日本語で指示できた。[ひそひそ声で、いたずらっぽく][くすくす笑う]と書くと、画面上でも演出の指示として文字の色が変わった。
使ってわかったのは、冒頭に1回書くだけでは演出が最後まで続かないことだ。[眠そうな声]と書くと、はじめは眠そうでも、文が進むにつれて普通の読み方に戻っていく。1文目は1秒あたり4.3字だった。それが最後の文では6.6字まで速くなり、楽しそうに読ませたときと同じ速さになった。ひそひそ声も、指示が効いたのは最初のほうだけだった。
そこで、[ひそひそ声で]を文ごとに書き直した。すると、最後の文までひそひそ声が続いた。演出は、効かせたい文の頭に毎回書くのがよい。同じ告知文で、英語の[sleepy drowsy voice]を文ごとに書き直しても、最後まで眠そうには聞こえなかった。
店員と客の掛けあいでは、店員の声に[明るく、元気に]「いらっしゃいませ!」と書き、客の声には[迷って]「うーん……」[小声で、恥ずかしそうに]「実は、きのうから三杯食べてるんですよね」と書いた。最後に店員が[笑いをこらえて]「……では、四杯目ですね!」と返す。2つの日本語の声で、3行とも台本どおりに読んだ。
無料で試せる
ElevenLabsの無料プランでは、毎月1万クレジットを使える。読み上げは1文字あたり約1クレジットで、編集部が6回試作して使ったのは約600クレジットだった。無料プランは個人利用に限られる。商用で使うなら月6ドルのプランからになる。
声を付けたあと、商品紹介の映像も作りたいなら、商品ページのURLから紹介動画を作るLaunchVideoのような道具もある。
同社によると、v4では10秒の録音から自分の声を複製できる。複製した声は声色をそのままに、ほかの言語も母語話者のように発音できるという。
出典
- Introducing Eleven v4, our most emotive model(ElevenLabs、2026年9月28日公開、29日更新)
- Eleven v4 and Eleven v4 Turbo Text to Speech models(ElevenLabs、2026年9月29日確認)
- 料金プラン(ElevenLabs、2026年9月29日確認)