ElevenLabsは2026年9月28日、音声生成モデル「Eleven v4」と、低遅延版「Eleven v4 Turbo」を発表しました。単に文章を読むのではなく、文脈から感情、話す速さ、間、人物像まで読み取り、演技として出力する方向を強めた更新です。[1]
MORIの制作とつながるのは、記事を音声化するだけではありません。短尺動画のナレーション、教材、複数人の会話、将来の音声エージェントまで、同じ声を保ちながら試作しやすくなる可能性があります。
v4の中心は「声の演出を言葉で指示できる」こと
Eleven v4では、[laughs] や [light rain] のようなタグに加え、「怒った調子」「フランス語訛り」といった自然言語の演出指示を使えます。発音記号による固有の読み方も改善したと同社は説明しています。[1]
図1:公式発表を整理したもの。品質や「自然さ」は提供元の評価であり、本記事では音声比較を実行していません。
対応言語はv4ファミリーで90超。日本語を含みます。v3の70超から範囲が広がり、音声クローンは元の話者らしさを保ったまま、別言語では現地のアクセントに寄せる設計です。[1][2]
多話者の場面では、各台詞を別々に読み上げて連結するだけでなく、直前の発言や場面全体を踏まえた応答を生成するとしています。長尺制作では話者の一貫性や、分割生成をつなぐ安定性も改善したという説明です。[1]
高品質版とリアルタイム版を用途で分ける
通常版のEleven v4は、ナレーション、吹替、ゲーム、オーディオブックなど、演出と長さを重視する用途向けです。v4 Turboは音声エージェントなど、返答の速さが必要な用途向けです。
図2:用途と提供開始状況。v4 Turboの約100msはモデル推論の中央値で、通信やアプリ処理を含む利用者の総待ち時間ではありません。[2]
同社ブログでは、v4 Turboの「聞こえ始めるまで」の中央値を約150msと報告しています。競合比較や約75%の盲検選好結果も掲載されていますが、試験設計・集計はElevenLabsの発表に基づく数値です。本記事は独立再現を確認していません。[1]
両モデルはすでにElevenCreative、ElevenAgents、ElevenAPIで利用可能です。[1] UIには月1万クレジットの無料プランがあり、商用利用はStarter以上。料金や利用権は地域・プラン・機能で変わるため、公開用途では現行条件の確認が必要です。[3]
MORIの制作で面白いのは「音声の試作回数」
記事から動画や教材へ展開するとき、人間が毎回録音し直す工程は重くなります。v4が公式説明どおり機能すれば、台本と演出指示を直しながら、同じ声で候補を増やしやすくなります。
図3:導入前に試す場合の提案。MORI本人がEleven v4を使用した結果ではありません。
大切なのは、生成回数だけで判断しないことです。固有名詞の読み、感情の過不足、話者の一貫性、権利・同意、最終的な動画との相性まで確認して、録音より本当に楽になったかを見る必要があります。
特に音声クローンは便利さと権利が隣り合います。本人の許可がない声を使わない、誰の声かを管理する、公開前に人が聞く――この三つは、性能とは別の制作条件です。
まとめ
Eleven v4は、音声AIを「読み上げ装置」から「演出可能な制作役」へ近づける更新です。90超の言語、多話者、声の一貫性、リアルタイム版という組み合わせは、記事・動画・教材・音声エージェントを横断するMORIの制作と相性があります。
一方で、100msや盲検選好の数値は提供元の測定です。実際の日本語、制作時間、修正回数、権利確認まで含め、完成物で判断するのが自然です。
出典
1. ElevenLabs:Introducing Eleven v4, our most emotive model — 2026年9月28日付。発表、機能、提供開始、提供元評価。
2. ElevenLabs Documentation:Models overview — モデルID、対応言語、API、推論遅延の説明。
3. ElevenLabs:Pricing — 2026年9月29日確認。無料枠・商用利用・各プランの現行表示。
確認日:2026年9月29日(日本時間)。一次資料を確認。モデルの実行比較・独立性能検証・導入・課金は未実施。サムネイルはAI生成の概念イラスト、本文図解は編集部作成です。