ElevenLabsは2026年9月28日、テキスト読み上げ用の音声AIモデル「Eleven v4」と、リアルタイム用途向けの低遅延版「Eleven v4 Turbo」を公開しました。どちらも日本語を含む90以上の言語に対応し、ElevenCreative、ElevenAgents、APIで利用できます。
同社によると、v4は話し方の感情や間、文脈をより細かく反映できるようにしたモデルです。一方のv4 Turboは、音声エージェントや対話型サービスでの応答速度を重視しています。
通常版とTurboの違い
主な位置づけは次の通りです。
- Eleven v4(モデルID:eleven_v4):音声品質を優先。ナレーション、オーディオブック、キャラクターボイスなどの制作向け
- Eleven v4 Turbo(モデルID:eleven_v4_turbo):低遅延を優先。音声エージェントやリアルタイムの対話体験向け
ElevenLabsは、Turboの推論遅延を中央値約100ミリ秒、リクエストから音声が聞こえ始めるまでを中央値約150ミリ秒と説明しています。ただし、これは同社が2026年9月にWebSocketストリーミング、同一の台本と標準設定で測定し、ネットワーク遅延を除外した結果です。実際の速度は通信環境やシステム構成によって異なります。

感情や効果音を台本内から指定
v4では、[laughs]、[whispers]、[door slams]のような指示を台本に入れ、感情、話し方、効果音を制御できます。複数話者の会話や、長い音声を分割生成した際の一貫性、同じ部分を再生成したときの声質維持も改善したとしています。
Professional Voice Cloneにも対応し、参照音声とは異なる言語を生成する場合は、元の話者の声の特徴を保ちながら、生成先の言語に自然なアクセントを目指す設計です。日本語も対応言語に含まれます。
一方、公式ドキュメントでは、音声タグの追従は完全ではなく改善中で、モデルの挙動が今後変わる可能性があると説明されています。v4ではStyleとSpeedのスライダー、SSMLは利用できません。
無料プランを含む全プランで利用可能
ElevenLabsの製品ページによると、v4は無料プランを含む全プランで利用できます。無料プランは月1万クレジットで、同社は音声約10分相当の目安を示しています。利用量や商用利用、Professional Voice Cloneなどの条件はプランごとに異なるため、導入前に最新の料金ページを確認する必要があります。
なお、音質、表現力、日本語の自然さ、遅延に関する評価はElevenLabsの説明と測定に基づくもので、当メディアが独自に比較検証したものではありません。
