2026年10月7日

Eleven v4 Turboとは?ElevenLabsの新TTSがリーダーボード首位

室谷室谷代表取締役
Eleven v4 Turbo(イレブン・ブイフォー・ターボ)は、ElevenLabsが発表した音声合成(TTS)モデルで、リアルタイム用途と音声エージェント向けに設計され、中央値で約100msという低い推論レイテンシを実現したのが特徴です。
テキトー教師テキトー教師DotAI 認定講師
しかも今回、ElevenLabsのEleven v4とEleven v4 Turboが、第三者評価機関Artificial Analysisのテキスト読み上げリーダーボードで1位と2位を獲得したと発表されたんですよね。単に新モデルが出たという話じゃないんですよ。
室谷室谷代表取締役
そうなんですよね。ElevenLabsいわく「Eleven v4とEleven v4 TurboがArtificial AnalysisのTTSリーダーボードで1位と2位になった」と。

特にTurboはv4を上回る評価を得ながら、価格は半分という点が強調されています。
テキトー教師テキトー教師DotAI 認定講師
ここで一度、発表の骨格を整理しておきましょう。
  • 発表元: ElevenLabs
  • 対象: Eleven v4 / Eleven v4 Turbo
  • 評価: Artificial AnalysisのTTSリーダーボードで1位・2位
  • Turboの位置づけ: v4の高速・低コスト版
  • 価格: Turboは$40/100万文字、v4は$80/100万文字
室谷室谷代表取締役
この「v4の低遅延版」という位置づけが、今回のニュースの肝なんですよね。MYUUUでも音声まわりは触っているので、リアルタイム性と品質のトレードオフはいつも悩みどころなんです。

Eleven v4 Turboとは?Eleven v4との違いと発表の全貌

Eleven v4 Turbo と Eleven v4 の違い
Eleven v4 Turbo
  • 公式ドキュメントでの説明: リアルタイム音声合成のための最先端モデル
  • モデルID: eleven_v4_turbo
  • v4の表現力を保ちながらリアルタイムに振り切った版
  • 提供チャネル: Text to DialogueのWebSocket経由、ElevenAgentsからも利用可
  • 用途: 会話エージェント、インタラクティブな音声体験などのリアルタイム用途
Eleven v4
  • 公式ドキュメントでの説明: 最も感情豊かで高品質な音声合成モデル
  • モデルID: eleven_v4
  • 台本を俳優が読むように解釈する全く新しいアーキテクチャ
  • 誰が話しているか、何が起きたか、その行がどう響くべきかを理解する設計
  • 提供チャネル: Text to Dialogue API経由
  • 用途: コンテンツ制作、オーディオブック、キャラクターボイスなど品質最優先の用途
テキトー教師テキトー教師DotAI 認定講師
まず基本から。Eleven v4 Turboは、ElevenLabsの公式ドキュメントでは「リアルタイム音声合成のための最先端モデル」と説明されています。

モデルIDはeleven_v4_turboです。
室谷室谷代表取締役
一方のEleven v4は「最も感情豊かで高品質な音声合成モデル」で、モデルIDはeleven_v4。両者は同じ研究・アーキテクチャの系譜にありつつ、用途が分かれているんですよね。
テキトー教師テキトー教師DotAI 認定講師
公式ページの表現を借りると、v4は「台本を俳優が読むように解釈する」全く新しいアーキテクチャで、誰が話しているか、何が起きたか、その行がどう響くべきかを理解する設計です。Turboはその表現力を保ちながら、リアルタイムに振り切った版なんですよ。
室谷室谷代表取締役
提供チャネルも整理しておきたいですね。v4はText to Dialogue API経由で利用でき、TurboはText to DialogueのWebSocket経由、さらにElevenAgentsからも使えるとされています。
テキトー教師テキトー教師DotAI 認定講師
講座でも受講生さんから「結局どっちを使えばいいの?」とよく聞かれるんですが、公式は用途で切り分けています。v4はコンテンツ制作・オーディオブック・キャラクターボイスなど品質最優先の用途、Turboは会話エージェントやインタラクティブな音声体験といったリアルタイム用途です。
室谷室谷代表取締役
ここ、覚え方としてはシンプルで、品質を突き詰めるならv4、会話のテンポを取るならTurbo、という感じです。

Eleven v4 Turboがリーダーボードで1位、Eleven v4は2位——何が評価されたのか

Eleven v4 Turbo vs Eleven v4 のリーダーボード評価
指標Eleven v4 TurboEleven v4他社トップ
Provider Voice Elo1,334(首位)1,321(2位)Qwen-Audio-3.1-TTS-Plus 1,292
Controlled Voice Elo1,173(2位)1,160(3位)Qwen-Audio-3.1-TTS-Plus 1,181(首位)
Pronunciation Robustness90.1%(2位)91.7%(首位)Gemini 3.8 Flash TTS 89.5%
テキトー教師テキトー教師DotAI 認定講師
今回の発表で一番インパクトがあるのが、Artificial Analysisのリーダーボードの数字です。ElevenLabsの公式スレッドで引用されている内容を整理するとこうです。
  • Provider Voice: Eleven v4 TurboはElo 1,334(+19/-19)、1,645回の出現で首位。Eleven v4が1,321、AlibabaのQwen-Audio-3.1-TTS-Plusが1,292、CartesiaのSonic 3.6が1,278
  • カテゴリ別ではCustomer ServiceとEntertainmentで1位、AssistantsとKnowledge Sharingで2位
  • Controlled Voice: Elo 1,173(+15/-15)、1,745回の出現で2位。Qwen-Audio-3.1-TTS-Plusの1,181が首位、Eleven v4が1,160で3位
  • Controlled Voiceの言語別ではアラビア語、ドイツ語、ヒンディー語、英語(UK)で1位
  • Pronunciation Robustness: 90.1%で2位。Eleven v4が91.7%で首位、Gemini 3.8 Flash TTSが89.5%
室谷室谷代表取締役
ここで大事なのは、Turboが「v4より安いのにv4より上」という評価になっている点です。Eloで1,334対1,321。

誤差レンジはありますが、少なくとも同等以上という見え方なんですよね。
テキトー教師テキトー教師DotAI 認定講師
発音の堅牢性ではv4が91.7%でTurboの90.1%を上回っています。つまり全項目でTurboが上というわけではなく、総合的な選好ではTurbo、発音の安定性ではv4、という住み分けが見えるんですよ。
室谷室谷代表取締役
リーダーボードは利用者投票ベースのEloなので、絶対的な品質指標というより「選ばれやすさ」の指標です。そこは冷静に見たほうがいいですよね。
テキトー教師テキトー教師DotAI 認定講師
そうそう。だからこそ、自分の用途の音声で聴き比べるのが結局一番強いんです。

公式もサンプルを公開していますから。

Eleven v4 TurboとEleven v4の性能比較——速度・品質・価格はどう違う

Eleven v4 Turbo と Eleven v4 の性能比較
項目Eleven v4 TurboEleven v4
モデルIDeleven_v4_turboeleven_v4
推論レイテンシ中央値 約100ms資料に記載なし
初回発話まで中央値 約150ms資料に記載なし
生成速度毎秒96文字毎秒84文字
価格$40/100万文字$80/100万文字
用途リアルタイム・エージェントコンテンツ制作・オーディオブック
室谷室谷代表取締役
ここからは数字で比較していきましょう。まず速度です。

ElevenLabsの公式スレッドによると、生成時間あたりの処理量はTurboが毎秒96文字、v4が毎秒84文字、v3が毎秒59文字です。
テキトー教師テキトー教師DotAI 認定講師
レイテンシはどうですか。
室谷室谷代表取締役
公式ページでは、Turboの中央値の推論レイテンシが約100ms、初回発話までの中央値が約150msとされています。比較として、Cartesia Sonic 3.6が262ms、OpenAI GPT-4o mini TTSが814msという数字が示されています。
テキトー教師テキトー教師DotAI 認定講師
150msというのは、会話で「間」として気にならないレベルなんですよ。公式も「150msの中央値で初回発話までの遅延が消え、会話が滑らかに流れる」と説明しています。
室谷室谷代表取締役
価格も整理しておきましょう。Turboが$40/100万文字、v4が$80/100万文字。

つまりTurboはv4の半額です。参考としてSonic 3.6が$49、Gemini 3.8 Flash TTSが$16.49という数字も示されています。
テキトー教師テキトー教師DotAI 認定講師
表にするとこうですね。
項目Eleven v4 TurboEleven v4
モデルIDeleven_v4_turboeleven_v4
推論レイテンシ中央値 約100ms資料に記載なし
初回発話まで中央値 約150ms資料に記載なし
生成速度毎秒96文字毎秒84文字
価格$40/100万文字$80/100万文字
用途リアルタイム・エージェントコンテンツ制作・オーディオブック
室谷室谷代表取締役
こう見ると、Turboは「安くて速い」、v4は「発音の堅牢性など品質面で強い」という構図です。どちらが上というより、目的で選ぶ感じなんですよね。
テキトー教師テキトー教師DotAI 認定講師
公式ドキュメントでも、v4は「ほとんどすべてのケースでv3に対する純粋なアップグレード」とされ、v4への切り替えが強く推奨されています。Turboはその中でリアルタイムに振った選択肢、という整理です。

Eleven v4 Turboの料金と提供状況——日本でいつから使えるか

テキトー教師テキトー教師DotAI 認定講師
料金の話をもう少し実務的に掘りましょう。ElevenLabsの料金ページでは、Freeが$0で月10,000クレジット、Starterが月$1(初月83%オフ、通常$6)、Creatorが月$11(初月50%オフ、通常$22)、Proが月$99、Scaleが月$299、Businessが月$990、Enterpriseがカスタム価格という構成です。
室谷室谷代表取締役
クレジットで見ると、Freeが10k、Starterが30k、Creatorが121k、Proが600k、Scaleが1.8M、Businessが6M。プランが上がるほどクレジットと同時実行数、カスタムボイス枠が増えていく形ですね。
テキトー教師テキトー教師DotAI 認定講師
公式ページには「Creatorプラン以上で、v4に使ったTTSクレジットが最大2倍まで残高から引かれない」という2週間のトライアルも案内されています。ただしこれはWebとモバイルアプリのみと明記されています。
室谷室谷代表取締役
日本で使えるかという点ですが、ElevenLabsのサイトは日本語を含む多言語に対応しており、料金ページも日本語で提供されています。API経由でも利用可能とされています。
テキトー教師テキトー教師DotAI 認定講師
なお、Turboの提供開始日や日本リージョン固有の提供条件については、今回の資料では明らかにされていません。公式のアナウンスを確認するのが確実です。
室谷室谷代表取締役
価格は税抜き表記で、税や手数料が別途かかると公式に注記されています。ここは実務で見積もる時に忘れがちなので注意ですね。

Eleven v4 Turboの使い方・始め方——リアルタイム音声エージェントに向く理由

テキトー教師テキトー教師DotAI 認定講師
使い方の入口を整理しましょう。公式ドキュメントによると、v4はText to Dialogue API、TurboはText to DialogueのWebSocket経由で利用できます。

APIではmodel_idを切り替えるだけでモデルを変更できると説明されています。
室谷室谷代表取締役
コード例も公式に載っています。TypeScript SDKだと、elevenlabs.textToSpeech.convertにボイスIDとテキスト、modelId: 'eleven_v4'を渡す形ですね。
テキトー教師テキトー教師DotAI 認定講師
Turboがリアルタイムに向く理由は、公式ページの説明がわかりやすいです。
  • ストリームイン・ストリームアウト: LLMがテキストを生成するそばから流し込み、文が終わる前に音声が返ってくる
  • 双方向ストリーミング: エージェントのループを前提に設計されている
  • 会話速度での表現力: 相槌、エスカレーション、保留がそれぞれ違う響きになる
  • 全ターンで同じ声: Professional Voice Cloneが両モデルで同じように機能し、通話の最初から最後まで一貫する
室谷室谷代表取締役
この「全ターンで同じ声」は、実際にエージェントを組むとありがたみがわかるやつなんですよね。長い通話で声が揺れると、途端に作り物っぽくなるので。
テキトー教師テキトー教師DotAI 認定講師
公式は「長いインタラクションでも一貫性を保つ」と説明しています。ここがTurboの実用上の売りなんですよ。
室谷室谷代表取締役
あと、公式ページにはSalesforceやAccenture、Rosebud、BeyondWords、Spring Financialといった企業の担当者のコメントが寄せられています。Spring Financialの担当者は「リアルな会話に感じられる速さと品質を両立した最初のモデル」という趣旨のコメントを寄せています。
テキトー教師テキトー教師DotAI 認定講師
導入企業の声が並んでいるのは、エンタープライズ用途を意識している表れですね。

Eleven v4 Turboでできること——対応言語と表現力の進化

室谷室谷代表取締役
対応言語はどうなっていますか。
テキトー教師テキトー教師DotAI 認定講師
公式ドキュメントによると、Eleven v4モデルファミリーは90以上の言語に対応しています。日本語(jpn)も含まれています。

具体的には英語、日本語、中国語(Mandarin)、韓国語、フランス語、ドイツ語、スペイン語、ポルトガル語(ブラジル)、ヒンディー語、アラビア語などが列挙されています。
室谷室谷代表取締役
表現力の面では、音声タグが効くのが特徴です。[whispering]、[shouting]、[laughing]のようなタグで演技を細かく指示できると。

公式は「v3よりタグ列を信頼性高く追従する」と説明しています。
テキトー教師テキトー教師DotAI 認定講師
長尺の継ぎ目もポイントです。Context stitching(コンテキスト・スティッチング)で、どんな長さの台本でもペースと演技が安定し、オーディオブック全体が最初から最後まで一発録りのように聞こえると説明されています。
室谷室谷代表取締役
再生成時の声の揺れ、いわゆるvocal driftも抑えられていると。何度リライトしても同じ話者であり続ける、と公式は書いています。
テキトー教師テキトー教師DotAI 認定講師
音声クローンも進化しています。v3ではProfessional Voice Cloneが非対応だったのが、v4で復活し、モデルの感情表現の幅を全言語で発揮するとされています。

Instant Voice Cloneも精度が大きく向上したと説明されています。
室谷室谷代表取締役
ネイティブアクセントの扱いも面白い変化です。参照ボイスの言語と生成言語が違う場合、v4は参照ボイスのアクセントを持ち越さず、対象言語の流暢で自然な発音を生成すると。
テキトー教師テキトー教師DotAI 認定講師
例として公式は、韓国語話者の声をクローンして英語を生成すると、韓国語なまりの英語ではなく自然な英語が出る、と説明しています。ダビングや多言語コンテンツ、多言語対応の音声エージェントに効く変更なんですよ。
室谷室谷代表取締役
ただし公式は、この挙動をトグル化することを研究中で、現時点ではタイムラインや詳細は明らかにされていないとしています。ここは今後の動きを追いたいところです。
テキトー教師テキトー教師DotAI 認定講師
音声ライブラリは17,500以上のボイスから選べると案内されています。ナレーション、会話、SNS、キャラクター、教育、広告、エンタメ、多言語といったカテゴリに分かれています。
室谷室谷代表取締役
ボイスクローンは10秒の音声から作れるとされています。ボイスデザインは文章で説明して生成、発音辞書はIPA対応で固有名詞や専門用語の読みを定義できると。

よくある質問

テキトー教師テキトー教師DotAI 認定講師
ここからは、よく聞かれるポイントに答える形で整理していきましょう。
室谷室谷代表取締役
まず、Eleven v4 TurboとEleven v4はどちらを選ぶべきか。公式の切り分けは明快で、品質最優先ならv4、リアルタイムやエージェントならTurboです。
テキトー教師テキトー教師DotAI 認定講師
料金はいくらか。Turboが$40/100万文字、v4が$80/100万文字です。

無料プランは月10,000クレジットで個人利用、クレジットカード不要と案内されています。
室谷室谷代表取締役
日本語には対応しているか。はい、Eleven v4モデルファミリーは90以上の言語に対応し、日本語(jpn)も含まれています。

公式ページには「日本語、スペイン語、ポルトガル語のテキストを渡せば、ネイティブアクセントで流暢に話す」と説明されています。
テキトー教師テキトー教師DotAI 認定講師
APIで使えるか。はい、v4はText to Dialogue API、TurboはText to DialogueのWebSocket経由で利用可能とされています。

REST APIやストリーミングエンドポイント、TypeScript・Python SDKも用意されています。
室谷室谷代表取締役
音声エージェントに使えるか。Turboはまさにその用途向けで、双方向ストリーミングと約100msの推論レイテンシ、初回発話まで約150msが特徴です。

ElevenAgentsからも利用できるとされています。
テキトー教師テキトー教師DotAI 認定講師
声質はv3と比べてどうか。公式は「v4はv3に対する純粋なアップグレードで、ほぼすべてのケースで良い結果を出す」としつつ、精度が大きく変わったためv3のほうが好みという場合もあるとして、自分のコンテンツで聴き比べることを勧めています。
室谷室谷代表取締役
長文の文字数制限はあるか。公式のモデル一覧では、Eleven v4は10,000文字の制限と記載されています。
テキトー教師テキトー教師DotAI 認定講師
感情やトーンの制御はできるか。音声タグで演技を指示でき、StabilityとSimilarityの2つの設定で一貫性と参照ボイスへの忠実さを調整できます。

ただしStyleとSpeedのスライダーはv4では使えず、SSMLも非対応と明記されています。
室谷室谷代表取締役
発表時期や日本での提供開始日については、今回の資料では明らかにされていません。公式のアナウンスを確認するのが確実です。
テキトー教師テキトー教師DotAI 認定講師
まとめると、Eleven v4 Turboは「v4の表現力を保ちながら、半額・低遅延でリアルタイムに振った一台」なんですよ。リーダーボード首位という結果も含めて、音声エージェントを組む人にとっては見逃せない発表ですね。
室谷室谷代表取締役
品質と速度のトレードオフに悩んできた人ほど、刺さる内容だと思います。まずは無料枠で自分の用途の音声を聴き比べるのがおすすめです。

Related

関連記事

New Articles

新着記事

ニュース

Anthropicの「Claude Startups」拡大、創業者が使える特典と申請条件

2026年10月7日
室谷テキトー教師
ニュース

ElevenAgents Architectとは?ElevenLabsが発表したAIエージェント改善アシスタント

2026年10月7日
室谷テキトー教師
ニュース

EmbeddingGemma 2とは?Google DeepMindのマルチモーダル埋め込みモデル

2026年10月7日
室谷テキトー教師
ニュース

Replitの「プロジェクト間コンテキスト」とは?複数プロジェクトをまたいでAIが文脈を参照

2026年10月7日
室谷テキトー教師
ニュース

Nano Banana 2.1とは?Googleの最新画像生成モデルを解説

2026年10月7日
室谷テキトー教師
ガイド

Seedance 2.0とは?ByteDanceのAI動画生成の使い方・料金と著作権の注意点

2026年10月7日
室谷テキトー教師
ニュース

OpenAI Web Searchとは?検索APIベンチマーク5位の実力

2026年10月7日
室谷テキトー教師
ニュース

Mistral Large 4とは?1兆パラメータの「Le Chonk」を解説

2026年10月6日
室谷テキトー教師
ガイド

Claude Mythosとは?一般公開されない理由とFable・Opusとの違い

2026年10月6日
室谷テキトー教師
ニュース

Ling 3.1 Flashとは?Ant Groupの560B推論モデルを解説

2026年10月6日
室谷テキトー教師

Join

AIプレナーになる。

入会は審査制です。いまの事業と、AIで何を動かしたいのかを聞かせてください。

参加を申請する