イレブンラボの音声エコシステムがさらに進化: Scribe v2 と イレブンエージェントの表現モードにより、「話す」ことが「表現する」にアップグレードされます。

イレブンラボは音声エコシステムを拡大し続けています。 Scribe v2 音声認識と イレブンエージェントの表現機能が強化されました。 Music v2、Dubbing v2と合わせて、3層の製品構造(創作/会話/API)を同時に強化しました。

Celebrities は音声エコシステムをさらに進化させます: Scribe v2 と Celebrities Expressive Mode、「話す」を「表現する」にアップグレード

イレブンラボは、2026 年も音声エコシステムを進化させ続ける予定です。最新のアップデートは、Scribe v2 音声認識 (STT) と イレブンエージェントの表現モード強化 (Expressive Mode) という 2 つの主要なラインに焦点を当てており、音楽 v2 やダビング v2 などのクリエイティブなマイルストーンに重ねられています。 「AIコミュニケーションプラットフォーム」を掲げる同社は、イレブンクリエイティブ、イレブンエージェント、イレブンAPIの3層構造により、音声を「生成」から「理解・会話」まで進化させている。

  • Scribe v2 (STT): 2026 年 1 日にリリースされ、複数の音声認識ベンチマークで 98% の精度に達し、「音声理解」面でのプラットフォームの欠点を補ったことが公式に発表されました。
  • エージェント向け表現モード: 2026-02 年に導入され、カスタマー サービス/ビジネス音声エージェントが「正しく応答する」だけでなく、口調や感情を表現できるようになり、人間と機械の会話の自然さが向上します。
  • クリエイティブ面での 2 つのマイルストーン: Music v2 と Dubbing v2 は 2026 年 5 月にリリースされ、音楽生成と多言語吹き替え機能が全体的にアップグレードされます。
  • 形成された 3 層の製品構造: イレブンクリエイティブ (作成)、イレブンエージェント (セッション)、およびイレブンAPI (開発者) は、同じ基礎モデルと資産システムを共有します。

バージョンの背景

Celebrities のコア アセットは音声基本モデルであり、テキスト読み上げ、音声合成、音声クローン、ダビング、音楽生成、SFX、画像とビデオなどの機能をカバーします。その音声モデルの系統には、イレブン フラッシュ (75 ミリ秒の超低遅延)、イレブン マルチリンガル v2 (高忠実度)、イレブン v3 (高い表現力)、および Scribe v2 (STT、精度 98%) が含まれます。公式ウェブサイトのアノテーションは、70 以上の言語と 5000 以上のプリセット音声ライブラリをサポートしています。

2026 年のアップデートの主な内容は、「音声生成」と「音声理解」を同じ製品リンクに組み込んで、企業内の複数のサプライヤーの接続によって引き起こされる音色の不一致やデータアイランドの問題を軽減することです。これは、「TTS ツール」から「音声インフラストラクチャ」へのアップグレードにおける重要なステップでもあります。

このバージョンのハイライト

音声理解側: Scribe v2

  • 高精度の文字起こし: 98% の精度を備えた複数のベンチマークが正式に公開され、多言語のシナリオをカバーします。
  • 閉ループ会話のサポート: STT と TTS が連携して、音声エージェントが単なる一方向のブロードキャストではなく、「理解して応答する」という完全な閉ループを実現できるようにします。

セッション側: イレブンエージェント表現モード

  • 感情表現能力: エージェントは状況に応じて口調と感情表現を調整できるため、顧客サービス シナリオでの聞き取りエクスペリエンスが大幅に向上します。
  • ビジネス構成機能: 顧客サービスおよびビジネス プロセスに、構成および監視可能な音声およびテキストの対話エージェントを提供します。

クリエイティブ面: 音楽 v2 と吹き替え v2

  • Music v2: 音楽生成機能が全体的にアップグレードされ、クリエイターのオーディオアセットリンクが完了しました。
  • 吹き替え v2: 多言語吹き替え機能が強化され、映画、テレビ、コンテンツの世界的な配信をサポートします。

開発者にとっての意味

国内の開発者やプロダクトチームにとって、イレブンラボの生態進化には注目すべき点が2つある。まず、Voice Agent はカスタマー サービス、アウトバウンド コール、マーケティングの新しいキャリアになりつつあり、「表現力」が従来の IVR と区別する重要な変数です。Expressive Mode などの機能は、AI カスタマー サービスに対するユーザーの受け入れに直接影響します。第二に、STT + TTS + Agent の統合ソリューションは、音色の一貫性とデータ管理の点で「複数のアセンブリ」よりも多くの利点がありますが、音声データのコンプライアンスとプライバシー要件にも注意を払う必要があります。

比較すると、オープン ソース側の Whisper は、STT で無料のセルフホスティングへの別のパスを提供しますが、イレブンラボの価値は、識別、生成、およびセッションを管理可能なエンタープライズ レベルのサービスにパッケージ化することにあります。どちらも、それぞれ「自己構築データ パイプライン」チームと「クイック起動」チームに適しています。

パスの提案を使用する

  • クリエイター: イレブンクリエイティブから始めて、音声クローン、ダビング、音楽生成を体験し、コンテンツ制作ワークフローを検証します。
  • エンタープライズ カスタマー サービス/アウトバウンド コール: イレブンエージェントの表現モードと監視機能を評価し、小規模なトラフィックでの試験運用後に容量を拡張します。
  • 開発者: Celebrity API を介して TTS/STT/エージェント機能を統合し、7 レベルのサブスクリプション (無料からエンタープライズまで) と使用量クレジットのコスト モデルに焦点を当てます。

追跡する価値のあるルート

  1. Scribe v2 の中国語と方言のカバレッジ: 国内ローカリゼーション シナリオでの多言語転写品質のパフォーマンスを測定しました。
  2. Expressive Mode 実装シナリオ: 顧客サービス、オーディオ コンテンツ、その他のシナリオにおける採用率とユーザー受け入れデータ。
  3. エンタープライズ コンプライアンスとデータ セキュリティ: 中国で使用される音声データのコンプライアンス パスは、国内チームが音声データにアクセスできるかどうかを判断するための重要な前提条件です。
著作権:コンテンツソース イレブンラボ正式リリース 。このプラットフォームは、情報提供と学習交流の目的でコンテンツを編集・整理しています。著作権に関する問題がございましたら、お問い合わせください。

レビュー

  • レビューを読み込み中...