ディープグラム API

-

Deepgram は、業界をリードする音声 AI API プラットフォームであり、統合された API セットを通じてリアルタイム音声認識 (STT)、テキスト読み上げ (TTS)、音声エージェント オーケストレーション、オーディオ インテリジェンス分析を提供します。 Nova-3 モデルは、300 ミリ秒未満の転写遅延で 50 以上の言語をサポートします。 Flux 会話モデルにはターン検出が組み込まれています。また、Aura-2 TTS 遅延は 200 ミリ秒未満です。このプラットフォームは SOC 2、HIPAA、GDPR 認定を受けており、エンタープライズ レベルの顧客には Twilio、Cloudflare、Sierra などが含まれます。

ディープグラム API 製品インターフェース

Deepgram API の包括的な内訳: 音声 AI インフラストラクチャの統合

コアパラメータと統計

寸法 仕様
製品のポジショニング 統合音声 AI API プラットフォーム (STT/TTS/音声エージェント/オーディオ インテリジェンス)
納品形式 クラウドAPI(パブリッククラウド/プライベートクラウド/セルフホスト)
ベースモデル Nova-3 (ユニバーサル文字起こし、50 以上の言語)、Flux (会話型 STT、10 言語)、Aura-2 (TTS、40 以上の英語音声)
STT 遅延 ライブ ストリーミング <300ms (Nova-3)、Flux 内蔵ターン検出
TTS 遅延 ストリーミング <200ms (Aura-2)
サポートされている言語 STT 50 以上の言語、TTS は主に英語 (複数のアクセントを含む)
セキュリティ コンプライアンス SOC 2 タイプ 1 および 2、HIPAA (署名済み BAA)、GDPR、CCPA、PCI
展開方法 パブリック クラウド API、プライベート クラウド/シングルテナント VPC、ローカル セルフホスティング
GitHub 組織 658 人のフォロワー、115 のリポジトリ、450 個以上のスター (Python SDK)
会社設立 2015 年、本社は米国サンフランシスコ
資金調達状況 2026 年 1 月に 1 億 3,000 万ドルのシリーズ C を完了、評価額は 13 億ドル (ユニコーン)
最新バージョン 2026.07 — Flux 多言語 + 音声エージェント API GA

パラメータの解釈: Deepgram の中核となる競争障壁は 3 つの「統合」に反映されています。統合 API エントランス (単一の音声エージェント API が STT/LLM/TTS を統合します)、統合ストリーミング インフラストラクチャ (STT と TTS が同じストリーミング パイプラインを共有し、ハンドシェイク遅延を削減します)、および統合デプロイメント ソリューション (同じ API をパブリック クラウド、プライベート クラウド、またはローカルで実行できます)。このアーキテクチャ設計により、エンドツーエンドの音声対話のフルリンク遅延を業界で最も低いレベルの 1 つに圧縮することができます。これは、開発者にとって、STT、NLU、TTS の 3 つの独立したシステムを複数のサービス プロバイダー間で接続する必要がないことを意味します。 API Key 1つで音声入力から音声出力まで完了できます。

ユーザーと市場の認識

エンタープライズレベルの顧客範囲: Deepgram の顧客リストは、Twilio (通信インフラストラクチャ)、Cloudflare (エッジ コンピューティング)、Sierra (エンタープライズ AI エージェント)、Cresta (顧客サービス インテリジェンス)、Kore.ai (エンタープライズ ダイアログ AI)、Daily (リアルタイム コミュニケーション フレームワーク)、Vapi (音声エージェント プラットフォーム)、Granola (会議メモ)、Jack in the Box (ファストフード) など、複数の業界の大手企業に及びます。製品ページには、顧客がコンタクト センター、ヘルスケア、メディア、金融サービスなどの分野にまたがっていることが示されています。

開発者コミュニティ: GitHub 組織には 658 人のフォロワーがおり、公式 SDK は Python (星 450 個)、JavaScript/TypeScript (星 268 個)、Go (星 87 個)、.NET (星 53 個)、Java (星 8 個)、Rust (星 66 個) をカバーしています。 Discord や GitHub Discussions でコミュニティが活発に行われており、公式技術ドキュメント API Playground やサンプルコード ライブラリが提供されています。

市場での認知度: 2026 年 1 月に、評価額 13 億米ドルで 1 億 3,000 万米ドルのシリーズ C 資金調達を完了し、有名な投資機関が主導するユニコーン陣営に参入しました。同時期に、OfOne (ドライブインレストラン向けの音声 AI 企業) を買収し、垂直シナリオでの拡大の野心を示しています。 Reuters、SiliconAngle、Forbesなどの業界メディアが報じた。

コストメリット

C サイド/個人開発者

Deepgram は 200 ドルの無料クレジットを提供しており、クレジット カードを拘束せずに登録して使用できます。すべてのパブリック モデル エンドポイントは、無料割り当て内で体験できます。個人の開発者がプロ​​トタイプの検証、小規模な実験、統合の学習を行うのに適しています。

API / 開発者レベル

請求モデルは従量課金制で、年間パッケージの事前購入をサポートしています (成長プラン、最大 20% 割引)。

音声認識 (STT) の価格比較:

モデル 従量課金制 (ストリーミング/分) 増加率 (ストリーミング/分) 従量課金制 (事前録音/時間) 成長 (事前に記録/時間)
フラックス$0.0065/分 $0.0057/分 $0.0077/分 $0.0065/分
Flux 多言語対応 $0.0078/分 $0.0068/分 同上 同上
Nova-3 モノリンガル $0.0048/分 $0.0042/分 $0.0077/分 $0.0065/分
Nova-3 多言語 $0.0058/分 $0.0050/分 $0.0092/分 $0.0078/分
カスタム 営業担当者へのお問い合わせ 営業担当者へのお問い合わせ 営業担当者へのお問い合わせ 営業担当者へのお問い合わせ

STT の追加機能: 機密情報の感度解除 (墨消し) $0.0020/分、キーワード強調 (Keyterm Prompting) $0.0013/分、話者分離 (ダイアライゼーション) $0.0020/分。スマート フォーマットは無料で含まれています。

音声合成 (TTS) 価格:

モデル 従量課金制 成長
オーラ2 $0.030/1,000 文字 $0.027/1,000 文字
オーラ1 $0.015/1,000 文字 $0.0135/1,000 文字

音声エージェント API 価格 (すべて込み):

パッケージ 従量課金制 成長
標準 (ディープグラム フルスタック) $0.075/分 ($4.50/時間) $0.068/分
標準 - BYO TTS $0.065/分 $0.051/分
カスタム - BYO LLM + TTS $0.050/分 $0.041/分
上級 $0.163/分 $0.146/分

オーディオ インテリジェンス: 要約生成 $0.0003 ~ $0.0006/1,000 トークン (入力/出力)、トピック検出、センチメント分析、および意図認識が価格に含まれています。

企業/民営化レベル

エンタープライズ バージョンの価格はオンデマンドです。確認については営業チームにお問い合わせください。次の差別化された機能をサポートします: カスタム モデル トレーニング、シングルテナント VPC デプロイ、ローカル セルフホスト、HIPAA BAA 署名、より高い同時実行制限、および排他的な SLA。月平均数万時間以上の音声を使用する高使用率のシナリオでは、エンタープライズ契約では Growth 価格からさらに割引を受けることがよくあります。

隠れたコストのヒント: Deepgram では、無音部分の料金が請求されたり、音声の長さが切り上げられたりすることはありません。実際の有効コストは、元の期間に基づいて予想されるよりも低くなる可能性があります。ただし、追加機能 (感度解除、キーワード強調、話者分離) は個別に課金され、複数の追加機能を組み合わせて使用​​すると、1 回の文字起こしコストが大幅に増加します。

主な機能

  • リアルタイム音声認識 (ストリーミング STT): WebSocket を介してオーディオをストリーミングする Nova-3 モデルは、300 ミリ秒未満の遅延で中間結果を返し、ターンターン検出と自動文セグメンテーションをサポートします。音声アシスタントやオンライン カスタマー サービスなど、低遅延のフィードバックを必要とするリアルタイムの会話シナリオに適しています。

  • 事前に録音されたオーディオの文字起こし (事前に録音された STT): REST API はオーディオ ファイルを送信します (マルチチャネルをサポート)。 Nova-3 は 50 以上の言語をサポートし、バッチ処理速度は競合製品の最大 40 倍です。ポッドキャスティング、会議の録画、コールセンターの品質検査などの非リアルタイムのシナリオに適しています。

  • 会話型音声認識 (Flux): 音声エージェント向けに特別に設計された認識モデルで、VAD (音声アクティビティ検出) の外部コンポーネントに依存せずに、自然な思考の転換検出 (思考終了検出) と割り込み処理 (バージイン) が組み込まれています。 10 言語をサポートし、2026 年 7 月には多言語バージョンが利用可能になります。

  • Text to Speech (Aura-2 TTS): 遅延 200 ミリ秒未満のストリーミング ニューラル ネットワーク音声合成。40 以上の英語音声 (アメリカ、イギリス、オーストラリア、その他のアクセントを含む) を提供し、文脈に応じた発話速度と感情の調整をサポートします。 Deepgram Prompting テクノロジーを使用して、発音スタイルを微調整します。

  • Unified Voice Agent API: 単一の API は STT → LLM オーケストレーション → TTS フルリンクを統合し、BYO LLM (OpenAI、Anthropic など) および BYO TTS をサポートします。組み込みの関数呼び出し、インテント ルーティング、およびセッションでの動的な構成切り替え。固定料金はすべて込みで 1 時間あたり $4.50 です。

  • オーディオ インテリジェント分析: 軽量の特殊モデルに基づいて、概要の生成、感情分析 (3 レベルの単語/文/会話)、意図認識、およびトピック検出を提供します。高価な汎用の大規模言語モデルを呼び出すことなく、会話音声から構造化された洞察を抽出します。

  • 高度な文字起こし機能の強化: 話者の分離 (ダイアライゼーション) により、誰がいつ話したかが自動的にマークされます。句読点/大文字/小文字の自動化/数字の書式設定 (スマート書式設定);キーワードの強化 (Keyterm Prompting) により、特定の分野の用語の認識率と再現率が最大 90% 向上します。機密情報の感度解除 (リダクション) により、社会保障番号やクレジット カード番号などの PII が自動的に削除されます。フィラーワードの転写 (フィラーワード) では、「えー」や「ああ」などの音声記号が保持されます。

エキスパート ビュー: Deepgram の製品ライン間には大きな相乗効果があります。STT の出力は Audio Intelligence への直接入力として使用でき、Audio Intelligence の概要は自動音声レポート生成用の TTS への入力として使用できます。 Voice Agent API は、LLM オーケストレーション層を介して STT と TTS をエンドツーエンドの音声会話パイプラインに接続するため、開発者はストリーミング オーディオの同期、コーデック、接続管理を個別に処理する必要がありません。この「取得、理解、生成」機能により、Deepgram は単なる API のコレクションではなく、完全な音声 AI オペレーティング システムになります。

モデルとバージョンの進化

メインライン リリース

  • 2025.02 — Flux Conversational STT: 方向転換検出が初めて音響モデルに直接組み込まれ、従来の独立した VAD コンポーネントに別れを告げます。英語の単一言語をサポートし、リアルタイム音声エージェントのシナリオを指向しています。
  • 2025.04 — Aura-2 TTS: 第 2 世代のニューラル ネットワーク音声合成モデル、40 以上の英語音声、遅延 <200ms。 Aura-1と比較して、専門用語(医療用語、金融用語)の発音精度、自然さ、処理が大幅に向上しました。
  • 2026.01 — Nova-3 GA: 第 3 世代のユニバーサル転写モデルが正式に市販されています。前世代のNova-2と比べて、固有名詞(商品名、人名、地名など)の認識が大幅に向上しました。 Keyterm Prompting を使用すると、特定の用語の認識精度を 10% から 90% 以上に高めることができます。 50 以上の言語をサポートし、強いノイズ環境での堅牢性が大幅に向上しました。
  • 2026.06 — Flux 多言語 + 音声エージェント API GA: Flux は 10 言語 (英語/スペイン語/ドイツ語/フランス語/ヒンディー語/ロシア語/ポルトガル語/日本語/イタリア語/オランダ語) に拡張されました。 Voice Agent API が正式に商品化され、Deepgram の単一 API からフルスタック音声 AI プラットフォームへの変革における重要なノードを示しています。
  • 2026.07 — 継続的な反復: CLI ツール、セルフホスト型リソース API 仕様、その他のインフラストラクチャは継続的に更新され、GitHub 組織内の 115 のウェアハウスは依然として活発に稼働しています。

候補者の検証

Deepgram はカスタム モデル トレーニング サービスも提供しています。これにより、企業ユーザーは独自のデータ セットに基づいて Nova-3 モデルを微調整し、エッジ シーンの認識精度をさらに向上させることができます。このサービスでは、データ量とシナリオの要件を評価するために営業チームに連絡する必要があります。

技術的な利点

エンドツーエンドの深層学習アーキテクチャ: Deepgram は、2015 年の設立以来、(従来の音響モデル + 言語モデルのパイプラインの代わりに) エンドツーエンドの深層学習を採用しており、単一のディープ ニューラル ネットワークを通じてオーディオ波形からテキストへのマッピングを直接学習します。このアーキテクチャの利点は、従来のパイプラインのモジュール間の情報損失が排除され、モデルが推論のためにコンテキスト情報をより完全に利用できることです。

統合ストリーミング インフラストラクチャ: STT と TTS は同じストリーミング インフラストラクチャ上で実行され、WebSocket 接続管理、オーディオ コーデック、ストリーミング バッファ スケジューリングを共有します。この直接的な効果は、STT が音声をテキスト TTS に変換し、その後応答テキストを音声に変換するときに、途中で異なるサービス間でネットワーク接続を切り替える必要がなくなり、エンドツーエンドの音声通信の遅延が最小限に抑えられることです。

低遅延エンジン: 製品ページには、Nova-3 のリアルタイム文字起こしの中間結果は 300 ミリ秒未満で返され、Aura-2 の最初のオーディオ バイトは 200 ミリ秒未満で到着できると記載されています。測定データ (Phonely CEO のパブリック コメントから) によると、Aura-2 のエンドツーエンド遅延は通常 200 ミリ秒未満であり、他の主流の TTS プロバイダーより 2 ~ 4 倍高速です。この遅延の低さは、音声エージェントのシナリオにとって重要です。人間の耳は 300 ミリ秒を超える遅延を知覚でき、それ以下であれば自然な会話のリズムを実現できます。

特殊なタスク モデルと汎用の大規模モデル: オーディオ インテリジェンス機能は、(汎用の大規模言語モデルではなく) 軽量でタスク固有の小型モデルを使用して、要約、感情、意図、トピックの 4 つの次元でドメイン精度の向上と推論コストの削減を実現します。製品ページでは、これらのモデルがドメインの会話データに基づいて微調整されているため、特定のタスク (顧客サービスの会話の要約など) に対して、同様のコストの汎用 LLM ソリューションよりも正確であることが明らかにされています。

柔軟な導入トポロジ: パブリック クラウド API → プライベート クラウド/シングルテナント VPC → ローカル セルフホスティング。プロトタイプの検証から厳格なコンプライアンス企業まで、すべての導入ニーズをカバーします。セルフホスト型ソリューションは Docker/Kubernetes に基づいており、完全な Helm チャートとデプロイメント スクリプトを提供します (GitHub: self-hosted-resources、39 つ星)。

使い方

登録と API キー

  1. console.deepgram.com にアクセスしてアカウントを登録します。
  2. 登録すると、200 ドルの無料クレジットが獲得できます。クレジット カードをバインドする必要はありません。
  3. コンソールで API キーを作成し、必要な権限 (STT / TTS / エージェント / インテリジェンス) を選択します。
  4. REST API、WebSocket、または公式 SDK を通じてリクエストを開始します。

クイックコールの例

Python: リアルタイム音声認識 (WebSocket):

「」パイソン ディープグラムからディープグラムをインポート 非同期をインポートする

dg_client = Deepgram('')

非同期定義 transcribe_stream():

Nova-3 モデルを使用したリアルタイム ストリーミング文字起こし

接続 = await dg_client.transcription.live(
    {"モデル": "nova-3"、"言語": "en-US"、"smart_format": True}
)
async def on_message(self, result, **kwargs):
    print(result.channel.alternatives[0].transcript)
connection.on("トランスクリプト", on_message)

asyncio.run(transcribe_stream()) 「」

cURL: 事前に録音された音声文字起こし:

「」バッシュ カール -X POST https://api.deepgram.com/v1/listen、model=nova-3&smart_format=true \ -H "認可: トークン " \ -H "コンテンツ タイプ: audio/wav" \ --data-binary @audio.wav 「」

cURL: テキスト読み上げ (Aura-2):

「」バッシュ カール -X POST https://api.deepgram.com/v1/speak、model=aura-2-odysseus-ja \ -H "認可: トークン " \ -H "コンテンツ タイプ: application/json" \ -d '{"text": "こんにちは、Deepgram 音声 AI へようこそ。"}' \ --出力音声.mp3 「」

音声エージェント API 設定: WebSocket 経由で「wss://agent.deepgram.com/agent」に接続し、エージェント設定 (LLM 選択、システム プロンプト ワード TTS 音声) を含む JSON メッセージを送信してセッションを開始します。完全な例については、公式ドキュメント を参照してください。

利用可能な SDK

Deepgram は、Python、JavaScript/TypeScript、Go、.NET、Java の公式 SDK を提供しています (Rust のコミュニティ バージョンも利用可能です)。すべての SDK は github.com/deepgram でオープンソースです。さらに、公式 CLI ツールは、端末からの STT/TTS/オーディオ スマート機能の直接呼び出しをサポートします。

製品の価格設定

有料モデルの概要:

レベル 適用対象 お支払い方法 開始条件
無料割り当て 個人開発者、プロトタイプ検証 $200 ボーナス 登録して入手
従量課金制 中小規模のチーム、成長するアプリケーション 従量課金制、最低使用量なし ボーナスがなくなったら自動的に切り替わります
成長 中程度から高使用量のアプリケーション 年間プランを事前注文 (20% 割引) 年間 4,000 ドル以上
エンタープライズ 大量の使用、コンプライアンス要件、カスタマイズのニーズ 営業担当者へのお問い合わせ 業務確認

無料クレジットの詳細: すべてのパブリック API エンドポイント (STT/TTS/Audio Intelligence/Agent) で 200 ドルのクレジットが利用可能です。未使用のボーナスには有効期限がありません。登録するためにクレジット カードをバインドする必要はありません。

同時実行制限: 従量課金制での STT REST API 50 同時実行 WebSocket 150 同時実行。 TTS 45 同時実行。 Voice Agent 45 の同時実行。これに応じて、Growth パッケージは REST 50、WSS 225、TTS 60、および Agent 60 にアップグレードされます。エンタープライズは、より高い同時実行性をネゴシエートできます。

アプリケーションのシナリオ

  • コンタクト センターとカスタマー サービスの音声 AI: 顧客とエージェントの会話をリアルタイムで文字に起こし、オーディオ インテリジェンスと組み合わせて通話概要を自動的に生成し、顧客の感情を検出し、意図を特定し、トピックごとに分類します。一般的なユーザーには、Stream It、Sharpen、Cresta、Revenue.io などがあります。 検証の焦点: 騒々しいコールセンター環境において、Nova-3 のアクセントとノイズに対する耐性は実際の認識率要件を満たしていますか。 Keyterm Prompt でビジネス固有の語彙をカバーできますか。

  • 音声エージェントと会話型 AI: 音声エージェント API に基づいてエンドツーエンドの音声 AI エージェントを構築します。これは、テイクアウトの注文 (Jack in the Box)、顧客サービス (Sierra、Aircall)、医療予約などのシナリオで使用できます。 Flux に組み込まれた交代検出と割り込み処理により、会話エクスペリエンスが実際の人との対話に近づきます。 検証の焦点: BYO LLM モードでは、LLM の応答遅延がエンドツーエンド遅延のボトルネックになります。 LLM の選択と Deepgram ストリーミング パイプラインの適合性を評価する必要があります。

  • メディア ポッドキャストとビデオ キャプション: 事前に記録された STT の高速バッチ処理機能 (最大 40 倍のリアルタイム レート) を活用して、ポッドキャスト、ビデオ、ライブ ストリームのキャプションと検索インデックスを生成します。話者の分離とインテリジェントなフォーマットと組み合わせることで、手動校正コストが大幅に削減されます。 検証の要点: マルチスピーカーシナリオにおけるダイアライゼーションの精度が製造基準を満たしているかどうか。多言語コンテンツの場合は、ターゲット言語がサポートされているリストに含まれているかどうかを確認する必要があります。

  • 医療臨床文書: HIPAA 準拠の STT API を介して臨床会話のリアルタイムの文字起こしを可能にし、医療用語をサポートし (Keyterm Prompting で強化)、医師の事務処理の負担を軽減します。 Deepgram 製品ページには、獣医学分野の顧客 (Talkatoo) が Nova-3 によって専門用語の認識精度が 10% から 625% に向上したことが示されています。 検証の重要なポイント: BAA に署名する必要があります。中国の医学用語のサポートは独自に検証する必要があります。

  • 音声分析とエンタープライズ インテリジェンス: 顧客サービスの録音、営業電話、会議記録を大規模に分析し、オーディオ インテリジェンスを通じて傾向とパターンを抽出します。汎用 LLM ソリューションと比較して、Deepgram の特化モデルは 10 ~ 100 倍安価で、1 日あたり数百万分レベルの音声分析に適しています。 検証のポイント: 概要/感想/意図の正確さがビジネス上の意思決定のニーズを満たしているか。カスタム分類システムをサポートしているかどうか。

該当する人

  • 音声アプリケーション開発者: 音声アシスタント、音声カスタマー サービス、または会話型 AI 製品を構築するために、低遅延、高精度の STT/TTS API を必要とするバックエンド エンジニア。 Deepgram の SDK は主流の言語をカバーしており、完全なドキュメントがあり、API プレイグラウンドを使用すると効果をすぐに体験できます。 前提条件: REST API または WebSocket プログラミング機能を備えていること。 MVP の検証を完了するには $200 のボーナスで十分です。

  • AI エージェント プラットフォームとフレームワーク: Vapi、Daily (Pipecat)、Cognigy、Kore.ai などのプラットフォーム レベルの製品には、Deepgram の音声機能が独自のプラットフォームのモジュールとして組み込まれています。 Voice Agent API の BYO LLM 機能により、これらのプラットフォームは独自のモデルの選択を保持できます。 前提条件: より高い同時実行性と SLA 保証を実現するには、エンタープライズ グレードの契約が必要です。

  • エンタープライズ コンタクト センターおよびテクニカル リーダー: 顧客サービス システムのアップグレード、通話品質分析、または AI エージェントの導入を担当する意思決定者。 Deepgram の SOC 2/HIPAA/GDPR コンプライアンス システムと Amazon Connect とのネイティブ統合により、企業調達のリスクしきい値が低くなります。 前提条件: プライベート クラウドまたはセルフホスト型の展開では、通常、6 ~ 12 か月の技術評価と PoC サイクルが必要です。

  • 新しいメディアおよびコンテンツ クリエイター: 高頻度の音声テキスト変換ニーズ (ポッドキャストのトランスクリプト、インタビューの編集、ビデオの字幕) を必要とするコンテンツ チーム。事前に録音された STT のバッチ処理機能とスマート フォーマット機能を利用して、数時間分の音声を数分で構造化ドキュメントに変換します。 前提条件: ドッキング ツールまたは自社開発の統合スクリプトが必要です。中国語サポートは Nova-3 Multilingual を通じて利用できますが、精度を測定する必要があります。

  • 群衆には適していません: 非常に低予算で純粋なオフライン一括転写 (ネットワーク依存なし) を必要とするプロジェクト (Whisper などのオープンソース ソリューションを検討することをお勧めします)。中国語音声合成の使用を必要とする高品質の TTS シナリオ (ディープグラムの現在の TTS は主に英語であり、中国語音声のサポートは公開されておらず、公式文書に準拠する必要があります)。ビデオレベルの表現力豊かな感情的なスピーチを必要とするシナリオ (ゲームキャラクターの吹き替え、オーディオブックなど) - Aura-2 は、芸術的なパフォーマンスシーンではなく、プロの対話シーンを目的としています。

概要と展望

Deepgram の中核的な競争力は、「フルスタック音声 AI の統合配信」にあります。これは、これまで一連の API に結合されていた STT、TTS、および NLU の機能を統合し、これに基づいて、低遅延ストリーミング エンジン、特殊なオーディオ インテリジェント モデル、および柔軟な展開オプションを追加します。 2026 年前半の Flux Multilingual および Voice Agent API GA のリリースは、Deepgram の「音声認識 API プロバイダー」から「音声 AI オペレーティング システム プラットフォーム」への移行を示します。

現在の制限と不確実性:

  • TTS の音声の多様性は依然として主に英語です。多言語TTSの適用範囲や適用効果は明ら​​かにされていない。英語以外の市場のお客様は、入手可能かどうかを確認する必要があります。
  • 音声エージェント API の BYO LLM モードでは、エンドツーエンドの遅延は外部 LLM の応答速度によって制限されます。 Deepgram が提示する公式価格 4.50 ドル/時間は、推奨される LLM 構成の使用を前提としています。
  • 中国語などのアジア言語の STT 精度は Nova-3 Multilingual でサポートされていますが、英語に比べて公開されているベンチマーク データが少ないため、潜在的なユーザーは実際のコーパス テストを実施する必要があります。
  • セルフホスト展開のリソース要件 (GPU モデル、推論ノードの数) は公開ページに明確に記載されていません。ハードウェアの推奨事項を入手するには、営業担当者に問い合わせる必要があります。
  • Audio Intelligence の概要/センチメント/インテント モデルは現在、カスタム トレーニングをサポートしていません。企業に高度な垂直分類要件がある場合、追加の手動ルールが必要になる場合があります。

調達および採用のリスク評価:

  • 中小規模のチームの場合は、200 ドルの無料割り当てから始めて、最初にコア シナリオ (STT の精度、TTS の自然さ、エンドツーエンドの遅延) がビジネス ベースラインを満たしているかどうかを確認し、その後、必要に応じて成長プランにアップグレードすることをお勧めします。
  • エンタープライズレベルの調達の場合、PoC を通じて 3 つのことを検証する必要があります。 ① 導入トポロジ (パブリック クラウド、プライベート クラウド、セルフホスト) がコンプライアンス マトリックスを満たしているかどうか。 ② 主要なシナリオ(特に独自の語彙とノイズコンテキスト)の識別精度。 ③ 年間 TCO が予算内であるかどうか (追加機能料金、同時実行のピークコスト、追加サポートの価格を確認)。
  • Deepgram の製品イテレーション リズム (メジャー バージョンで約 2 ~ 3 か月) に注意し、契約にバージョン アップグレードや API 放棄の移行期間条項を含めることをお勧めします。

関連ツール: elevenlabs、udio

バージョン情報

  • Flux 多言語 + 音声エージェント API の一般提供 :Flux Multilingual 多言語会話音声認識モデル (10 言語) を開始、Voice Agent API が正式に商用利用可能 ($4.50/時間)、Aura-2 TTS モデルがオンラインになり、Nova-3 がデフォルトの製品転写モデルになる
  • Nova-3 の一般提供 :Nova-3 モデルが正式リリースされ、固有名詞とノイズの認識精度が大幅に向上、50 以上の言語をサポート、Keyterm Prompting によりキーワード再現率が最大 625% 向上
  • Aura-2 テキスト読み上げの開始 :Aura-2 TTS モデルをリリース、40 以上の英語音声、遅延 200 ミリ秒未満、エンタープライズ レベルの対話シナリオ向けに最適化
  • Flux 会話型 STT の開始 :リアルタイム音声エージェントのシナリオ向けに特別に設計された、ターン検出と割り込み処理が組み込まれた Flux 会話型音声認識モデルをリリース

ユーザーレビュー

  • レビューを読み込み中...