AssemblyAI API
AssemblyAI API
AssemblyAI API のコアパラメータと統計
AssemblyAI は単一のチャット製品やエンドツーエンドのアプリケーションではなく、音声処理の完全なリンクのための REST + WebSocket API コレクションのセットです。その中心的な成果物は、機能数ではなく、文字起こしの精度と処理遅延の間のエンジニアリング バランスです。次の表は、主な製品ラインと仕様をまとめたものです。
| 製品ライン | APIフォーム | コアモデル | 請求単位 | 一般的なレイテンシー |
|---|---|---|---|---|
| 事前録音された音声からテキストへの変換 (事前録音された STT) | REST API(非同期) | ユニバーサル-3.5 プロ、ユニバーサル-2 | 毎時オーディオ | ファイル期間 × ~0.3 ~ 0.5 (リアルタイム係数) |
| リアルタイム音声テキスト変換 (リアルタイム STT) | WebSocket (ストリーミング) | Universal-3.5 Pro リアルタイム、ユニバーサル ストリーミング | WebSocket セッションの継続時間 | 300-800ms 最初の単語 |
| 音声エージェント API | 単一の WebSocket (全二重) | U3.5 Pro リアルタイム + LLM + TTS (カスケード) | 1 分あたりのセッション数 | ~500 ~ 1500 ミリ秒のエンドツーエンド応答 |
| 音声理解 | REST (転写の上にオーバーレイ) | 転写後ベースの独立した分析モデル | 時間単位のオーディオ (追加機能は個数ごとに請求されます) | 文字起こし付きで返却 |
| ガードレール | REST/WebSocket | 独立したモデレーション モデル | 時間単位のオーディオ (追加機能は個数ごとに請求されます) | 転写して返す |
| LLM ゲートウェイ | REST/WebSocket | 25 以上のモデル (OpenAI/Anthropic/Google/Qwen/Kimi) | 100 万あたりのトークン (入力/出力は別) | 選択したモデルによって異なります |
製品の位置付けの境界: AssemblyAI は、エンドツーエンドの顧客サービス システム、記録ハードウェア、NLP トレーニング プラットフォームを提供しません。その値アンカーは、変換レイヤー「オーディオ入力 → 構造化テキスト/インテント/メタデータ」にあります。 「ポッドキャストをテキストに変換してラベルを付ける」というニーズには適しています。エージェントをスケジュールするための完全なカスタマー サービス プラットフォームが必要な場合、それはモジュールの 1 つにすぎません。
コミュニティと業界の状況: 公開情報によると、AssemblyAI は 1,000 万時間以上の音声データを処理し、独立系開発者からフォーチュン 500 企業に至るまでの顧客にサービスを提供しています。同社は2022年にシリーズCの資金調達を完了し、累計資金調達額は1億1,500万米ドルを超える予定だ。投資家には、Insight Partners、Accel などが含まれます。GitHub オープン ソース プロジェクト (Python SDK、Go SDK、サンプル コードなど) には何千ものスターが蓄積されていますが、そのコア モデルの重みはオープンソースではありません。
AssemblyAI API のユーザーと市場の認知度
AssemblyAI の音声 API 市場における地位は、「純粋に学術的なオープンソース モデル (Whisper など)」と「フルスタックのクラウド音声プラットフォーム (Azure Speech、Google Cloud Speech-to-Text など)」の間にあります。競合するのはモデルの数ではなく、「すぐに使える精度 + 開発者エクスペリエンス + コンプライアンスへの対応力」の組み合わせです。
C サイド/独立開発者レベル: 50 ドルの無料クレジットとクレジット カード登録プロセスが不要なため、エクスペリエンスのしきい値が大幅に低くなります。これは、独立した開発者によってポッドキャストの文字起こし、ビデオ字幕の生成、パーソナル音声アシスタントのプロトタイプによく使用されます。 Reddit と Hacker News での AssemblyAI に関する議論は、「API ドキュメントの明瞭さ」と「中国語/多言語の長い音声の正確さ」に焦点を当てています。中国語の複雑な音声シナリオでは、その精度は Alibaba Cloud や Tencent Cloud などのローカル ソリューションにまだ及ばないが、英語シナリオでは業界をリードしているとユーザーが報告しました。
B サイド/エンタープライズ レベル: 医療文字起こしは、AssemblyAI の最も競争力のある垂直シナリオです。 Medical Mode (+$0.15/時間) は、医療用語用に特別に最適化されており、HIPAA BAA (追加料金なし、セールスコミュニケーションに署名する必要なし) と組み合わされているため、遠隔医療や電子医療記録の音声入力などのシナリオに安定して導入できます。カスタマー サービス センター (コンタクト センター) は、2 番目に大きな導入シナリオです。リアルタイム文字起こし + センチメント分析 + コンテンツ レビューの組み合わせにより、エージェント支援、通話品質検査、コンプライアンス監視という 3 つの典型的なニーズがカバーされます。公表されている法人顧客には、多数の大手医療技術企業や外部委託されたカスタマー サービス センターの運営者が含まれます。
競合製品とのポジショニングの違い: Azure Speech と Google Cloud STT は言語のカバー範囲とクラウド ネイティブの統合において利点がありますが、AssemblyAI は「文字起こし + 理解 + レビューを完了する単一の API」のリンク統合においてよりコンパクトです。 Whisper (OpenAI) には、オフライン シナリオとカスタム微調整の自由度がありますが、リアルタイム ストリーミング、スピーカー分離、準拠したバインディングがありません。 AssemblyAI のエントリー ポイントは、クラウド ベンダーよりも音声に重点を置き、オープンソース ソリューションよりも本番環境に対応した、この 2 つの中間にあります。
AssemblyAI API のコスト上の利点
AssemblyAI のコスト構造は、「回線あたりの価格」ではなく「総所有コスト (TCO)」の観点から評価する必要があります。単価は最低ではありませんが、「転記+理解+レビュー+コンプライアンス+運用保守」のパッケージ効果により、特定のシナリオではエンジニアリング統合コストを大幅に削減できます。
価格競争力の階層化: AssemblyAI の価格設定は、「100 万トークンあたり数セント」というビッグモデル時代のロジックに依存せず、「時間ごとの音声ベース」で請求されます。モデルグレードによって価格差が3~10倍あり、追加機能を課金に重畳することで、きめ細かく料金をコントロールできる料金体系となっている。
| 課金アイテム | 米国/EU 価格 (同じ) | 請求手順 |
|---|---|---|
| 録音済み - Universal-3.5 Pro | $0.21/時間 | 複雑なオーディオ、医療、クリティカルな転写に推奨されるフラッグシップモデル |
| 録音済み - Universal-2 | $0.15/時間 | クリアな録音の一括転写に適したユニバーサルモデル、27言語以上対応 |
| ストリーミング - U3.5 Pro リアルタイム | $0.45/時間 | WebSocket セッションの長さによって課金される、主力のリアルタイム文字起こし |
| ストリーミング - ユニバーサル ストリーミング | $0.15/時間 | 低コストのリアルタイム ソリューション。英語または多言語でのみ利用可能 |
| 音声エージェント API | $4.50/時間 ($0.075/分) | エンドツーエンドの音声エージェント (STT+LLM+TTS+オーケストレーション)、すべて込みの価格 |
| 医療モード (追加) | +$0.15/時間 | 医学用語の最適化、転写モデルの上に重ねられます |
| コンテンツモデレーション (ガードレール) | +$0.01~$0.15/時間 | PII テキストの感度を下げる PII オーディオのミュート、ポルノ/暴力的なコンテンツの管理 |
| LLM ゲートウェイ | トークンによる請求 | 入力トークンあたり $0.05 ~ $5.00 の範囲の 25 以上のモデル |
顧客/インディー開発者: 50 ドルの無料クレジットは、中規模のポッドキャスト文字起こしプロジェクト (約 50 ~ 100 時間) には十分です。ただし、ストリーミング課金の落とし穴に注意する必要があります。WebSocket のアイドル時間も課金され、接続を閉じ忘れると、数時間以内に無料割り当てがすべて消費される可能性があります。初回登録にクレジットカードは不要で、無料枠を使い切るとAPI呼び出しが停止されるため、予期せぬ請求が発生することもありません。
開発者/API インテグレーター: コアとなるコスト管理ツールはモデルの選択です。 Universal-2 の精度は、クリアな録音シナリオでは十分です。 Universal-3.5 Pro に切り替えるとコストが 40% 高くなりますが、精度の向上は通常 5 ~ 10% の範囲内です。重要なのは、シーンがその 5 ~ 10% に該当するかどうかです。騒がしく、医療用語が多く、複数の人が重なって話しているようなシナリオの場合、フラッグシップ モデルの追加コストはプラスの ROI をもたらします。キーワード プロンプト (+$0.05/時間) は、モデルをアップグレードせずに特定の用語の認識率を向上させることができ、コスト重視のシナリオでは優先される最適化方法です。
エンタープライズ/コンプライアンス シナリオ: HIPAA BAA および SOC 2 認定は追加費用なしで標準価格に含まれており、医療業界や金融業界は「コンプライアンス プレミアム」を支払う必要がありません。 PCI-DSS 認証は、Voice Agent API 製品に限定されています。マルチチャンネル オーディオの料金はチャンネル数の 2 倍になります。ステレオ ファイル (2 チャンネル) の実際のコストは定価 × 2 です。電話録音を扱う場合は、事前に評価する必要があります (通常は 2 チャンネル: エージェント用に 1 トラック + 顧客用に 1 トラック)。
隠れたコスト: 最大の隠れたコストは API 呼び出し料金ではなく、「モデル選択の間違いによる手戻り」です。公式ドキュメントには、デフォルトのモデル (speech_models パラメータが明示的に設定されていない) が無料アカウントと有料アカウントで異なる可能性があり、デフォルトに依存すると、アップグレード後に文字起こしの動作が突然変異する可能性があることが明確に記載されています。もう 1 つの隠れたコストは、ストリーミング モードで接続を閉じるのを忘れることによって発生する過剰請求です。これは、トークンによって課金される大規模モデル API の慣性とは異なります。チームがその使用に切り替える場合、財務監査プロセスを適応させる必要があります。
AssemblyAI APIの主な機能
AssemblyAI の役割は「機能の数」で勝負するのではなく、「音声入力から構造化出力までの連携の完全性」で壁を築くことです。以下に、コア機能とその適用可能なシナリオを製品ラインごとに分類します。
-
事前に録音された音声をテキストに変換 (事前に録音された STT): オーディオ/ビデオ ファイルのアップロードをサポートし、文字起こし結果を非同期で返します。コアパラメータには、
audio_url(オーディオ ファイルを指す)、speech_models(モデルの選択)、language_code(言語の指定または自動検出) が含まれます。適用可能なシナリオ: ポッドキャストの文字起こし、会議のテキストへの録音、ビデオ字幕の生成、医療ディクテーションの録音。 受け入れに関する懸念事項: 中国語の長い音声 (>60 分) の話者分離精度と用語認識率は、テスト セットで個別に検証する必要があります。 -
リアルタイム STT: WebSocket 経由でオーディオをストリーミングし、テキストの断片 (発話) をリアルタイムで返します。 3 つのリアルタイム モデルとリアルタイム スピーカー ラベリングをサポートします (U3.5 Pro Realtime は、2026 年 3 月からインライン リアルタイム スピーカー分離をサポートします)。適用可能なシナリオ: ライブ字幕、通話のリアルタイム文字起こし、音声エージェントの入力層、会議のリアルタイム録音。 受け入れに関する懸念事項: 弱いネットワーク環境では、最初の単語の遅延 (TTFF) が 2 秒以上に増加する可能性があります。ネットワーク ジッターの影響は、モバイル シナリオで評価する必要があります。
-
Voice Agent API: 2026 年 4 月に正式リリースされ、単一の WebSocket で音声入力→音声出力 (STT → LLM → TTS) を完了します。内蔵のターン検出、割り込み処理、およびツール呼び出し。料金はすべて込みの 4.50 ドル/時間で、請求を管理したり、STT/LLM/TTS の 3 つのプロバイダーの統合を個別に管理する必要がなくなります。該当するシナリオ: 顧客サービス音声ロボット、電話相談の事前スクリーニング、営業アウトバウンド通話資格確認。 コア制限: LLM の選択は、AssemblyAI の LLM ゲートウェイで利用可能なモデル プールによって制限されます。チームが独自の微調整されたモデルにアクセスする必要がある場合は、自己構築リンクを構築する必要があります。
-
音声理解: 話者識別、エンティティ検出 (50 以上のエンティティ タイプ)、感情分析 (段落レベル)、自動章 (非推奨、LLM ゲートウェイへの移行を推奨)、キー フレーズ、トピック検出 (IAB)、翻訳 (100 以上) ターゲット言語)、要約 (要約、非推奨、推奨) を含む分析レイヤーを文字起こし結果の上にオーバーレイします。 LLM ゲートウェイに移行します)。適用シナリオ:カスタマーサービスコール分析(顧客の感情変動点の抽出、高頻度の課題の特定)、営業会議サマリー(議事録やアクションアイテムの自動生成)、メディアコンテンツの二次利用(ポッドキャストから引用可能な断片やトピック分類の抽出)。
-
ガードレール (コンテンツ セキュリティ ガードレール): トランスクリプション レイヤーでセキュリティ監査を同時に実行します。 - PII テキストの感度の解除 (クレジット カード番号、社会保障番号、電話番号などの自動置換)、PII オーディオのサイレンシング (元の録音のビープ音のカバレッジ)、センシティブな単語/違法コンテンツのフィルタリング (冒涜フィルタリング)、ポルノ/暴力/ヘイト スピーチおよびその他の禁止されているコンテンツ監査 (コンテンツ モデレーション)。該当するシナリオ: 未成年者向けの音声アプリケーション、金融顧客サービスの録音コンプライアンス レビュー、パブリック ポッドキャスト コンテンツのフィルタリング。 エキスパート ビュー: ガードレールと文字起こしは、追加のセクションを必要とせず、同じ API 呼び出しで完了します。つまり、「最初に文字起こししてから個別にレビューする」リンクよりも、レイテンシと統合コストの点でより多くの利点があります。
-
LLM ゲートウェイ: 2026 年 4 月に発売された新製品。これは本質的に再販レイヤーであり、AssemblyAI の API キーを使用して、OpenAI、Anthropic、Google、Qwen、および Kim を含む 5 つのサプライヤーからの 25 以上のモデルを均一に呼び出します。主な機能には、自動フェイルオーバー (1 つのモデルが利用できない場合に、遅延を追加することなく、代替モデルに自動的に切り替える)、ヒント キャッシュ (Anthropic/OpenAI/Google モデルのサポート)、構造化 JSON 出力 (Claude 4.5 以降) が含まれます。適用可能なシナリオ: 音声エージェントの LLM 推論ステップ、通話後の自動要約生成、音声コンテンツに基づくツール コール チェーン。 主な制限事項: LLM ゲートウェイはモデルの微調整サービスを提供せず、カスタム モデルへのアクセスもサポートしません。
AssemblyAI API のモデルとバージョンの進化
AssemblyAI の製品進化は、「モデルの反復 + API の拡張」の並行リズムに従います。 Conformer-1 から Universal-3.5 Pro までのモデルに関しては、主な変更点はエンコーダー アーキテクチャ、トレーニング データの規模、および言語の範囲に焦点を当てています。 API に関しては、単一の文字起こしから音声理解ガードレール、音声エージェント、LLM ゲートウェイまで拡張され、レイヤーごとの製品マトリックスを形成しています。
主な機種ラインナップ:コンフォーマーからユニバーサルシリーズまで
- Conformer-1 (~2021): Conformer エンコーダ アーキテクチャに基づいた初期モデルで、中国語などの英語以外のシーンのカバー範囲は限られています。廃止されたため、新しい統合には推奨されません。
- Conformer-2 (2023-11): エンコーダー構造が改善され、英語の書き起こし精度が大幅に向上し、話者分離や感情分析などの理解機能が初めてサポートされました。現在入手可能ですが、推奨モデルではありません。
- Universal-2 (2024-06): 対象言語が 27 以上に拡大され、中国語、日本語、スペイン語、ドイツ語、フランス語、その他の主要言語が含まれます。 Keyterms Prompting メカニズムの導入により、ユーザーはキーワード リストを使用してモデルが特定の用語を識別できるようになります。一般的な転写用のメインモデルという位置づけであり、フラッグシップモデルと価格勾配がございます。
- Universal-3.5 Pro (2025-03): フラッグシップの録音済みモデルで、騒がしい状況、複数人での会話、早口、アクセントなどの困難なオーディオシーンにおいて、精度が Universal-2 よりも大幅に優れています。ストリーミング バージョン (Universal-3.5 Pro Realtime) も同時に発売され、音声エージェントに推奨される入力モデルになりました。新しい統合ではデフォルトでこのモデルを使用することをお勧めします。
API 製品ライン拡張のマイルストーン
- 2024 年以前: コアとして録音済み STT とストリーミング STT を使用し、追加機能として音声理解を使用します。ビジネス モデルは純粋な API 従量課金制です。
- 2025: Guardrails 製品ラインは、PII の非感作化、コンテンツ レビュー、および機密ワードのフィルタリングを統合して、独立して発売されます。医療モードは正式にサポートされており、医療文字起こしシナリオをカバーします。価格体系は「ベーシックモデル+追加機能の従量課金」の方向に洗練されました。
- 2026 年 4 月: Voice Agent API が正式にリリースされ (元の Speech-to-Speech API から名前変更およびアップグレード)、LLM Gateway が同時に起動されます。 2 つの新製品は、AssemblyAI の位置付けを「音声合成」から「音声合成 + 音声ワークフロー用の LLM ルーティング」に拡張します。
注目すべき非推奨と移行パス
- 「best」および「nano」モデルのエイリアスは非推奨となり、それぞれ Universal-3.5 Pro および Universal-2 にマップされます。
speech_model(単数形) パラメータは非推奨になりました。代わりにspeech_models(複数形) を使用してください。auto_chaptersおよびsummarization関数は、Universal-3.5 Pro 上で 500 エラーを黙って返します。LLM Gateway に移行することが公式に推奨されています (Claude Sonnet または GPT-5 シリーズを通じて章の概要と概要を生成)。- 「u3-pro」ストリーミング モデルのエイリアスは「u3-rt-pro」にマッピングされています。新しい統合では標準名を使用する必要があります。
AssemblyAI API の技術的利点
AssemblyAI の技術ロードマップは、単にモデル パラメーターの数や言語範囲の広さを追求するのではなく、「標準的な GPU ハードウェアで最高の文字起こし精度を達成する」という目標を中心に展開しています。
エンコーダ アーキテクチャの実践的な方向性: 純粋なエンコーダ デコーダ トランスフォーマを使用する Whisper などのオープン ソース モデルとは異なり、AssemblyAI の Conformer シリーズは、エンコーダ内で畳み込みモジュール (CNN) とセルフ アテンション (Self-Attention) を組み合わせています。このハイブリッド アーキテクチャの利点は、畳み込みモジュールがオーディオのローカル タイミング パターン (音素遷移など) を効率的にキャプチャできる一方で、セルフ アテンションはグローバルな依存関係のモデル化に優れていることです。このアーキテクチャは、純粋な Transformer エンコーダよりも現実世界のシナリオにおけるノイズ、アクセント、抑揚に対してより堅牢であり、その結果、ノイズの多いコンテキストでの単語誤り率 (WER) が 10 ~ 20% 低くなります。
カスケード制御フローの設計思想: Voice Agent API の実際のアーキテクチャは STT (Universal-3.5 Pro Realtime) → LLM (Gateway routing) → TTS (self-hosted LiveKit) ですが、単一の WebSocket エンドポイントとして外部に公開されます。このカスケード ソリューションとエンドツーエンドの音声モデル (GPT-4o のネイティブ音声モードなど) の違いは、各層の中間生成物 (テキスト トランスクリプション LLM 応答テキスト) を監査およびデバッグできることです。この監査可能なカスケード アーキテクチャは、「説明可能な AI 中間結果」を必要とする金融や医療などのコンプライアンス シナリオにとってかけがえのないものです。
リアルタイム文字起こしのための低遅延エンジニアリング: リアルタイム STT の中核となる技術的課題は、「完全なコンテキストが到着する前に読み取り可能な出力を生成する方法」です。 AssemblyAI のアプローチは、最初の 100 ~ 200 ミリ秒の音声が到着するとすぐにデコードを開始し、ローカル アライメント アルゴリズムを使用して一時的な発話を生成し、後続の音声が到着したときに継続的に修正および調整することです。これは、最初の単語の遅延は 300 ~ 800 ミリ秒で制御できるが、最初の出力単語はコンテキストが改善された後に修正される可能性があることを意味します。リアルタイムの字幕シナリオの場合、この「最初に出力してから変更する」戦略は、「すべてが処理されるまで待ってから出力する」よりも使いやすいです。
スピーカー分離のための技術ソリューションの選択: AssemblyAI は、標準バージョン (+$0.02/時間、オーディオ特徴クラスタリングに基づく) と実験版 (+$0.065/時間、より洗練された埋め込みモデルを使用) の 2 つのレベルのスピーカー分離を提供します。標準バージョンは、2 ~ 3 人の間での明瞭な会話には十分ですが、実験バージョンは、話者が 4 人を超える場合、または音声の重複が多い場合に大幅な改善が見られます。リアルタイム話者分離は、2026 年 3 月以降、U3.5 Pro Realtime のインライン アノテーションをサポートします。これは、音声エージェント シナリオの厳格な要件です。リアルタイム話者ラベルがなければ、エージェントは「顧客が言った」と「エージェントが言った」を区別できません。
AssemblyAI APIの使い方
AssemblyAI には GUI デスクトップ アプリやモバイル アプリはなく、すべての機能は REST API と WebSocket API を通じて公開されます。利用パスは「製品ページエクスペリエンス→API統合→本番展開」の3段階に分かれています。
製品エクスペリエンス ポータル: 公式 Web サイトにはプレイグラウンド ページがあり、コードを記述せずに音声ファイルをアップロードして、文字起こし効果をテストしたり、モデルを切り替えたり、パラメーターを調整したりできます。これは精度を評価する最も直接的な方法です。購入する前に、自分のシーンの 10 ~ 20 個のオーディオ サンプルをテストすることをお勧めします。
API 統合手順:
- AssemblyAI アカウントを登録し、API キーを取得します。サインアップすると、自動的に $50 の無料クレジットが獲得できます。クレジット カードは必要ありません。
- 製品ラインを選択します。事前録音トランスクリプションは REST POST を使用してオーディオ URL を送信し、ライブトランスクリプションは WebSocket 接続を開き、Voice Agent はエージェント WebSocket エンドポイントを使用します。
- 主要なリクエスト パラメータ:
audio_url(事前録音) / WebSocket URL (リアルタイム)、speech_models(モデルを明示的に指定します。デフォルト値に依存しない)、language_code(言語を指定するか、自動検出のために空白のままにします)、追加の関数パラメータ (話者の分離を有効にするspeaker_labels: trueなど)。 - 結果の受信: 事前記録モードでは、コールバック (Webhook) またはポーリングを通じて結果を取得します。リアルタイム モードは、WebSocket で発話イベントを継続的に受信します。 Voice Agent は同じ WebSocket 上で音声データを送受信します。
API 呼び出しの例 (Python SDK): 「」パイソン Assemblyai を aai としてインポート
aai.settings.api_key = "
事前に録音された文字起こし
転写者 = aai.Transcribe() config = aai.TranscriptionConfig( speech_model=aai.SpeechModel.best, # Universal-3.5 Pro に自動的にマップします Speaker_labels=本当、 言語コード = "zh" ) トランスクリプト = transcriber.transscribe("https://example.com/audio.mp3") print(転写.テキスト)
リアルタイム文字起こし(WebSocket)
転写者 = aai.RealtimeTranscribe( サンプルレート=16000、 on_data=lambda 発話: print(utterance.text), on_error=ラムダエラー: print(error) ) transcriber.connect() 「」
統合に関するメモ:
- ストリーミングの課金は、音声の再生時間ではなく、WebSocket の接続時間に基づいて行われます。オーディオ ストリームが終了したら、必ずすぐに接続を閉じてください。
- マルチチャンネルオーディオの料金は、チャンネル×再生時間で計算されます。アップロードする前に、すべてのチャンネルを保持する必要があるかどうかを確認してください。
- デフォルトのモデル選択は無料アカウントと有料アカウントで異なる場合があります。常に
speech_modelsパラメータを明示的に設定してください。
AssemblyAI API の製品価格
AssemblyAIは「無料クォータスタート+従量課金+追加機能オーバーレイ」の料金モデルを採用しています。サブスクリプション パッケージや年間割引の一般公開はありません。エンタープライズ ボリューム ディスカウントについては営業担当者に問い合わせる必要があります。
無料割り当て: 登録すると、50 ドルの無料処理時間を獲得できます。クレジット カードは必要ありません。無料利用枠には、1 分あたり 5 つの新しいストリーミング接続という同時実行制限がありますが、従量課金制 (PAYG) にアップグレードすると、1 分あたり 100 に増加します。
従量課金制の料金体系:
- 事前録音されたトランスクリプション: 音声提出の継続時間 (時間) に応じて請求されます。マルチチャネルの場合は、チャネル数 × 継続時間に応じて請求されます。追加機能 (話者分離、エンティティ検出、センチメント分析など) は、それぞれ 1 時間あたり最大 0.01 ~ 0.15 ドルかかります。
- リアルタイム文字起こし: 音声送信時間ではなく、WebSocket セッション時間 (接続から切断まで) によって課金されます。追加機能も積み重なっていきます。
- 音声エージェント API: セッション分ごとに請求され、$0.075/分 ($4.50/時間)、すべてのコンポーネント (STT+LLM+TTS+オーケストレーション) が含まれます。
- LLM ゲートウェイ: モデルの入力/出力トークンによって請求され、各モデルの価格は、0.05 ドル/M 入力トークン (GPT-5 Nano) から 5.00 ドル/M 入力トークン (GPT-5.5 / Claude 4.8 Opus) の範囲で個別に設定されます。
一般的な請求の罠:
- WebSocket アイドル接続の継続課金 - 接続を閉じるのを忘れることは、予期せぬ出費の最大の原因です。
- Universal-3.5 Pro で非推奨の
auto_chaptersまたはsummarization機能を使用すると、機能しないだけでなく、エラー処理やデバッグにかかる時間のコストが発生します。 ・LLMゲートウェイのモデル価格は、グローバルルーティング(グローバル)とリージョナルルーティング(リージョン内)に分かれます。リージョン ルーティングの料金は 10% 高くなります。データ主権の制限が必要ない場合は、明示的に `"model_region": "global" を指定すると、LLM 呼び出しコストを 10% 節約できます。
AssemblyAI APIの適用シナリオ
AssemblyAI の機能は、「オフライン バッチ処理」と「オンライン リアルタイム インタラクション」という 2 つの側面をカバーします。最も代表的なシナリオは次の 3 種類です。
-
医療転記と医療記録の音声入力: 医療モード (+$0.15/時間) は、医療用語 (薬剤名、解剖学的語彙、診断基準) に特に最適化されており、HIPAA BAA 準拠 (署名に料金は必要ありません) と組み合わされており、診療所や病院は音声による電子医療記録入力システムを構築できます。一般的なリンク: 医師の口述 → リアルタイムの文字起こし → 医療モードの最適化 → 構造化された医療記録フィールドの抽出。 控除のメリット: 医師が手入力から解放されることで、各医師は 1 日あたり 45 ~ 90 分の事務時間を節約できると推定されています。 実装の前提条件: 中国の医療シナリオでは、最初にサンプルを使用して医療モードの精度をテストする必要があります。英語の医療転写の精度は実稼働環境で使用可能なレベルに達しており、中国語の医療転写の公開データは少ないため、より適切な受け入れテストが必要です。
-
カスタマー サービス センターの通話分析とエージェントの支援: リアルタイムの文字起こし + センチメント分析 + コンテンツ レビューの組み合わせは、通話中 (エージェントの画面に顧客の気分変動とキーワード プロンプトがリアルタイムで表示される)、通話後 (通話概要を自動的に生成し、高頻度の問題を特定し、To Do 項目を抽出する)、およびコンプライアンス監査 (エージェントが機密用語を使用したかどうか、および顧客が必要な情報を許可したかどうかを確認する) という 3 つのサブ シナリオを同時にカバーします。 控除のメリット: 品質検査チームのコール サンプリング レートが 5 ~ 10% (手動制限) から 100% (AI 自動レビュー) に増加し、同時にエージェントのトレーニング サイクルが 20 ~ 30% 短縮されます。 前提条件: 2 チャネル通話録音によるコスト倍増効果を TCO に含める必要があります。キーワード プロンプトの精度は、Keyterms プロンプトの構成品質によって異なります。
-
音声エージェント/音声ロボット: 音声エージェント API は、「ゼロから会話型音声エージェントへ」の最速パスを提供します。一般的なアプリケーションには、テイクアウト/物流のための訪問の自動リマインダー、銀行およびクレジット カードの返済リマインダー、外来予約の確認と再スケジュールなどが含まれます。 控除のメリット: 手動の発信通話と比較すると、1 回の通話のコストは約 5 ~ 10 元 (人件費) から約 0.45 元に下がりました (Voice Agent API の 4.50 ドル/時間は、1.5 分間の通話で約 0.1125 ドル ≈ 0.8 元であり、オペレーターの回線料金を加えた人件費よりもまだ低いです)。 実装の前提条件: 音声エージェントは現在、単純な質問と回答および情報確認タスクに関しては成熟していますが、複数ラウンドの複雑な意図推論 (顧客からの苦情エスカレーション、手動介入を必要とする複雑なアフターサービスなど) が含まれる場合は、依然として人工エージェントをセットアップする必要があります。
AssemblyAI API の適用可能なグループ
-
独立系開発者およびスタートアップ テクノロジー チーム: 50 ドルの無料クレジット + 明確な API ドキュメント + 多言語 SDK (Python、JavaScript、Go、Ruby、.NET) により、音声プロトタイピングの最初の選択肢の 1 つとなります。 境界には適していません: プロジェクトでオフラインの文字起こし (インターネット コンテキストなし) が必要な場合、または深くカスタマイズされたモデル (微調整/蒸留) が必要な場合、AssemblyAI の純粋な API モードでは要件を満たすことができないため、Whisper などのオープン ソース ソリューションを検討する必要があります。
-
音声アプリケーション バックエンド エンジニア: オーディオおよびビデオ ファイルのトランスクリプションを処理し、リアルタイムの音声パイプラインを構築する必要があるバックエンド チーム。 AssemblyAI の利点は、単一の API キーで転記→理解→レビューのリンク全体を接続できるため、マルチベンダー統合によるエンジニアリングのオーバーヘッドが削減されることです。 前提条件: チームは WebSocket プログラミングの経験がある必要があります。リアルタイム モードの課金ロジック (音声時間ではなく接続時間) は REST API の考え方とは異なるため、設計とプリプロダクションでは注意を払う必要があります。
-
ヘルスケアおよび金融業界向けのコンプライアンス テクノロジー チーム: HIPAA BAA および SOC 2 認定の標準カバーに加え、音声エージェント API の PCI-DSS 認定により、コンプライアンス パスのエンジニアリング オーバーヘッドを最小限に抑えます。 国境には適していません: 規制要件によりデータを国内 (中国) サーバーに保存する必要がある場合、AssemblyAI は現在米国および EU 地域でのみサービスを提供しており、中国では展開していません。国境を越えたデータ送信のコンプライアンスの実現可能性を評価する必要があります。
-
メディアおよびコンテンツ制作チーム: ポッドキャストの文字起こし、ビデオ字幕の生成、会議記録のアーカイブ。 Universal-2 のクリアな録音精度は、単純なシーンであればフラッグシップ モデルのプレミアムを支払う必要がないほど十分です。 前提条件: ある程度のスクリプト作成または統合作業が必要です (Zapier または自己構築スクリプトを介して音声ファイルを AssemblyAI に自動的に送信し、文字起こし結果を取得するなど)。技術者以外のユーザーは、サードパーティのツール パッケージに依存する必要がある場合があります。
AssemblyAI APIの概要と展望
AssemblyAI の中核的な競争力は「音声処理リンク全体の API レベル」にあります。これは最高の音声精度を備えたソリューションではありません (特定の言語やシナリオでは、ローカル クラウド ベンダーや特定のコーパス向けに微調整されたモデルの方が優れている可能性があります) が、「すぐに使える精度 + コンプライアンス対応 + エンジニアリング統合効率」の三角バランスに基づいた実稼働レベルの商用化オプションを提供します。
現在の主な制限事項:
- 中国にはサービスノードがありません。中国国内の企業にとって、音声データの国境を越えた送信はコンプライアンス上の不確実性に直面しています。これは技術的な問題ではなく、法的な評価が必要なアクセスの問題です。
- 中国語などの英語以外の言語の精度は依然として英語に遅れています。改善は続けられていますが、中国語の複雑な音声 (方言、同音異義語の曖昧さ、専門用語) の処理能力はまだ英語レベルに達しておらず、中国語シナリオの事前購入 PoC は必須です。
- 音声エージェント (音声エージェント API) の LLM 選択は、ゲートウェイのモデル プールによって制限されます。独自の微調整モデルまたは未収集の特定のモデルを使用する必要がある場合、現在使用できるのは自己構築された STT+LLM+TTS リンクのみです。これにより、単一の WebSocket の包括的な価格と PCI 認定の利便性が失われます。
調達と導入のリスク評価: 英語の音声処理が必要なチームにとって、AssemblyAI は「最初に検証して後で拡張する」ための低リスクのオプションです。概念実証を完了するには 50 ドルの無料クレジットで十分で、年間契約や前払いは必要ありません。推奨される評価パスは次のとおりです。まず、50 ドルの無料クレジットを使用して、プレイグラウンドで 20 ~ 50 の代表的なオーディオをテストします。 → 精度が標準を満たしていることを確認します。 → 使用量が月 500 ドルを超えた場合は、営業に連絡して割引交渉します。 → 音声エージェントのシナリオでは、最初に 4.50 ドル/時間の包括価格を使用して製品の市場適合性を確認し、次にコストを制御するために自社構築リンクに移行するかどうかを決定します。中国でのビジネスの場合、AssemblyAI が正式に中国に参入する前、または現地のクラウド サービス プロバイダーと連携する前に、AssemblyAI に注目し続けることをお勧めしますが、当面は主要なソリューションにはしないことをお勧めします。
関連ツール: elevenlabs、udio
バージョン情報
- AssemblyAI API (バージョン 2026-07) :Universal-3.5 Pro は最新の主力トランスクリプション モデルで、Voice Agent API は正式に利用可能な段階に達し、LLM Gateway には 25 以上のモデルと自動フェイルオーバーが追加されました。特定のバージョンの反復は、公式の変更ログの対象となります。
- AssemblyAI API (バージョン 2026-04) :Voice Agent API (以前の Speech-to-Speech API) が正式にリリースされ、LLM Gateway はオンラインで、5 つのプロバイダーの 25 以上のモデルをサポートしています。公式の正確な日付はまだありません。
- AssemblyAI API (バージョン 2025-12) :Universal-Streaming Multilingual がリリースされ、多言語のリアルタイム ストリーミング文字起こしがサポートされます。 Universal-3.5 Proはストリーミング版を開始します。公式の正確な日付はまだありません。
- AssemblyAI API (バージョン 2025-03) :Universal-3.5 Pro モデルがリリースされ、複雑な音声 (騒がしい複数人での会話) の書き起こし精度が大幅に向上しました。公式の正確な日付はまだありません。
- AssemblyAI API (バージョン 2024-06) :Universal-2 モデルがリリースされ、以前の Conformer-2 に代わって 27 以上の言語をカバーし、ユニバーサル トランスクリプションのメイン モデルとして機能します。公式の正確な日付はまだありません。
- AssemblyAI API (バージョン 2023-11) :Conformer-2 モデルがリリースされ、改良されたエンコーダー アーキテクチャが導入され、当時の主力トランスクリプション モデルとなりました。公式の正確な日付はまだありません。
ユーザーレビュー