アイスピーチ
無料
iSpeech は、TTS および音声認識 API サービスを提供し、多言語およびマルチプラットフォームの統合をサポートし、Web、モバイル、デスクトップ アプリケーションをカバーする、確立されたテキスト読み上げサービス プラットフォームです。
iスピーチ
iSpeech のコアパラメータと統計
iSpeech は、米国で確立された音声技術サービス プロバイダーである iSpeech, Inc. の製品です。 REST API を主要な配信形式として使用し、開発者にテキスト読み上げ (TTS) と自動音声認識 (ASR) という 2 つの主要な機能を提供します。大規模な GPU コンピューティング能力に依存するニューラル TTS メーカーとは異なり、iSpeech の製品路線は、「軽量 API + マルチプラットフォーム SDK + カスタマイズ可能な音声モデル」という従来の音声ミドルウェア路線に傾いています。
| プロジェクト | 広報 |
|---|---|
| 公式の位置づけ | テキスト読み上げおよび音声認識 API |
| コアコンピテンシー | TTS 合成 ASR 認識、位置マーカー、口形素 |
| 導入方法 | REST API (HTTP GET/POST)、マルチプラットフォーム SDK |
| 登録開発者数 | 80,000+ |
| 毎月の API リクエスト | 1 億回以上/月 |
| サポートされている言語の数 | 30 以上 (中国語、日本語、韓国語、アラビア語、およびほとんどのヨーロッパ言語を含む) |
| 標準ボイスの数 | 40+ (男性と女性の声、地域差を含む) |
| ホーム | 米国 |
| 最新バージョン | API 2025 (~2025) |
| サポートされているプラットフォーム | ウェブ、Android、iOS、デスクトップ、API |
API ファーストの製品形式: iSpeech は、エンド消費者向けに独立したアプリを提供しません (ただし、DriveSafe.ly、iSpeech Translator、iSpeech Dictation などのツールベースのアプリケーションはあります)。その中心的な価値は、開発者が HTTP リクエストを通じて任意のインターネット アプリケーションに音声機能を組み込めるようにすることです。 1 つの TTS リクエストはオーディオ バイナリ データを返し、1 つの ASR リクエストは認識されたテキストと信頼スコアを返します。プロセス全体は、コールバックを待たずに同期的に完了します。
技術の成熟度と歴史的蓄積: 同社は少なくとも 2009 年から運営されており (公式 Web サイトの著作権注釈 2009-2018)、API ドキュメントの改訂履歴は早くても 2011 年まで遡ることができます。この長期的な運用は、コア API インターフェイスが比較的安定しており、破壊的な変更が発生する可能性が低いことを意味し、継続的な運用が必要な運用環境に適しています。
iSpeech のユーザーと市場の認識
iSpeech の市場カバレッジは主に、「開発者の数」と「API 呼び出しの量」という 2 つの検証可能な側面に基づいています。公開財務データや法人顧客リストは公開されていない。
開発者の規模: 公式 Web サイトのホームページには 80,000 人以上の登録開発者が公開されており、毎月の API リクエストは 1 億回を超えています。この規模は、既存の音声 API サービスプロバイダーの平均レベルを上回っており、中小規模の開発者グループの間で安定した既存ユーザーを抱えていることがわかります。
生態学的対象範囲: iSpeech は、iPhone、Android、BlackBerry、.NET、Java、PHP、Flash、JavaScript、Ruby、Python、Perl を含む合計 11 のプラットフォーム向けの SDK またはコード サンプルを提供しており、主流のモバイル、デスクトップ、サーバー開発スタックのほぼすべてをカバーしています。この幅広さは古い音声 API でより顕著ですが、新興言語 (SwiftUI、Kotlin Multiplatform、Go、Rust など) への適応は公的に更新されていません。
業界ベンチマーク: AWS Polly、Google Cloud Text-to-Speech、Azure Cognitive Services などのクラウド大手が提供する TTS サービスと比較した場合、iSpeech の利点は音声品質やモデルのスケールではなく、API のシンプルさ (複雑なクラウド SDK を学習する必要がない) とクロスプラットフォーム SDK の完全性にあります。クラウド大手の TTS は通常、それぞれのクラウド エコシステム内で最高のエクスペリエンスを提供しますが、エコシステムを離れると統合コストが増加します。 iSpeech の独立した API フォームは、そのようなシナリオにより適しています。
iSpeech のコスト上の利点
利用方法に応じてコスト構造が異なります。Cサイドユーザーは通常無料版でコア機能を体験でき、高頻度で利用する場合は有料パッケージへの加入が必要になります。開発者/API ユーザーは呼び出し回数に基づいて請求されます。エンタープライズレベルのユーザーは、カスタマイズされた見積もりを入手するには企業に連絡する必要があります。具体的な価格は、公式のリアルタイム価格ページに準拠します。
iSpeechの主な機能
iSpeech の機能システムは、「音声合成」と「音声認識」の 2 つの主要なラインを中心に展開し、位置マーキングと視覚的位置のための 2 つの補助データ インターフェイスも提供します。
-
TTS Text-to-Speech API: コア機能、テキストを音声に合成します。 40 以上の標準サウンド (多言語の男性および女性の音声バリアントを含む)、8kHz ~ 48kHz のサンプリング レート、16 ~ 320kbps のビット レート、11 の出力オーディオ形式 (mp3/mp4/wav/aiff/ogg/flac/wma/alaw/ulaw/vox) をサポートします。スピーチの速度とピッチは、速度 (-10 ~ 10) とピッチ (0 ~ 200) のパラメーターを通じて調整できます。 startpadding と endpadding をサポートし、オーディオの最初と最後に無音セグメントを追加します。これは、IVR サウンド制作シナリオに適しています。
-
ASR 自動音声認識 API: 音声をテキストに書き起こします。フリーフォーム モード (ユニバーサル ディクテーション、ショート メッセージ、ボイスメール) およびコマンド リスト モード (「はい/いいえ」制御命令など、限られた語彙でのコマンド認識) をサポートします。垂直方向のシナリオでの高精度の認識に適した、マルチドメインの非フリー テキスト モデル (アシスタント、日付、NFL、NBA、時間、電話番号、番地など) を提供します。 ASR 応答には信頼スコアが含まれており、二次検証しきい値の設定に使用できます。
-
位置マーカー: TTS の補助データ インターフェイス。オーディオ内の各単語の開始および終了タイムスタンプ (ミリ秒レベル) を返します。歌詞の同期、字幕のハイライト、カラオケ効果などのシナリオに適しています。マーカー リクエストでは、TTS オーディオ リクエストとまったく同じパラメータ (音声/速度/形式など) を使用する必要があることに注意してください。使用しないと、タイムスタンプがオーディオと一致しません。
-
口形素: TTS の口の形のアニメーション データ インターフェイス。口の形の番号 (口 0 ~ 21) と各フレームの時間間隔を返します。デジタルヒューマンのリップシンクやアニメキャラクターのリップシンクなどのシナリオに適しています。ビューポイントと位置マーカーは、同じ一連のパラメーターの一貫性要件を共有します。
-
SSML および MathML のサポート: SSML タグを使用して、話速の増減、強勢の強調、ポーズの挿入などの細かい発音動作を制御します。 MathML による数式の音声読み上げをサポートします (libmath ライブラリを有効にする必要があります)。どちらの機能もデフォルトではオフになっているため、有効にするには営業担当者に問い合わせる必要があります。
iSpeech のモデルとバージョンの進化
iSpeech のバージョンの反復は、主流の大規模モデルの「大きなバージョン + 小さな増分」モデルとは異なります。その API 自体は下位互換性を維持しており、API ドキュメントのリビジョンがバージョン進化のアンカー ポイントとなります。
API ドキュメントのバージョン行: API ドキュメント (開発者ガイド) の改訂履歴には、次のマイルストーンが示されています。
- 2011-08: 初めて作成されたドキュメント、TTS の基本機能
- 2011-09: ASR 機能を追加
- 2012-08: 位置マーカーと口形素を追加
- 2013-01: MathML サポートを追加
- 2013-01: SSML サポートを追加
- 2016-09: 最新の更新、サポートされている言語リストの更新
それ以来、ドキュメントにはメジャー バージョン マークがありませんが、API は引き続き実行されており、コア インターフェイスが安定したメンテナンス期間に入ったことを示しています。
製品価格バージョン ライン: 価格ページには、Hacker (無料)、ジュニア ($29/月)、Growth ($399/月)、および Elite (L33T) の 4 つのレベルが用意されており、放棄プランはないことが示されています。 API ドキュメントに記載されているクレジット システムと自動購入システムは引き続き動作します。
ステータス評価: iSpeech は典型的な「成熟しているが反復が少ない」製品です。コア機能は安定しており、ドキュメントも充実していますが、2016 年以降、メジャー バージョンのアップデートの発表はありません。これは、継続的な機能の反復と最新の TTS テクノロジーを求めている最先端のプロジェクトにとっては兆候である可能性があります。これは実際、長期的に安定した API を追求し、インターフェイスの変更に頻繁に対応したくないプロジェクトにとっては利点です。
iSpeech の技術的な利点
iSpeech の技術的なルートは、モデル機能における最先端のブレークスルーを追求するものではなく、「API の安定性」、「クロスプラットフォームのカバレッジ」、「同期応答」という 3 つのエンジニアリングの側面を中心に利点を構築します。
同期 API 設計のエンジニアリングへの影響: API ドキュメントには、「iSpeech API は高速かつ同期であるため、コールバックを使用しない」と明確に記載されています。各 TTS リクエストは同じ HTTP トランザクションで完全な音声データを返します。これは、開発者が Webhook 受信、ポーリング ステータス、非同期キュー管理を実装する必要がなく、統合コードの量が非同期音声 API よりも大幅に少ないことを意味します。リアルタイム インタラクション シナリオ (IVR システム、音声アシスタントなど) の場合、同期設計によりコールバック遅延の不確実性を排除することもできます。
マルチフォーマットとマルチパラメータの柔軟性: 11 のオーディオフォーマット、8 つのサンプリングレート、16 ビットレート、ピッチとスピーチレートの調整の組み合わせをサポートし、単一の API リクエストでパラメータ設定を完了します。これにより、「生成後の二次トランスコーディング」作業モードと比較して、ワンホップ処理リンクとそれに対応するトランスコーディング コストが削減されます。ただし、一部のパラメータの組み合わせには制限があることに注意してください。ビット レートは MP3 形式でのみ使用でき、ビット深度は AIFF/FLAC/WAVE 形式でのみ使用できます。パラメータを選択する前に、フォーマット互換性テーブルを確認する必要があります。
SDK の無料戦略とロックイン効果: モバイル SDK (iPhone/Android/BlackBerry) は、収益を生み出さないアプリケーションでは無料で使用できます。この戦略により、開発者の初期検証コストが削減されます。 iSpeech SDK を使用してアプリケーションが開発およびテストされた後、他の TTS サービス プロバイダーに切り替えるには、オーディオの収集および再生ロジックを書き直す必要があります。この「統合ロック」効果は、iSpeech が開発者ストックを維持するための重要なメカニズムです。
パフォーマンスとスループット: iSpeech は、正確な TTFT (最初の単語までの遅延)、RPM (1 分あたりのリクエスト数)、および同時実行の上限を開示していません。公式表現は、「各通話をわずか数ミリ秒で処理」および「ダウンタイムなし」です。最初に無料プランでベンチマーク テストを実行し、実際の応答時間がビジネス シナリオ (特に高い同時実行性またはリアルタイムの対話シナリオ) を満たしているかどうかを評価することをお勧めします。
iSpeech の統合と使用
iSpeech を使用するには、次の 3 つの方法があります。 オンライン エクスペリエンス API 統合 SDK 統合。
オンライン体験: 公式 Web サイトでは、言語と音声合成効果を選択できる Web 版の TTS オーディション (https://www.ispeech.org/text.to.speech) を提供しており、登録は必要ありません。 ASR 機能には、オーディオ テストをアップロードするためのオンライン デモ ページもあります。このエントリは、技術評価フェーズでの迅速な検証に適しています。
API 統合 (コア パス):
- 開発者アカウントを登録します: https://www.ispeech.org/developers にアクセスして登録し、32 桁の 16 進数の API キーを取得します。
- リクエスト形式を選択します。REST (URL エンコード)、JSON、および XML 形式がサポートされています。エンドポイントは「http://api.ispeech.org/api/rest」、「http://api.ispeech.org/api/json」、「http://api.ispeech.org/api/xml」です。
- TTS リクエストを開始します (カールの例)。
カール "http://api.ispeech.org/api/rest、apikey=<YOUR_API_KEY>&action=convert&text=Hello+world&voice=usenglish女性&format=mp3" 「」 - ASR リクエストを開始します (POST の例)。
curl -X POST -d "apikey=<YOUR_API_KEY>&action=recognize&freeform=3&locale=en-US&content-type=audio/x-wav&audio=[base64_audio_data]" "http://api.ispeech.org/api/rest" 「」
SDK 統合: iSpeech は、iPhone、Android、.NET、Java、PHP、Flash、JavaScript、Ruby、Python、Perl 用の SDK を提供します。モバイル SDK のダウンロードおよび統合ガイドは https://www.ispeech.org/developers にあり、各プラットフォームには独立したドキュメント ページがあります。 SDK の最下層は引き続き同じ REST API セットを呼び出しますが、オーディオの録音やストリーミングなどのプラットフォーム固有のロジックをカプセル化します。
設定ポイント: API キーは開発者バックエンド管理ページで表示および編集でき、残りのクレジット、利用可能なサウンド リスト、有効な ASR モデルなどの情報を確認できます。高度な機能 (SSML、MathML、カスタム サウンド、カスタム ASR モデル) はデフォルトでは有効になっていないため、[email protected] に連絡して有効にする必要があります。
iSpeech の製品価格
iSpeech の価格体系は、「月次/年間サブスクリプション」と「従量課金制」のハイブリッド モデルで運用されており、具体的な料金は SDK プラットフォームと使用レベルによって異なります。
サブスクリプション プラン (API アクセス パーティ向け):
| 計画 | 月々のお支払い | 年払い(月額利用料相当) | 該当するシナリオ |
|---|---|---|---|
| ハッカー (無料) | $0 | $0 | 評価テスト、個人プロジェクト、使用率が低い |
| ジュニア | $29/月 | $299/年 (~$24.92/月) | 小規模なアプリケーション、起業家チーム |
| 成長 | $399/月 | $3,999/年 (~$333.25/月) | 中規模商用アプリケーション |
| エリート (L33T) | ビジネスへのお問い合わせ | ビジネスへのお問い合わせ | 高い同時実行性、カスタマイズされたニーズ |
従量制課金 (非モバイル SDK): TTS は単語ごとに課金され、ASR は認識トランザクションごとに課金されます。価格帯は $0.05 ~ $0.0001 で、使用量が増加するにつれて単価が下がります。モバイル SDK (iPhone/Android/BlackBerry) は、収益を生まないシナリオで無料で使用できます。
エンタープライズ/カスタマイズ価格: カスタム サウンド モデル、カスタム ASR モデル SSML/MathML 機能、民営化展開 (カスタム組み込みおよびクラウド ソリューション) などについては、ビジネスに関するお問い合わせが必要です。 APIドキュメントには自動購入システム(https://www.ispeech.org/developer/purchase/)へのリンクが記載されていますが、プランごとのクレジットパッケージの数や有効期間は公開されていません。
払い戻しとキャンセル: 価格ページには、払い戻しポリシーが明確にされずに、「いつでもプランをキャンセルまたはアップグレードできます」と表示されます。企業調達では、サービス レベル アグリーメント (SLA) とクレジットの有効期限ルールを契約で規定することをお勧めします。
iSpeech アプリケーションのシナリオ
iSpeech の API 設計は、「独立した音声製品の構築」ではなく「既存のシステムへの音声機能の組み込み」を必要とするシナリオに最適であると判断しています。
-
IVR 音声プロンプトの生成: TTS API を介して電話音声メニュー プロンプト トーンをバッチで生成し、ブロードキャスト中の突然を避けるためにプロンプト サウンドの最初と最後に無音を追加する startpadding/endpadding パラメータをサポートします。コマンド リスト モードで ASR を使用すると、ユーザー キー入力を音声コマンド認識に拡張し、IVR のキー レベルを下げることができます。 実装のヒント: IVR シナリオは遅延の影響を受けやすくなります。リアルタイム合成による待機を避けるために、プロダクション コンテキストでよく使用されるプロンプト サウンドを事前に生成してキャッシュすることをお勧めします。
-
モバイル アプリケーションのアクセシビリティ (アクセシビリティ): iSpeech TTS 読み上げコンテンツを読み上げアプリ (ニュース、電子書籍 RSS リーダー) に統合し、視覚障害のあるユーザーまたは音声読み上げシナリオに音声出力を提供します。無料の非収益アプリは、モバイル SDK を使用してゼロコストで統合できます。 実装のヒント: iSpeech 合成音声の自然さが、書籍を長時間聞く場合のユーザー エクスペリエンスの要件を満たしているかどうかを評価する必要があります。
-
音声コマンドと制御: スマート ホーム、車両システム、産業用制御などの制限された入力シナリオでは、ASR のコマンド リスト モードを使用して主要な語彙を定義し、高精度の音声コマンド認識を実現します。コマンド リストは、認識結果を事前に設定された語彙範囲に制限し、認識精度はフリーフォームのユニバーサル ディクテーションよりも大幅に高くなります。 実装のヒント: コマンド リスト モードでは、エイリアスとコマンド階層を自分で設計する必要があります。複雑なシナリオでは、エイリアス設計に一定の学習コストがかかります。
-
オンライン教育と e ラーニング: TTS API を通じてコース テキストを音声にバッチ合成し、音声バージョンを学習教材に追加します。多言語サポートにより、同じ API セットの下でさまざまな言語のコースに対応する音声を直接生成できます。 フロアのヒント: iSpeech の合成音声では、音声の速度とピッチ (速度 -10 ~ 10、ピッチ 0 ~ 200) をより自由に調整できます。教育シナリオでは、速度パラメーターを使用して、集中リスニング モードと速聴モードを切り替えることができます。
-
デジタル ヒューマンとアニメーションの唇の同期: Visemes インターフェイスを介して各フレームの唇形状番号データを取得し、2D/3D デジタル ヒューマン キャラクターの唇形状アニメーションを駆動します。位置マーカーと組み合わせると、単語ごとの強調表示や口の位置の調整が可能になります。 重要なヒント: 口形素インターフェイスは、口の形状番号 (0 ~ 21) のみを返します。アニメーション効果の最終的な品質は、フロントポート形状フレームからアニメーションスケルトンへのマッピングスキームによって異なります。 iSpeech はアニメーションのレンダリング側の機能を提供しません。
iSpeech の適用可能なグループ
iSpeech の中核となる顧客グループは、「音声機能を迅速に統合する必要があるが、クラウド ベンダーのエコシステムに束縛されたくない」開発者と中小企業です。
-
独立開発者および小規模チーム: 無料プランと低価格のジュニア プラン (月額 29 ドル) により、音声機能への参入障壁が低くなります。 TTS/ASR 機能が必要だが、MVP または小規模アプリケーションを開発する際の予算が限られているチームに適しています。 前提条件: 特定の API 統合機能が必要です (HTTP リクエストとオーディオのエンコードとデコードを処理できる)。 SDK はエンコードのワークロードを軽減できますが、排除することはできません。
-
クラウド エコシステムに束縛されていないエンタープライズ開発チーム: チームのテクノロジー スタックが AWS/Azure/GCP などのクラウド プラットフォームに依存していない場合 (または複数のクラウド間の API 差異管理を避けたい場合)、iSpeech の独立した REST API フォームは、クラウド プラットフォームから独立した音声機能アクセス ソリューションを提供します。 前提条件: API キー、使用状況の監視、フェイルオーバー ロジックを自分で管理する必要があります。
-
IVR および電話システム インテグレーター: iSpeech の TTS は、IVR プロンプト トーン生成および音声メニュー ナビゲーション用のコマンド モード ASR に対する成熟したパラメータ サポートを備えています。同期 API 設計は、IVR システムの一般的な低遅延要件も満たしています。 不適合な境界: 豊かな感情と自然な擬人化 (オーディオブックのナレーション、顧客サービスの音声など) を必要とする TTS シナリオの場合、iSpeech の合成音声品質とニューラル TTS (イレブンラボ、Play.ht など) の間にはギャップがあります。まずは評価を聞いてみることをお勧めします。
-
教育テクノロジー チーム: 多言語サポートとバッチ合成機能により、多言語コース コンテンツの吹き替えの基本的なニーズをカバーできます。 境界線に適合していない: 子どもの声や教育現場に特有のイントネーションのバリエーションが不足しており、普遍的な多言語音声のみに依存しています。
iSpeech の概要と展望
iSpeech の核となる競争力は「安定 + シンプル + クロスプラットフォーム」にあります。API インターフェースは 10 年以上下位互換性を維持しており、同期設計により統合の複雑さが軽減され、11 のプラットフォーム用の SDK が主流の開発スタックをカバーしています。基本的な「テキスト読み上げ」または「音声テキスト変換」機能のみが必要なプロジェクトの場合、iSpeech は確実で低コストの選択肢となります。
現在の制限事項: 深層学習ベースのニューラル TTS 製品 (elevenLabs、Play.ht、Azure Neural Speech など) と比較して、合成音声の自然さと感情の表現力には世代間ギャップがあります。この API にはストリーミング出力機能 (ストリーミング TTS) が欠けているため、最初の単語の待ち時間が短いことが必要なリアルタイムの会話シナリオでは不利になります。バージョンの反復速度は、新興の競合他社の速度よりも大幅に遅いです。 2016 年以降、API ドキュメントに大きな更新はなく、長期的なテクノロジー進化の道筋は十分に透明ではありません。
使用されるリスク評価: 財務状況が非公開の確立された企業として、iSpeech が長期的にサービスを利用できるかどうかは、会社自身のキャッシュ フローと顧客更新率に依存しています。購入する前に、企業は契約でサービス可用性のコミットメントとサービスの停止および移行の条件を明確に指定することをお勧めします。音声品質が重要なシナリオでは、決定を下す前に、まず公式 Web サイトのデモを通じて iSpeech の出力サンプルと少なくとも 2 つの競合製品を比較し、合成品質がユーザーの期待を満たしていることを確認することをお勧めします。最先端の TTS 機能 (感情制御、音声クローン、ストリーミング合成) を追求するプロジェクトにとって、iSpeech は現時点では最良の選択ではありません。
関連ツール: イレブンラボ、udio
iSpeech の使用方法
- Webクライアント:公式Webサイトにアクセスし、アカウントを登録することで利用できます。ほとんどの機能はインストールする必要がありません。
- API アクセス: RESTful API を提供し、開発者は API キーを取得して独自のアプリケーションに統合できます。
バージョン情報
- iSpeech API 2025 :公式の正確な日付はまだありません。 API サービスは音声品質と言語サポートを最適化するために毎年更新されます。
- iSpeech API 2024 :公式の正確な日付はまだありません。 APIサービスの年次バージョンアップデート。
ユーザーレビュー