Ekhos IA
Gratuit
Ekhos AI est une plate-forme de synthèse vocale et de création audio basée sur l'IA qui prend en charge le clonage vocal et la synthèse vocale.
EkhosAI
Paramètres et statistiques de base
Ekhos AI est une application de bureau Windows positionnée comme une « transcription d'IA locale hors ligne », et non comme une plateforme cloud TTS ou de clonage vocal. Sa valeur fondamentale est de transcrire des fichiers audio/vidéo ou des entrées de microphone en temps réel en texte, en les traitant entièrement sur l'appareil local sans télécharger aucune donnée sur le cloud. Ce n'est pas dans la même voie que les produits cloud TTS tels que ElevenLabs et Fish Audio. Ses concurrents directs sont des outils de transcription tels que Otter.ai, Trint et Descript, mais ils se différencient dans la dimension « confidentialité des données » : la plupart des produits concurrents sont des traitements cloud, tandis qu'Ekhos est une solution locale complète hors ligne.
| Projets | Informations publiques |
|---|---|
| Positionnement du produit | Outil de bureau de transcription vocale hors ligne IA |
| Capacités de base | Audio en texte, reconnaissance du locuteur, traitement local de l'IA |
| Plateforme | Bureau Windows (Microsoft Store) |
| Accueil | UA (Australie) |
| Création d'entreprise | 2024 |
| Langues prises en charge | 98 (y compris le chinois, l'anglais, le japonais, le coréen et d'autres langues principales et langues mineures) |
| Niveau du modèle IA | Intermédiaire / Avancé / Expert trois niveaux réglables |
| Mode de transcription | Optimisé (vitesse 2x), Standard, Identification des haut-parleurs |
| Dernière version | v3.0.6 (02/05/2026) |
| Matériel minimal | Windows 10+, Intel Core i5 / AMD Ryzen 5, 8 Go de RAM, 500 Go SSD |
| Matériel recommandé | GPU NVIDIA RTX (séries 20/30/40/50) + 16 Go de RAM |
Brève revue en une phrase : Ekhos AI n'est pas un outil TTS, mais un "transcripteur d'IA local installé sous Windows" - faites glisser le fichier d'enregistrement et sortez automatiquement la transcription, sans être connecté à Internet, sans téléchargement et sans laisser de traces.
Différence fondamentale en matière de confidentialité des données : contrairement aux outils de transcription cloud, les fichiers audio et les résultats de transcription d'Ekhos AI sont tous stockés dans la base de données SQLite locale de l'utilisateur, et l'inférence IA est effectuée sur le CPU/GPU local sans qu'aucune donnée ne soit transférée hors de l'appareil. Pour les secteurs tels que le médical, le juridique et les forces de l'ordre qui ont des exigences de conformité strictes en matière d'exportation de données, cette fonctionnalité détermine directement la différence entre « peut être utilisé » et « ne peut pas être utilisé ».
Reconnaissance des utilisateurs et du marché
Ekhos AI se positionne sur le segment de marché local de la transcription hors ligne. Le public cible est clair mais l’échelle globale est plus petite que celle des outils de transcription généraux.
Couverture de l'industrie cible : les utilisateurs cibles répertoriés publiquement sur le site officiel comprennent les praticiens du droit, le personnel médical, les forces de l'ordre, les journalistes, les chercheurs et les producteurs de podcasts. Les caractéristiques communes de ces secteurs sont : une grande sensibilité à la confidentialité des données, une fréquence élevée des besoins de transcription et le contenu des documents peut impliquer des accords de confidentialité ou des contraintes de conformité.
Avis d'utilisateur : La recommandation de l'utilisateur (Jane T.) affichée sur le site officiel met l'accent sur le principal argument de vente : "un fonctionnement complètement hors ligne, le contenu audio et de transcription reste privé et sécurisé". À en juger par le fonctionnement des médias sociaux (Facebook, X/Twitter, LinkedIn, YouTube), l'équipe construit activement une communauté mais n'a pas encore formé de bouche à oreille à grande échelle.
Positionnement comparatif du marché : Sur le marché de la transcription d'IA, les solutions cloud (Otter.ai, Trint, Rev) occupent la majorité. L'itinéraire « hors ligne + local » d'Ekhos a actuellement peu de concurrents directs. Il s'agit à la fois d'un avantage de différenciation et d'un seuil d'éducation du marché : un grand nombre d'utilisateurs se sont habitués à la commodité des outils cloud (synchronisation multi-appareils, édition collaborative), et le mode hors ligne complet d'Ekhos constitue en fait une limitation dans ces scénarios. Il ne s’agit donc pas d’un remplacement d’Otter.ai, mais d’un outil dédié aux scénarios où la migration vers le cloud n’est pas possible. Sur la base des informations publiques, il n’existe aucune évaluation ou divulgation par un tiers faisant autorité des cas de clients d’entreprise à grande échelle.
Avantage de coût
La structure de coûts d'Ekhos AI s'articule autour d'une « licence logicielle unique + investissement matériel à la demande », ce qui est essentiellement différent du modèle « abonnement minute/heure » des outils de transcription cloud.
Client C/personnel (version gratuite) : Fournit un plan gratuit permanent. Transcrivez une fois par jour pendant 30 minutes maximum, prenez en charge 98 langues, utilisez deux modes de transcription en temps réel, Microphone et Haut-parleur, et accédez à un éditeur de texte pour la relecture. Limité par la durée d'une seule session et la fréquence quotidienne, il convient aux utilisateurs légers ayant des exigences de transcription extrêmement faibles (comme les étudiants qui organisent occasionnellement des enregistrements en classe). Le format de sortie est uniquement du texte.
Personnel/Avancé (Premium, 9 $/mois, payé annuellement) : L'abonnement annuel équivaut à 9 $ par mois (bénéficiez de 25 % de réduction), débloquez des transcriptions illimitées, aucune limite de taille/nombre/durée de fichier, identification et marquage du locuteur, traitement de file d'attente par lots Word/PDF/Texte, trois formats d'exportation, prise en charge de l'accélération GPU et assistance technique par courrier électronique. C'est la principale solution pour les utilisateurs haute fréquence.
Abonnement Entreprise/Volume : Contactez [email protected] pour un devis. Le site officiel ne divulgue pas les différences fonctionnelles spécifiques de la version entreprise (qu'elle inclut la gestion multi-utilisateurs, le déploiement centralisé, la personnalisation de la marque, etc.), et les entreprises clientes doivent négocier elles-mêmes.
Élément de coût implicite : le principal coût caché d'Ekhos AI ne réside pas dans l'abonnement logiciel, mais dans l'investissement matériel. La transcription de 30 minutes d'audio sur la configuration la plus basse (8 Go de RAM, inférence CPU) prend 38 à 73 minutes (selon le niveau du modèle d'IA), tandis qu'un GPU NVIDIA RTX peut compresser la même tâche en 3 à 4 minutes. Le coût d'achat/de mise à niveau du matériel GPU (ordinateur portable RTX 4050 ou supérieur) peut être plusieurs fois supérieur au coût annuel du logiciel, mais il s'agit du coût inhérent de la solution locale hors ligne. Pour les utilisateurs disposant déjà d’appareils Windows de milieu à haut de gamme, le coût marginal est extrêmement faible.
| Dimension du coût | Édition gratuite | Édition Premium (9 $/mois) | Édition Entreprise |
|---|---|---|---|
| Frais mensuels | 0 $ | 9 $ (payé annuellement) | Négociation commerciale |
| Limite de transcription quotidienne | 1/30 minutes | Illimité | Illimité |
| Reconnaissance du locuteur | ❌ | ✅ | ✅ |
| File d'attente par lots | ❌ | ✅ | ✅ |
| Format d'exportation | Texte | Mot + PDF + Texte | Sous réserve de contrat |
| GPU accéléré | ❌ | ✅ | ✅ |
| Préparez votre propre matériel | Processeur minimum i5/8 Go | Processeur minimum i5/8 Go, GPU RTX recommandé | Identique à Premium |
| Confidentialité des données | Local hors ligne ✅ | Local hors ligne ✅ | Local hors ligne ✅ |
Fonctions principales
La conception fonctionnelle d'Ekhos AI s'articule autour de « l'entrée audio → transcription IA → relecture et édition → exportation » plutôt que du « traitement audio IA » général.
-
Transcription locale de l'IA (Core) : prend en charge l'importation de MP3, MP4, WAV, MKV, AVI, MPEG et d'autres formats audio et vidéo courants et les transcrit automatiquement en texte. La transcription est entièrement effectuée sur le CPU ou le GPU local et ne repose pas sur une connexion Internet. Des modèles d'IA à trois niveaux intermédiaire, avancé et expert sont disponibles : plus le niveau est élevé, plus la précision est élevée, mais plus cela prend de temps. Conseils applicables : Le modèle Expert présente des avantages évidents dans les enregistrements avec des accents prononcés et un bruit de fond complexe, mais le temps de traitement est environ 2 fois supérieur à celui du modèle Intermédiaire. Il est recommandé d'utiliser Intermédiaire pour un aperçu rapide, puis d'utiliser Expert pour affiner les passages clés.
-
Modes de transcription à trois niveaux : Optimisé (2 fois plus rapide que Standard, adapté à une rédaction rapide), Standard (mode classique, équilibrage de la vitesse et de la précision), Identification du locuteur (marque automatiquement les locuteurs et prend en charge le renommage, adapté aux scénarios d'entretien de conférence). Trois modes peuvent être librement sélectionnés avant de commencer la transcription, et le même audio peut être transcrit plusieurs fois dans différents modes. Effet de synergie : la combinaison Optimisé + Intermédiaire peut terminer la première ébauche d'un audio de 30 minutes en 3 à 5 minutes, puis utiliser le mode d'identification du locuteur pour effectuer une deuxième transcription du même audio afin d'obtenir l'étiquette du locuteur. Les résultats des deux transcriptions sont recoupés dans l'éditeur de pistes, en tenant compte à la fois de la rapidité et de la précision.
-
Identification et marquage du locuteur : La version Premium marque automatiquement le locuteur (SPEAKER 1, SPEAKER 2...), et le numéro peut être remplacé par le vrai nom une fois la transcription terminée. Cette fonction est implémentée sur la base du clustering d'empreintes vocales du modèle d'IA local et ne nécessite pas de bibliothèque d'empreintes vocales cloud. Limite de précision : La précision de la reconnaissance est plus élevée dans les scènes où deux personnes parlent et l'enregistrement est clair ; lors d'une table ronde avec plus de trois personnes ou d'une scène d'enregistrement en champ lointain, des haut-parleurs qui se chevauchent ou des différences de volume excessives entraîneront une confusion entre les étiquettes.
-
Transcription en direct (Live Mic/Live Speaker) : prend en charge la transcription en temps réel via un microphone ou des haut-parleurs du système. Le mode Live Speaker peut transcrire n'importe quel audio lu par votre ordinateur à partir de YouTube, TikTok, Facebook Reels, podcasts Zoom/Teams, webinaires, etc. Valeur de mise en œuvre : les journalistes peuvent obtenir la transcription en temps réel pendant que l'interview est en cours, sans avoir à attendre que l'enregistrement soit terminé avant de la transcrire.
-
Outil de vérification du lecteur multimédia et de l'éditeur de pistes : le lecteur multimédia intégré est lié à l'éditeur de piste audio - lors de la lecture audio, Tracks Editor met simultanément en surbrillance le paragraphe de texte correspondant actuel, ce qui facilite la relecture pendant l'écoute. Prend en charge la recherche en texte intégral pour localiser les pistes audio. Un éditeur de texte brut est également fourni comme alternative légère. Déduction d'efficacité : la transcription manuelle traditionnelle prend environ 4 à 6 heures pour 1 heure d'enregistrement. Avec la première ébauche d'IA d'Ekhos AI + la relecture de Tracks Editor, la durée totale peut être compressée à 20 à 40 minutes (en fonction de la qualité audio et du niveau de précision requis).
-
File d'attente par lots et exportation multiformat : La version Premium prend en charge l'ajout de plusieurs fichiers audio et vidéo à la file d'attente pour une transcription en séquence, sans qu'il soit nécessaire de les démarrer manuellement un par un. Le format d'exportation prend en charge Word (.docx), PDF et texte brut (.txt), ce qui facilite la connexion avec les flux de travail en aval (tels que les avocats rédigeant les procès-verbaux des réunions et les journalistes compilant les transcriptions des entretiens). Synergie : la file d'attente par lots + le mode optimisé peuvent réaliser une transcription par lots sans surveillance la nuit et exporter directement le package des procès-verbaux de la réunion le lendemain.
Evolution du modèle et de la version
Le rythme d'itération des versions d'Ekhos AI présente un modèle typique de version de logiciel de bureau de « transition des fonctionnalités de la grande version + correction rapide des bogues de la petite version ».
Contexte de la version principale
| Version | Date de sortie | Changements fondamentaux |
|---|---|---|
| v1.0.0 | 2025-03-11 | Produit officiellement lancé, capacités de base de transcription hors ligne locale |
| v1.0.1 - v1.0.6 | 2025-03 ~ 2025-08 | Correctifs de stabilité et de compatibilité (taux d'échantillonnage standardisé, horodatage, traitement des noms d'utilisateurs Windows générés par l'ID de base de données contenant des espaces, etc.) |
| v2.0.0 | 2025-09-26 | Mise à niveau majeure des fonctionnalités : introduction de trois modes de transcription : optimisé (vitesse 2x), standard et identification du locuteur ; connectez-vous au Microsoft Store |
| v3.0.0 | 2026-03-05 | Mise à niveau de l'architecture de sécurité : mot de passe local + phrase de récupération (haute résistance), options de sécurité d'accès multiples (uniquement login/mot de passe ou login/pas d'authentification) ; protection du texte de transcription (masque en lecture seule / visible en lecture seule / jouable en lecture seule / modifiable) |
| v3.0.4 | 2026-03-28 | Correction de l'erreur de vérification de la durée du fichier de transcription et de l'erreur de mot de passe local ; amélioration des performances de l'interface utilisateur lors de la transcription |
| v3.0.5 | 2026-04-05 | Ajout d'une fonction de sélection manuelle de la langue avant la transcription pour améliorer la précision de la transcription dans les scénarios de détection non automatique |
| v3.0.6 | 2026-05-02 | Commutation du mode sombre/clair ; les résultats de transcription du locuteur sont regroupés et fusionnés par personne (en remplacement de l'affichage ligne par ligne) |
Vérification des candidats
- v2.0.0 (2025-09) est un tournant clé pour les produits de « utilisables » à « faciles à utiliser ». Le mode optimisé accélère la transcription de 2 fois et l'identification du locuteur ouvre la porte à des scénarios de réunion/entretien. La série v1.x avant cette version résolvait principalement des problèmes d'ingénierie de base tels que la « compatibilité Windows ».
- v3.0.0 (2026-03) clarifie le positionnement sécuritaire du produit. L’introduction de mécanismes hiérarchiques de contrôle d’accès et de protection des textes de transcription répond directement aux exigences fondamentales des secteurs juridique et médical en matière de conformité en matière de sécurité des données. Il s'agit du nœud de fonctionnalités le plus important qui distingue Ekhos AI de la plupart des outils de transcription cloud.
- v3.0.6 (2026-05) représente le dernier état de stabilité actuel. Le mode sombre améliore l'expérience utilisateur à long terme et le regroupement des locuteurs améliore considérablement la lisibilité des longs résultats de transcription.
Avantages techniques
Le parcours technique d'Ekhos AI ne vise pas à devenir leader en matière d'échelle de paramètres de modèle, mais se concentre sur la mise en œuvre de l'ingénierie autour des deux dimensions de « l'efficacité de l'inférence locale » et de « l'architecture de protection de la vie privée ».
Sélection à trois niveaux du pipeline d'inférence d'IA local : des modèles à trois niveaux intermédiaire, avancé et expert sont fournis, et les utilisateurs peuvent choisir librement en fonction du compromis entre précision et rapidité de la tâche. À en juger par les données de test de référence officielles, le temps nécessaire pour transcrire un audio MP3 anglais de 30 minutes sous différents niveaux de matériel et de modèle est le suivant :
| Configuration matérielle | Intermédiaire | Avancé | Expert |
|---|---|---|---|
| Processeur : i7-13620H / 16 Go de RAM (ordinateur portable 2023) | 38 minutes | 63 minutes | 72 minutes |
| GPU : RTX 4050 / 16 Go de RAM (même modèle) | 3 minutes | 4 minutes | 4 minutes |
| Processeur : AMD Ryzen 9 5900X / 32 Go de RAM (ordinateur de bureau 2020) | 31 minutes | 58 minutes | 59 minutes |
| Processeur : i5-1135G7 / 8 Go de RAM (ordinateur portable 2020) | 38 minutes | 64 minutes | 73 minutes |
Effet multiple de l'accélération GPU : à partir du test de référence, il peut voir que le GPU de l'ordinateur portable RTX 4050 a une vitesse d'inférence environ 12 fois plus rapide que le CPU de la même machine. Un enregistrement d'interview de 30 minutes nécessite environ une heure pour être transcrit en mode CPU (plus que la durée d'enregistrement elle-même), mais seulement 3 à 4 minutes en mode GPU - ce qui signifie que les utilisateurs peuvent obtenir leur premier brouillon juste après la réunion, plutôt que d'attendre après la pause déjeuner. Cet écart est encore amplifié dans les scénarios de transcription par lots.
Architecture de confidentialité sans exportation de données : les fichiers audio, les résultats de transcription et les pondérations des modèles d'IA sont tous stockés localement. Il n'y a aucune requête réseau pendant le processus de transcription, aucune télémétrie, aucune analyse d'utilisation et aucun transfert de données externes. Les données sont stockées dans une base de données SQLite locale et sont cryptées, prenant en charge un contrôle d'accès fort avec un mot de passe local + une phrase de récupération. Pour les scénarios soumis à des réglementations telles que HIPAA (soins de santé), RGPD (protection des données de l'UE), secret professionnel de l'avocat, etc., cette architecture répond naturellement aux exigences de conformité sans qu'il soit nécessaire de signer un DPA (accord de traitement de données) supplémentaire.
Capacités de transcription multilingue dans 98 langues : prend en charge la transcription dans 98 langues, dont le chinois, l'anglais, le japonais, le coréen, le français, l'allemand, l'espagnol, le portugais, le russe et l'arabe. Cette fonctionnalité repose sur des modèles vocaux multilingues, plutôt que sur la formation de modèles distincts pour chaque langue. Limite applicable : la précision des langues principales (anglais, chinois, espagnol, français et allemand) est nettement meilleure que celle des langues mineures (telles que l'hawaïen, le latin et le sanskrit). Dans le scénario chinois, l’effet de transcription des enregistrements en mandarin standard est meilleur, mais la précision des enregistrements avec de forts accents dialectaux ou un mélange de chinois et d’anglais diminuera.
Guide des pièges de l'ingénierie :
- Forte dépendance matérielle : sur un appareil avec la configuration la plus basse (8 Go de RAM, pas de GPU), le modèle Advanced/Expert prend 60 à 73 minutes pour transcrire 30 minutes d'audio, et l'efficacité réelle peut ne pas être aussi bonne qu'un travail manuel. Il est recommandé d'avoir au moins 16 Go de RAM + un processeur de milieu de gamme, ou d'opter directement pour un GPU RTX.
- Non pris en charge sur les systèmes non Windows : Actuellement uniquement pris en charge sur Windows 10/11. Non disponible pour les utilisateurs macOS et Linux, ce qui limite l'applicabilité dans les flux de travail multiplateformes.
- Restriction pour un seul utilisateur et un seul appareil : la licence est liée à un seul utilisateur et à un seul appareil, et la synchronisation entre appareils n'est pas prise en charge. Si vous devez utiliser le même compte Premium sur plusieurs ordinateurs, vous devez contacter le responsable pour confirmer s'il existe un plan d'autorisation multi-appareils.
Comment utiliser Ekhos AI
Le chemin d'utilisation d'Ekhos AI est très différent des outils SaaS traditionnels : il ne s'agit pas d'une application Web qui peut être utilisée en ouvrant un navigateur, mais d'un logiciel de bureau local qui doit être téléchargé et installé.
Première étape : Téléchargez et installez. Recherchez « EKHOS AI » sur le Microsoft Store ou visitez apps.microsoft.com/detail/9nqjkq3l649b pour télécharger et installer. Lancez l'application une fois l'installation terminée. La première fois que vous l'utilisez, vous devez créer un compte avec votre nom et votre adresse e-mail (uniquement pour l'authentification, aucune donnée n'est transmise). Le système garantit la sécurité de la connexion grâce à une connexion cryptée SSL et une URL tokenisée.
Étape 2 : Sélectionnez la méthode de transcription. L'interface principale propose trois entrées de transcription :
- Importer des fichiers : glisser-déposer ou parcourir pour sélectionner des fichiers audio et vidéo locaux (MP3, MP4, WAV, MKV, AVI, MPEG, etc.) et prendre en charge l'ajout par lots à la file d'attente.
- Transcription du microphone en temps réel : cliquez pour commencer à capturer l'entrée du microphone et transcrire le texte en temps réel, adapté aux entretiens en face à face ou à la dictée de notes.
- Transcription en direct du haut-parleur : transcrivez tout audio lu par votre système informatique (par exemple, réunions en ligne, podcasts, vidéos). Vous devez d'abord régler le périphérique de sortie sur « Stereo Mix » ou un périphérique équivalent dans les paramètres audio du système.
Étape 3 : Configurez les paramètres de transcription. Avant de démarrer la transcription, vous pouvez définir :
- Niveau de modèle IA : Intermédiaire (rapide) / Avancé (équilibré) / Expert (précision la plus élevée)
- Mode de transcription : Optimisé (vitesse 2x)/Standard/Identification du locuteur
- Langue : sélection manuelle ou détection automatique (le préréglage manuel est pris en charge depuis la v3.0.5)
- Durée de la transcription en direct (mode Live uniquement) : clips de 1/2/3/4 minutes
Étape 4 : Relecture et exportation. Une fois la transcription terminée, utilisez Tracks Editor pour synchroniser la lecture audio et relisez paragraphe par paragraphe pour rechercher et localiser le contenu clé. Après relecture, exportez vers Word, PDF ou Texte.
Liste des entrées de fonctions :
| Opération | Localisation de l'entrée | Scénarios d'utilisation |
|---|---|---|
| Importer des fichiers audio et vidéo | Interface principale / glisser-déposer | Transcription par lots d'entretiens, de réunions et de conférences enregistrés |
| Transcription en temps réel du microphone | Interface principale Bouton micro | Entretiens en face-à-face, notes orales |
| Transcription en temps réel du haut-parleur | Interface principale Bouton haut-parleur | Conférence en ligne, podcast, transcription doublage vidéo |
| Sélectionnez le modèle IA | Panneau des paramètres de pré-transcription | Sélectionnez en fonction de la qualité de l'enregistrement et du besoin de précision |
| Sélectionnez le mode de transcription | Panneau des paramètres de pré-transcription | Faire la distinction entre la rédaction rapide et l'annotation multi-locuteurs |
| Relecture de lecture multimédia | Éditeur de pistes | Corriger à l'écoute pour améliorer la précision finale |
| File d'attente par lots | File d'attente de l'interface principale | Traitement par lots de plusieurs fichiers d'enregistrement la nuit |
| Exporter le fichier | Liste de transcription / clic droit | Livrer à l'équipe en aval ou archiver |
Prix des produits
Ekhos AI adopte le modèle Freemium, avec une tarification à trois niveaux couvrant le spectre des besoins, depuis l'utilisation personnelle de l'éclairage jusqu'aux achats groupés en entreprise.
Édition gratuite (0 $) : 1 opportunité de transcription par jour, jusqu'à 30 minutes chacune. Prend en charge 98 langues, utilise la transcription en temps réel du microphone et du haut-parleur, fournit une vérification de base avec un éditeur de texte et exporte uniquement au format texte. Convient aux étudiants et aux utilisateurs légers à essayer. Une limite de temps unique de 30 minutes n’est pas suffisante pour des scénarios tels que les podcasts et les interviews de longue durée.
Version Premium (9 $/mois, payé annuellement) : Facturée sous forme d'abonnement annuel (équivalent à 108 $/an, 25 % de moins qu'un paiement mensuel). Débloquez des transcriptions illimitées, aucune limite de taille/durée/nombre de fichiers, l'identification et le marquage des locuteurs, l'exportation Word/PDF/Texte en file d'attente par lots et l'accélération GPU. Assistance technique par e-mail. Il s’agit du meilleur choix pour la grande majorité des utilisateurs ayant des besoins réguliers en matière de transcription.
Enterprise Edition : pour les achats groupés, veuillez contacter [email protected] pour un devis. Le site Web officiel ne divulgue pas les différences fonctionnelles de la version entreprise (telles que les licences multi-utilisateurs, le panneau de gestion centralisé, l'engagement SLA de modèle personnalisé, etc.), et les entreprises doivent confirmer une par une avec le responsable avant de prendre une décision d'achat.
Comparaison des coûts avec les outils de transcription cloud (déduction) :
| Comparaison | Ekhos AI Premium (9 $/mois) | Otter.ai Pro (environ 16,99 $/mois) | Trit (environ 60 $/mois) |
|---|---|---|---|
| Abonnement mensuel | 9 $ | ~17$ | ~60$ |
| Confidentialité des données | Local hors ligne, zéro téléchargement de données | Traitement en nuage | Traitement en nuage |
| Délai de transcription | Illimité | 1 200 minutes/mois | Sous réserve de planification |
| Reconnaissance du locuteur | ✅ | ✅ | ✅ |
| Format d'exportation | Mot/PDF/Texte | Plusieurs | Plusieurs |
| Synchroniser sur tous les appareils | ❌ (un seul appareil) | ✅ | ✅ |
| Édition collaborative | ❌ | ✅ | ✅ |
| Investissement matériel | Besoin d'apporter votre propre ordinateur Win + GPU (facultatif) | Juste un navigateur | Juste un navigateur |
Explication de la déduction : Ekhos a un net avantage de prix en termes de frais mensuels (environ 1/6 de Trint, soit la moitié d'Otter.ai), mais cet avantage est basé sur le principe de « renoncer à la synchronisation entre appareils et à la collaboration multi-utilisateurs ». Pour un scénario axé sur la confidentialité impliquant une seule personne et un seul appareil, le coût total de possession d'Ekhos (logiciel 108 $/an + appareil Windows existant) est bien inférieur à celui des solutions cloud. Pour les scénarios d'équipe qui nécessitent une collaboration en équipe et un accès multiplateforme, la valeur ajoutée des outils cloud peut compenser la différence de prix.
Scénarios d'application
L'attribut « local hors ligne » d'Ekhos AI détermine que ses scénarios applicables ont des limites claires : tout scénario dans lequel « les données ne peuvent pas quitter l'appareil » est son champ d'origine.
-
Procès-verbaux des réunions du secteur juridique : les enregistrements des réunions avocat-client sont généralement protégés par le secret professionnel de l'avocat et ne peuvent pas être téléchargés sur des services cloud tiers. Les capacités de transcription entièrement natives d'Ekhos AI permettent aux avocats d'effectuer des enregistrements en texte sur des appareils Windows sur site sans craindre de fuite de données. Points clés à vérifier : L'exactitude de la transcription des termes juridiques (expressions latines, citations de cas) doit être axée sur les tests ; il est recommandé d'utiliser 5 à 10 enregistrements légaux réels pour des tests de comparaison avant utilisation officielle, et de les comparer avec le temps de relecture manuelle.
-
Dictée médicale et transcription des dossiers médicaux : les dossiers médicaux dictés par les médecins, les dossiers chirurgicaux et les enregistrements de consultation impliquent des exigences de conformité HIPAA. La nature sans transfert de données d'Ekhos AI élimine le processus fastidieux de signature d'un BAA (Business Associate Agreement). Points clés de vérification : L'exactitude de la reconnaissance des termes médicaux (noms de médicaments, structures anatomiques, codes de diagnostic) ; si la vitesse de réalisation de 30 minutes de transcription en 3 à 4 minutes sous accélération GPU peut répondre aux besoins d'archivage immédiat après un service ambulatoire.
-
Compilation de brouillons d'interview de journaliste : le journaliste peut obtenir la première ébauche du texte grâce à une transcription en temps réel via le microphone du site de l'interview et exporter directement l'interview quelques minutes après l'interview. Pour plusieurs séries d'entretiens, la fonction de file d'attente par lots planifie la transcription en arrière-plan entre les entretiens. Points clés de vérification : Précision de l'identification de l'orateur dans les scénarios d'entretien à plusieurs personnes ; Cohérence de la transcription des interviewés avec des accents différents.
-
Collecte de données de recherche universitaire : les chercheurs organisent des enregistrements audio de discussions de groupe, d'entretiens approfondis et de conférences universitaires. La prise en charge de 98 langues lui permet de gérer des documents de recherche multilingues. Réduction des coûts et amélioration de l'efficacité : la transcription manuelle traditionnelle d'un entretien d'une heure prend environ 4 à 6 heures (y compris la relecture) ; en utilisant Ekhos AI (mode optimisé + intermédiaire + relecture de l'éditeur de pistes), le temps total peut être réduit à 30 à 60 minutes et l'efficacité est améliorée d'environ 4 à 6 fois. Notez cependant que les enregistrements avec de forts accents dialectaux ou un bruit de fond peuvent nécessiter le modèle Expert et des temps de vérification plus longs.
-
Processus de podcasting et de production de contenu : les producteurs de podcasts peuvent utiliser le mode d'identification du locuteur pour générer automatiquement des transcriptions de podcast qui incluent des balises de locuteur comme base pour les notes d'émission, les copies sur les réseaux sociaux ou le matériel des moteurs de recherche. Points clés de vérification : L'exactitude de la segmentation des phrases lors de conversations à plusieurs personnes ; performances dans des conditions d'enregistrement non idéales telles que les changements de débit de parole et le chevauchement de parole qui sont courants dans les podcasts.
Personnes concernées
Le profil d'utilisateur principal d'Ekhos AI n'est pas « les premiers utilisateurs à la recherche de la dernière technologie d'IA », mais « les professionnels ayant des contraintes de conformité claires ou des besoins urgents en matière de confidentialité ».
-
Professionnels du droit (avocats, affaires juridiques, responsables de la conformité) : les enregistrements des réunions clients, des audiences judiciaires et des négociations contractuelles doivent être transcrits mais ne doivent pas être téléchargés sur le cloud. L’architecture locale hors ligne d’Ekhos AI répond naturellement aux exigences de confidentialité. Prérequis : Doit être utilisé sur un appareil Windows ; 16 Go de RAM ou plus sont recommandés pour garantir l’efficacité de la transcription. Ne convient pas aux limites : Ne convient pas aux équipes juridiques qui ont besoin que plusieurs personnes collaborent sur la même transcription - Ekhos ne prend actuellement pas en charge la collaboration en temps réel entre plusieurs utilisateurs.
-
Praticiens médicaux (médecins, infirmières, archivistes médicaux) : les exigences de transcription pour les dictées de dossiers médicaux, les enregistrements de consultation et les dossiers chirurgicaux sont soumises à des restrictions strictes sur l'exportation de données dans le cadre de la HIPAA. Le stockage crypté natif d’Ekhos élimine le besoin de signer un BAA. Ne correspond pas aux limites : organisations qui doivent intégrer des systèmes DSE/DME - Ekhos n'offre actuellement pas d'API ou de plug-in d'intégration de système d'information de santé.
-
Journalistes et professionnels des médias : la translittération rapide des enregistrements d'entretiens peut réduire considérablement le délai entre l'entretien et la publication. La fonction de transcription par microphone en temps réel convient aux scénarios d’entretiens en direct. Prérequis : Le microphone doit être calibré avant l'entretien et le bruit ambiant doit être acceptable ; pour les entretiens en table ronde à plusieurs, il est recommandé d'utiliser un enregistreur indépendant + transcription importée au lieu d'une transcription par microphone en temps réel.
-
Chercheurs et étudiants universitaires : Besoin de transcrire des cours, des entretiens, des discussions de groupe en texte pour une analyse qualitative. La prise en charge de 98 langues couvre des scénarios de recherche multilingues. Ne convient pas aux limites : chercheurs qui doivent effectuer un codage qualitatif complexe ou une analyse linguistique des résultats de transcription - Ekhos exporte du texte brut/Word/PDF et ne produit pas de formats adaptés au codage alignés sur l'horodatage (tels que les annotations de chronologie au format CSV/JSON).
-
Producteur de podcasts et créateur de contenu : transcrivez automatiquement l'audio du podcast en transcriptions textuelles pour une utilisation dans les notes de présentation, le référencement et la recréation des médias sociaux. Ne convient pas aux limites : les producteurs de podcasts qui ont besoin d'éditer l'audio tout en éditant la transcription - Des outils tels que Descript intègrent profondément l'édition audio et l'édition de transcription, et le flux de travail de transcription + relecture d'Ekhos est plus adapté aux processus de traitement linéaire.
Résumé des limites inappropriées : Ekhos AI ne convient pas aux utilisateurs qui ont besoin d'une synchronisation entre appareils, d'une édition en collaboration en équipe, de plates-formes non Windows ou qui ont besoin d'une intégration API. Il s'agit d'un outil spécial conçu pour les scénarios « d'une seule personne, d'une seule machine, axés sur la confidentialité d'abord », et non d'une plate-forme de transcription à usage général.
Résumé et Outlook
Ekhos AI a trouvé une différenciation précise sur le marché de la transcription de l'IA : « local hors ligne + confidentialité d'abord », qui constitue à la fois son cœur de compétitivité et son plafond incassable.
Principaux avantages actuels : dans le contexte de tous les outils de transcription grand public adoptant une architecture de traitement cloud, Ekhos est l'un des rares produits de bureau à atteindre « zéro données sortantes ». La combinaison de modèles d'IA à trois niveaux + trois modes de transcription offre aux utilisateurs un compromis flexible entre précision et vitesse. Le prix de 9 $/mois est parmi les plus bas parmi les outils similaires. 12 versions ont été publiées en 15 mois (2025-03 à 2026-05) et le passage de la v1.0.0 à la v3.0.6 a été réalisé. L’efficacité des itérations est digne de reconnaissance.
Limites majeures actuelles : prend uniquement en charge les plates-formes Windows, exclut les utilisateurs macOS et Linux. L'autorisation pour un seul appareil et un seul utilisateur limite le scénario de commutation entre plusieurs appareils. Le fait de ne pas prendre en charge l'intégration de l'API signifie qu'elle ne peut pas être intégrée au système d'automatisation des flux de travail existant de l'entreprise. Il n'y a pas de fonctions de synchronisation cloud et d'édition collaborative, et il ne convient pas aux scénarios d'équipe. L'exactitude de la transcription des langues minoritaires n'a pas été vérifiée par un tiers indépendant.
Éléments à voir : Si l'équipe lancera une version macOS pour élargir la base d'utilisateurs ; s'il introduira un mode cloud facultatif (activer la synchronisation en cas de besoin) pour équilibrer confidentialité et commodité ; si la version entreprise inclura des capacités de gestion multi-utilisateurs et de déploiement centralisé, ce qui détermine si elle peut entrer dans la liste d'achats de l'organisation.
Évaluation des risques d'achat et d'adoption : Pour les utilisateurs individuels (avocats, journalistes, chercheurs), la version Premium à 9 $/mois est un investissement à faible risque : la version gratuite peut effectuer une vérification fonctionnelle et passer à Premium pour débloquer une productivité totale. Avant l'installation, il est recommandé d'utiliser la version gratuite pour traiter 5 à 10 enregistrements réels de la scène cible afin de confirmer que la vitesse et la précision de la transcription atteignent la ligne utilisable sous la configuration matérielle attendue. Pour les achats institutionnels, l'accent doit être mis sur : les systèmes de licences multi-appareils (si plusieurs employés sont autorisés à être utilisés au sein de la même organisation), si le format d'exportation est compatible avec le système de gestion de documents interne et l'engagement de l'équipe de développement en faveur des mises à jour de version à long terme et des corrections de bugs - en tant que petite startup australienne fondée en 2024, sa capacité à poursuivre ses opérations doit être prise en compte dans l'évaluation des risques.
Outils associés : elevenlabs, udio
Informations de version
- actuel :Version actuelle.
- lancement :Le produit est mis en ligne.
Avis des utilisateurs