Arize Phoenix
Gratuit
Arize Phoenix est une plateforme d'observabilité d'IA open source lancée par Arize AI. Il couvre le traçage LLM/agent, la collecte OpenTelemetry, l'évaluation LLM en tant que juge, les ensembles de données, les terrains de jeux expérimentaux et la gestion des invites. Il convient aux équipes de développement pour déboguer et améliorer les applications d'IA localement, dans des conteneurs Kubernetes ou Phoenix Cloud.
Texte de l'outil
Paramètres et statistiques de base
Arize Phoenix est une plateforme open source d'observabilité et d'évaluation pour les équipes d'ingénierie en IA. L'objectif principal n'est pas de remplacer le modèle lui-même, mais de précipiter les preuves en cours d'exécution pendant le processus d'itération de LLM, RAG, agent et invite : la durée du lien de demande, le jeton et le coût, le contexte de récupération, les résultats d'évaluation, la version de l'ensemble de données et les résultats expérimentaux peuvent tous être observés dans le même système. Le README officiel de GitHub positionne Phoenix comme une plateforme d'observabilité de l'IA open source, couvrant l'expérimentation, l'évaluation et le dépannage.
| Projets | Informations publiques |
|---|---|
| Nom du produit | Arize Phoenix |
| Entrée officielle | phoenix.arize.com |
| Saisie des documents | arize.com/docs/phoenix |
| Dépôt GitHub | Arize-ai/phoenix |
| Paquet PyPI | arize-phoenix |
| Version actuelle | 17.9.0, publié le 19/06/2026 |
| Licence | Licence élastique 2.0 ; la documentation officielle explique que l'auto-hébergement est gratuit et n'a pas de seuil fonctionnel |
| Formulaire de déploiement | Carnet Jupyter local, Docker, Kubernetes/Helm, Phoenix Cloud/Arize AX |
| Compétences de base | Traçage, évaluation, ensembles de données, expériences, terrain de jeu, gestion des invites, PXI |
| Normes d'observation | Écosystème de traçage et de suivi automatique basé sur OpenTelemetry / OpenInference |
| Langue et intégration | SDK Python, JavaScript/TypeScript ; prend en charge OpenAI, Anthropic, Google, Bedrock, LangChain, LlamaIndex, DSPy, CrewAI et d'autres écosystèmes |
| Taille de la communauté | GitHub environ 10,2 000 étoiles, environ 936 forks ; le dernier package PyPI nécessite Python >=3.10,<3.15 |
Ces paramètres indiquent que Phoenix est plus proche d’un « atelier de débogage et d’évaluation d’applications IA » que d’une simple plateforme de journalisation. Il relie l'observation, l'évaluation et l'expérimentation : lorsqu'une trace montre une latence élevée, une récupération médiocre ou un risque d'hallucination, l'équipe peut continuer à suivre l'invite correspondante, les échantillons d'ensembles de données et les résultats expérimentaux pour former un enregistrement de projet reproductible.
Reconnaissance des utilisateurs et du marché
La reconnaissance de Phoenix sur le marché provient principalement de trois types de signaux. Le premier est l'adoption par les développeurs open source : l'échelle de plus de 10 000 étoiles sur GitHub montre qu'il ne s'agit plus d'un premier concept d'entrepôt, mais d'un projet d'infrastructure qui fait l'objet d'une attention continue et est utilisé dans le domaine de l'observabilité LLM. Le second est la distribution des packages et des images : le responsable maintient simultanément le package PyPI, le sous-package Python d'image Docker et le package TypeScript, indiquant que les scénarios d'utilisation couvrent les prototypes de notebook, les applications serveur, le déploiement conteneurisé et les chaînes d'outils front-end/Node. Le troisième est l'engagement commercial d'Arize : Phoenix peut être auto-hébergé gratuitement, ou vous pouvez utiliser la version hébergée via Phoenix Cloud/Arize AX, laissant différentes voies de mise en œuvre pour les développeurs individuels et les équipes d'entreprise.
Les signaux écologiques donnés par la page officielle de Phoenix incluent plus de 3 millions de téléchargements mensuels, plus de 10 000 étoiles GitHub, plus de 7 000 communautés et plus de 22 millions de téléchargements mensuels d'instruments OpenTelemetry. Ces chiffres conviennent mieux comme référence pour la popularité et l'activité écologique que pour le nombre de clients d'entreprise ou de données sur les revenus ; les achats réels doivent toujours être jugés en fonction de la taille des traces de l’équipe, des exigences de conservation des données, des exigences de conformité et des capacités d’auto-hébergement.
Du point de vue des portraits d'utilisateurs, Phoenix aura plus de valeur après la croissance des agents d'IA et des applications RAG. Pour une simple démonstration de chat, il vous suffit d'imprimer le journal pour le dépannage ; une fois que le système inclut la récupération, l'invocation d'outils, la collaboration multi-agents, les sessions utilisateur et l'évaluation automatique, il est difficile de répondre « quelle étape a provoqué une dégradation de la qualité » avec les journaux traditionnels. L’intérêt de Phoenix réside dans la structuration de ces preuves opérationnelles afin que les équipes de développement, d’évaluation, produit et plateforme puissent discuter autour d’une même trace.
Avantage de coût
Le principal avantage de Phoenix en matière de coût réside dans « l'open source auto-hébergé gratuitement + un cloud géré à la demande ». La documentation officielle d'auto-hébergement indique clairement : l'auto-hébergement de Phoenix sur votre propre infrastructure ou compte cloud est gratuit, il n'y a pas de frais de licence, il n'y a pas de limites d'utilisation ni de seuils de fonctionnalités, et aucune donnée n'est envoyée à Arize. Ceci est essentiel pour les équipes qui gèrent des données commerciales sensibles, souhaitent contrôler la période de conservation ou nécessitent un déploiement intranet.
| Solutions | Structure des coûts | Forme d'équipe | Compromis clés |
|---|---|---|---|
| Local / Carnet | Le logiciel lui-même est gratuit et le coût correspond principalement aux ressources locales et au temps de débogage | PoC, enseignement et dépannage rapide pour les développeurs individuels | Ne convient pas à la collaboration à long terme et au maintien de la production par plusieurs personnes |
| Docker / Composer | Le logiciel est gratuit et couvre les coûts de serveur, de stockage, de sauvegarde et d'exploitation et de maintenance | Petite équipe, pilote interne, production légère | Besoin de gérer vous-même les mises à niveau et les configurations de sécurité |
| Kubernetes / Barre | Le logiciel est gratuit et le coût provient des clusters, du stockage objet, des bases de données, de la surveillance et du SRE | Équipes de plateforme, entreprises sensibles aux données | La complexité de l'exploitation et de la maintenance est plus élevée, mais les capacités de gouvernance sont plus fortes |
| Phoenix Cloud / Arize AX Gratuit | La page de tarification officielle montre que Free est destiné aux développeurs uniques, avec 25 000 traces/mois, 1 Go, 15 jours de rétention | Individus ou petites équipes qui souhaitent démarrer rapidement et ne souhaitent pas déployer d'infrastructure | Le quota gratuit et la période de conservation sont limités |
| Arize AX Pro | La page de tarification officielle montre que Pro est destiné aux petites équipes/équipes de démarrage, comprend 50 000 traces/mois, 10 Go, une conservation de 30 jours et prend en charge une utilisation supplémentaire | Nécessite des services d'hébergement et une collaboration d'équipe | Le coût augmente avec la durée et le volume de données |
| AXE Entreprise | Devis personnalisé mettant l'accent sur la prise en charge des SLA, SOC2/HIPAA, des formations, des modules complémentaires auto-hébergés, etc. | Organisations avec de solides processus de conformité SLA et d'approvisionnement d'entreprise | Communication commerciale et confirmation du contrat requises |
Le chemin auto-hébergé de Phoenix réduit considérablement le risque de dépendance vis-à-vis d'un fournisseur par rapport aux outils d'observabilité qui proposent uniquement du SaaS hébergé. Le véritable coût total ne disparaît pas, mais passe de la licence logicielle à l'infrastructure, à la conservation des données, au contrôle d'accès, à la récupération des sauvegardes et aux processus de mise à niveau. Pour les équipes dotées de solides capacités d'ingénierie, de sensibilité des données ou de plates-formes Kubernetes existantes, cette structure de coûts est généralement plus contrôlable ; pour les petites équipes sans capacités d’exploitation et de maintenance, la version hébergée est plus simple.
Fonctions principales
- Traçage : collectez les liens d'exécution de l'application LLM via OpenTelemetry/OpenInference, affichez la trace, la durée, le jeton de retard, le coût, les entrées et sorties, les résultats de récupération et les appels d'outils, adaptés au dépannage des problèmes de qualité et de performances du RAG, de l'agent et du flux de travail.
- Évaluation : prend en charge les modes d'évaluation tels que les évaluations de réponses, les évaluations de récupération, le LLM en tant que juge, etc., et associe les hallucinations, l'exactitude de l'assurance qualité, la pertinence et d'autres indicateurs pour tracer ou des résultats expérimentaux pour aider l'équipe à convertir « ne pas se sentir bien » en indicateurs comparables.
- Ensembles de données : créez des ensembles d'échantillons versionnés pour les tests de régression, l'évaluation précise ou la comparaison rapide, réduisant ainsi le risque de vous fier uniquement à des vérifications ponctuelles manuelles après chaque modification rapide.
- Expériences : suivez les différences d'effet causées par les modifications des invites, des modèles, des configurations de récupération, des paramètres et du code, adaptées à la comparaison de plusieurs plans avant de passer en ligne.
- Playground : optimisez les invites, comparez les modèles, ajustez les paramètres et rejouez les appels LLM tracés, adaptés au retour à l'interface de débogage à partir d'échantillons d'échecs réels.
- Gestion des invites : effectuez un contrôle de version, une gestion des balises et des tests systématiques des invites afin que les modifications des invites puissent être enregistrées et annulées comme les modifications de code.
- PXI / Phoenix Intelligence : le README officiel le décrit comme un agent d'ingénierie d'IA intégré pour le débogage des traces, l'itération des invites et la navigation dans le produit, ce qui convient pour abaisser le seuil permettant aux nouveaux membres de comprendre les traces.
- Écosystème MCP et CLI :
@arizeai/phoenix-mcpet@arizeai/phoenix-cliofficiellement répertoriés, qui sont utilisés pour connecter les fonctionnalités de Phoenix aux contextes de développement ou aux flux de travail d'agent tels que Cursor et Claude Code.
La combinaison de ces fonctions permet à Phoenix non seulement de « lire les journaux », mais également de connecter directement les données d'observation aux expériences et aux évaluations. Pour les produits d’IA, le plus difficile n’est souvent pas de voir une erreur, mais de savoir si l’erreur est reproductible, si elle est corrigée par une nouvelle invite et si elle nuit à d’autres échantillons. Phoenix est conçu autour de cette problématique.
Evolution du modèle et de la version
Phoenix lui-même n'est pas un modèle de base, mais une plateforme d'observabilité et d'évaluation des applications d'IA ; l'évolution de la version fait ici référence à l'itération du package « arize-phoenix » et aux capacités de la plateforme. L'historique des versions de PyPI montre que Phoenix maintient toujours des versions à haute fréquence en 2026, 17.9.0 a été téléchargé le 19/06/2026, 17.8.1 et 17.8.0 ont tous deux été publiés le 17/06/2026 et 17.7.0 a été publié le 16/06/2026.
| Temps | Version | Signal public |
|---|---|---|
| 2026-06-19 | 17.9.0 | Version de GitHub marquée comme la plus récente ; PyPI fournit simultanément la distribution de roues et de sources |
| 2026-06-17 | 17.8.1 | 17.8 Version de maintenance principale |
| 2026-06-17 | 17.8.0 | Version des fonctionnalités principales de la version 17.x |
| 2026-06-16 | 17.7.0 | Version des fonctionnalités principales de la version 17.x |
| 2026-06-02 | 17.0.0 | 17.x est l'un des points de départ de la version majeure, indiquant que la plateforme évolue encore rapidement |
Du point de vue de l’adoption technique, l’itération des versions haute fréquence présente deux faces. D'une part, cela montre que Phoenix répond activement à l'évolution rapide de l'écosystème LLM/agent et peut rapidement suivre de nouveaux cadres, de nouveaux fournisseurs et flux de travail d'évaluation ; d'autre part, le déploiement en production nécessite la mise en place de processus de correction de version, de vérification de mise à niveau et de migration de données, en particulier dans les scénarios auto-hébergés, et il n'est pas approprié de suivre directement chaque petite version pour une mise à niveau automatique.
Avantages techniques
Le premier avantage technique de Phoenix est qu’il s’agit avant tout d’OpenTelemetry. Observabilité LLM Si vous utilisez un format de point enterré privé, vous pouvez produire rapidement des graphiques à court terme, mais il est facile de verrouiller les données dans un seul outil à long terme. L'itinéraire basé sur OTel/OpenInference de Phoenix facilite la circulation des données de trace entre les langages, les frameworks et les services, et permet également aux entreprises d'accéder aux pipelines observables existants.
Le deuxième avantage est que "trace et évaluation sont sur le même écran". De nombreux systèmes peuvent enregistrer la chaîne d’appels, mais ils ne peuvent pas expliquer si ce lien est bon ou non ; d'autres outils d'évaluation peuvent donner des points, mais ils peuvent ne pas être en mesure de retrouver les invites spécifiques du document de recherche, les paramètres du modèle et les appels d'outils. Phoenix attache les résultats de l'évaluation à la trace et peut retracer une réponse échouée jusqu'à l'étendue du fragment récupéré et juger les résultats.
Le troisième avantage est expérimental. Les ensembles de données, les expériences, le terrain de jeu et la gestion des invites permettent à Phoenix de couvrir le processus depuis la découverte du problème jusqu'à la comparaison des solutions. L'équipe peut accumuler des échantillons d'échecs en ligne dans un ensemble de données, puis comparer les changements d'indicateurs de différentes invites, modèles ou configurations de récupération, au lieu de simplement essayer encore et encore dans la fenêtre de discussion.
Le quatrième avantage est l’élasticité du déploiement. Le README officiel explique que Phoenix peut s'exécuter sur une machine locale, un ordinateur portable Jupyter, un déploiement conteneurisé ou dans le cloud ; le document d'auto-hébergement clarifie également les chemins vers Docker, Kubernetes/Helm, etc. Cette flexibilité permet à Phoenix de servir à la fois le débogage personnel et d'entrer progressivement dans les plateformes internes de l'entreprise.
Comment utiliser
Le parcours d'utilisation de Phoenix est généralement divisé en trois étapes, de légère à lourde : d'abord l'exécuter localement, puis se connecter au traçage et enfin établir un processus d'évaluation et d'expérimentation.
| Entrée | Convient pour l'action | Descriptif |
|---|---|---|
PyPI arize-phoenix |
Installez le notebook localement pour le débogage et un essai rapide | pip install arize-phoenix pour démarrer Phoenix |
| Docker | Déploiement local ou sur serveur | Convient aux instances partagées en équipe ou à la vérification de production légère |
| Kubernetes / Barre | Production, auto-hébergement, plateforme | Convient aux équipes disposant d'une plate-forme K8s existante et d'exigences de conformité |
| Phoenix Cloud / Arize AX | Utilisation hébergée | Pour les équipes qui ne souhaitent pas entretenir l’infrastructure |
| Point de terminaison SDK / OTEL | Accéder aux traces des applications | Envoyer des étendues de framework LLM d'application Python/JS ou d'exécution d'agent à Phoenix |
Le processus de démarrage typique est le suivant :
- Choisissez une méthode de déploiement : les essais personnels peuvent démarrer localement ou sur Phoenix Cloud, le PoC d'entreprise peut utiliser Docker et l'auto-hébergement en production est préféré pour évaluer Kubernetes/Helm.
- Connectez les instruments OpenInference/OpenTelemetry à l'application, tels que OpenAI, Anthropic, LangChain, LlamaIndex, CrewAI, DSPy et d'autres intégrations.
- Affichez les traces dans Phoenix et confirmez d'abord si le niveau de portée, les entrées et sorties, le jeton de document de récupération et la latence sont complets.
- Créez des évaluations pour les tâches critiques telles que la pertinence de la récupération, l'exactitude des réponses, les hallucinations, la conformité du format ou les métriques personnalisées.
- Précipitez les échantillons ayant échoué dans l'ensemble de données et utilisez des expériences pour comparer différentes invites, modèles, paramètres et stratégies de récupération.
- Corrigez la version et la configuration du déploiement avant de passer en ligne, et confirmez les politiques de contrôle d'accès, de conservation des données, de sauvegarde, de mise à niveau et de traitement des données sensibles.
Prix des produits
La tarification de Phoenix doit faire la différence entre l'hébergement source et les services d'hébergement Arize. L'open source Phoenix est libre de s'auto-héberger. Le document de licence officiel indique qu'il est basé sur la licence Elastic 2.0, permettant un auto-hébergement gratuit dans votre propre infrastructure ou compte cloud, et qu'il n'y a aucun seuil fonctionnel. En d’autres termes, si l’équipe est elle-même responsable de l’infrastructure, de l’exploitation et de la maintenance, Phoenix Ontology ne facture pas par sièges, travées ou modules fonctionnels.
En termes de services d'hébergement, la page de tarification d'Arize place Phoenix sous le système Arize AX : Free est destiné aux développeurs individuels, Pro est destiné aux petites équipes et aux équipes de démarrage, et Enterprise est destiné aux forfaits personnalisés. La page publique montre que Free inclut 25 000 traces/mois, 1 Go de conservation de données pendant 15 jours ; Pro comprend 50 000 traces de span/mois, 10 Go, 30 jours de rétention et propose une facturation de span et de Go supplémentaires ; Enterprise est personnalisé et met l'accent sur la prise en charge exclusive des fonctionnalités d'entreprise telles que SLA, SOC2/HIPAA, la formation, les modules complémentaires auto-hébergés et la résidence des données.
Lors de la sélection proprement dite, il n’est pas recommandé de simplement comparer les prix catalogue. Le coût de l’observabilité de l’IA est fortement lié à la granularité des traces, à la longueur du contexte, à la taille des documents récupérés, à la période de conservation, à la taille de l’équipe et aux exigences de conformité. La phase PoC peut commencer par un auto-hébergement gratuit ou un Free Cloud ; une fois que vous entrez en production, la croissance du stockage, les performances des requêtes, le contrôle d'accès, les politiques de masquage et la maintenance des mises à niveau doivent être inclus dans le budget.
Scénarios d'application
- Dépannage de la qualité des applications RAG : enregistrez les questions des utilisateurs, récupérez les résultats du reclassement des documents, générez des réponses et des scores d'évaluation, et localisez rapidement les erreurs dues aux récupérations manquantes, aux invites sans contexte peu claires ou aux échecs d'inférence de modèle.
- Débogage des appels d'agents et d'outils IA : développez la décision, la latence, le jeton et l'état d'échec de l'agent d'appel d'outil en plusieurs étapes dans un graphique de trace, adapté au dépannage des points bloqués des agents à liaison longue.
- Test de régression d'invite : ajoutez des échantillons d'échec réels à l'ensemble de données, comparez les nouvelles et anciennes invites, différents modèles et combinaisons de paramètres dans les expériences pour réduire le risque de régression provoqué par l'itération d'invite.
- Évaluation préalable au lancement du produit LLM : utilisez des évaluations de réponse et des évaluations de récupération pour établir le seuil de lancement, permettant aux équipes de produit, d'algorithme et d'ingénierie de discuter s'il peut être publié autour du même ensemble d'indicateurs.
- Gouvernance de la plateforme d'IA interne à l'entreprise : Phoenix auto-hébergé, laissant des traces et des évaluations dans l'intranet ou dans le cloud propre, tout en unifiant les spécifications d'observation de chaque équipe métier.
- Débogage local du développeur : démarrez rapidement Phoenix dans un ordinateur portable ou un service local, affichez la chaîne d'appels et les résultats de l'évaluation, et c'est plus facile à consulter que les journaux dispersés.
Ce que ces scénarios ont en commun, c'est qu'une seule sortie ne peut pas indiquer si le système est fiable, et la relation d'entrée, de contexte, de lien d'exécution, d'évaluation et de version doit être enregistrée. Phoenix est le plus précieux dans ce type de travail qui nécessite une « chaîne de preuves ».
Personnes concernées
- Développeur d'applications LLM : besoin de voir le comportement spécifique du modèle, de l'outil, de la récupération et de l'invite lors d'un appel, plutôt que d'obtenir simplement la réponse finale.
- Équipe d'ingénierie RAG/agent : le lien système est long et la cause de l'échec peut survenir lors de la récupération, du reclassement, de l'appel d'outil, de la planification ou de la réponse finale.
- Équipe AI Platform : j'espère unifier le traçage, les évaluations, les ensembles de données et les expériences au sein de l'organisation et réduire la duplication des outils d'observation pour chaque équipe commerciale.
- Équipe de science des données et d'évaluation : Il est nécessaire de relier l'échantillon artificiel LLM-as-a-juge, les indicateurs expérimentaux et les traces en ligne.
- Entreprises de conformité ou sensibles aux données : vous souhaitez auto-héberger et contrôler la résidence des données, le contrôle d'accès, les périodes de conservation et les limites d'audit.
Les situations dans lesquelles il n'est pas adapté sont également claires : s'il ne s'agit que d'une démo unique, de scripts internes à basse fréquence et d'une simple page de discussion sans liens en plusieurs étapes, le concept et le coût de déploiement de Phoenix peuvent être élevés. Une autre limite concerne les capacités d'exploitation et de maintenance : bien que l'auto-hébergement soit gratuit, l'utilisation en production nécessite toujours la maintenance des bases de données, du stockage, des sauvegardes, des autorisations, des mises à niveau et de la surveillance ; les petites équipes sans capacités de plate-forme peuvent être plus adaptées pour commencer avec Phoenix Cloud ou Arize AX.
Résumé et Outlook
La compétence principale d'Arize Phoenix est de connecter « voir le problème » et de « prouver la solution » des applications d'IA. Le traçage permet à l'équipe de savoir comment un résultat est généré, l'évaluation permet à l'équipe de savoir si les résultats répondent aux normes, et les ensembles de données et les expériences permettent à l'équipe de savoir si un certain changement améliore réellement le système. Pour les applications LLM, RAG et agents rapidement itératives, cette fermeture est plus fiable que de simples journaux ou un seul examen humain.
Trois limites principales doivent être notées à l'heure actuelle. Premièrement, bien que Phoenix soit open source et auto-hébergé gratuitement, la licence est Elastic License 2.0, ce qui n'est pas équivalent aux licences libres telles qu'Apache/MIT. La redistribution commerciale et le packaging d'hébergement nécessitent une confirmation légale. Deuxièmement, les versions à haute fréquence nécessitent que l'équipe de production effectue des corrections de version et des tests de mise à niveau. Troisièmement, l’efficacité de Phoenix dépend de la qualité des points enterrés ; si la structure de trace, la désensibilisation des entrées et des sorties ou la conception de l'échantillon d'évaluation ne sont pas bonnes, quelle que soit la qualité de l'interface, elle ne peut présenter que des preuves incomplètes.
Il vaut la peine de continuer à observer les progrès de Phoenix sur trois axes à l'avenir : premièrement, l'écosystème OpenInference/OTel couvre davantage de frameworks d'agents ; deuxièmement, si les agents d'ingénierie IA tels que PXI, MCP et CLI peuvent transformer davantage la « visualisation des traces » en « positionnement automatique et réparations recommandées » ; troisièmement, si les frontières entre Arize AX et open source Phoenix restent claires, afin que les individus, les équipes open source et les entreprises puissent choisir la voie appropriée en fonction de la gouvernance des données et des exigences de coûts.
Outils associés : hugging-face, replicate
Informations de version
- arize-phoenix v17.9.0 :Les versions GitHub et PyPI affichent la dernière version d'arize-phoenix ; le résumé du package PyPI est AI Observability and Evaluation, et la licence est étiquetée Elastic-2.0.
- arize-phoenix v17.8.1 :Version de maintenance principale 17.x, publiée immédiatement après la version 17.8.0.
- arize-phoenix v17.8.0 :Version des fonctionnalités principales 17.x, utilisée pour l'itération continue des fonctionnalités de la plate-forme Phoenix.
- arize-phoenix v17.7.0 :Sorties des fonctionnalités principales de la version 17.x, à une cadence de publication élevée en juin 2026.
Avis des utilisateurs