Arize IA Gratuit

-

Arize AI est une plate-forme d'ingénierie pour les applications AI Agent et LLM, proposant deux gammes de produits : Arize AX (cloud SaaS) et (open source). Couvrant le suivi du comportement des agents, l'évaluation LLM, l'optimisation des invites de gestion des expériences, l'assistant d'ingénierie Alyx AI et l'intégration du tissage de données, aidant l'équipe à passer du « débogage par ressenti » à « l'amélioration systématique basée sur la trace et l'évaluation ».

Arize IA Interface du produit

Texte de l'outil

Paramètres et statistiques de base

Le système de produits d'Arize AI est divisé en deux lignes : Arize AX (plateforme cloud SaaS) et Arize Phoenix (plateforme d'observabilité d'IA open source). Le premier est destiné aux scénarios au niveau de l'entreprise qui nécessitent des services gérés et une collaboration en équipe, tandis que le second est destiné aux équipes de développement qui nécessitent l'auto-hébergement, la résidence des données ou le débogage local. Les deux partagent le même ensemble de normes de données et de moteurs d’évaluation OpenInference/OpenTelemetry.

Projets Informations publiques
Système de produits Arize AX (Cloud SaaS) + Arize Phoenix (Open Source)
Entrée officielle arize.com
Documentation produit arize.com/docs
Organisation GitHub github.com/Arize-ai — 72 référentiels
Dépôt principal Phoenix (10,6k étoiles), OpenInference (1,1k étoiles)
Licence Open Source Licence Elastic 2.0 (Phoenix), Apache-2.0 (OpenInference, etc.)
Volume de traitement mensuel de la plateforme Plus de 1 000 milliards de portées, plus de 1 milliard d'évaluations, plus de 5 millions de téléchargements
Clients d'entreprise Reddit, DoorDash, Uber, Instacart, Spotify, Booking.com, PagerDuty, Atlassian, Pepsi, Priceline et plus
Formulaire de déploiement Arize AX SaaS, auto-hébergement Phoenix (Docker/K8s/local)
Taille de l'équipe Plus de 35 postes ouverts, bureaux à Berkeley et New York
Contexte du financement Battery Ventures, Foundation Capital, TCV, Adams Street, Microsoft Venture, OMERS, etc.

Ces paramètres indiquent qu'Arize n'est plus une start-up précoce : sa capacité de traitement de plusieurs milliards de dollars et sa liste d'entreprises clientes de premier plan indiquent qu'elle dispose d'un avantage de premier arrivé dans le domaine de l'observabilité LLM. Mais ce qui creuse vraiment l'écart, ce ne sont pas les chiffres eux-mêmes, mais la logique du produit trois-en-un « trace + évaluation + expérience » : les outils APM traditionnels peuvent vous dire que le système est lent, mais ils ne peuvent pas dire s'il s'agit d'un problème rapide, d'une récupération manquante ou d'une dégradation du modèle ; Arize associe ces trois types de signaux à la même trace, permettant à l'équipe d'IA de déboguer le comportement de l'agent comme le débogage du code.

Reconnaissance des utilisateurs et du marché

La reconnaissance d’Arize sur le marché peut être observée sous trois dimensions. Niveau d'adoption par les entreprises, la liste de clients affichée sur le site officiel comprend Reddit, Uber, DoorDash, Spotify, Instacart, Booking.com, Atlassian, PagerDuty, Wayfair, Priceline et d'autres entreprises leaders dans les domaines des réseaux sociaux, des voyages, du commerce électronique, de l'audio et de la vidéo et du SaaS. La plupart de ces clients intègrent des fonctions AI Agent ou LLM dans les processus métier de base et ont un fort besoin d'observabilité et d'évaluation.

Au niveau de l'écosystème Open source, Phoenix a reçu 10,6 000 étoiles sur GitHub, OpenInference a reçu 1,1 000 étoiles et le nombre d'entrepôts au niveau de l'organisation a atteint 72. La moyenne mensuelle de plus de 5 millions de téléchargements et de plus de 22 millions de téléchargements d'instruments OpenTelemetry montre qu'il est non seulement testé, mais également intégré en permanence dans des projets réels.

Approbation de l'industrie Les investisseurs d'Arize comprennent Battery Ventures, Foundation Capital, TCV, Adams Street, Microsoft Venture, OMERS, Sinewave et DataDog. Parmi eux, l’investissement de DataDog a une signification particulière : le géant traditionnel de l’APM reconnaît indirectement que l’observabilité de l’IA est une nouvelle catégorie indépendante.

Il convient de noter que les étoiles open source et les téléchargements mensuels reflètent l’intérêt des développeurs et la vitesse de diffusion écologique, et ne sont pas directement équivalents au nombre de clients payants ou aux revenus. Lors de l'évaluation des achats, les entreprises doivent demander à Arize de fournir des termes de référence SLA et des politiques d'exportation de données qui correspondent à leur propre échelle de traçage.

Avantage de coût

La structure de coûts d'Arize doit être divisée en trois niveaux car le coût de la version open source et de la version cloud SaaS est très différent.

Individuel/Petite équipe (côté C) : le niveau Arize AX Free fournit 25 000 périodes/mois et 1 Go de stockage avec 15 jours de rétention, ce qui convient aux développeurs individuels pour vérifier des concepts ou apprendre pour une utilisation à l'essai. Si vous souhaitez simplement suivre le processus de traçage, il n'y a aucun frais dans le quota du niveau gratuit. L'auto-hébergement de Phoenix est entièrement gratuit, mais nécessite l'engagement de ressources locales ou de serveur.

Niveau Développeur/API : AX Pro au prix de 50 $/mois, comprend 50 000 spans, 10 Go, 30 jours de rétention. L'excédent est facturé en tant que portée et stockage supplémentaires (le prix unitaire spécifique n'est pas divulgué, veuillez vous référer à la page officielle en temps réel). Par rapport à l’auto-hébergement, le niveau Pro permet d’économiser les coûts d’exploitation et de maintenance et convient aux petites et moyennes équipes sans équipes de plateforme dédiées. Pour les équipes disposant d'une expérience Kubernetes et de capacités opérationnelles, Phoenix auto-hébergé peut avoir un coût total inférieur à plus grande échelle : le logiciel est gratuit et le coût est répercuté sur l'infrastructure, le stockage et les heures de travail SRE.

Niveau Entreprise/Privé : AX Enterprise est un devis personnalisé, et les informations publiques montrent qu'il comprend un support dédié SLA, la conformité SOC2/HIPAA, une formation, des modules complémentaires auto-hébergés et des fonctionnalités de résidence de données. Ce niveau doit être confirmé via la communication commerciale, et les prix spécifiques ne sont pas répertoriés sur la page publique. Arize propose également un plan tarifaire de démarrage pour les entreprises d'IA en démarrage.

En termes de coûts cachés, plusieurs points sont facilement négligés : La granularité du traçage des span affectera la consommation mensuelle - si chaque appel d'outil, chaque récupération et chaque cycle de réflexion de l'agent génère des spans indépendants, le quota d'entrée libre de 25 000 ou 50 000 peut être rapidement épuisé dans les scénarios d'agent réel. De plus, les politiques de conservation des données affectent directement les coûts de stockage : les longues périodes de conservation (par exemple plus de 90 jours) nécessitent une planification de la capacité de la base de données et des solutions de sauvegarde dans des scénarios d'auto-hébergement d'entreprise.

Fonctions principales

  • Suivi du comportement de l'agent (Observer) : basé sur la norme OpenInference/OpenTelemetry, il enregistre complètement chaque étape de la demande LLM d'appel à l'outil de l'agent, de l'opération de récupération et du chemin de décision, et le présente sous forme de graphique de trace. Problèmes d'acceptation : vérifiez si les liens complexes tels que l'agent de codage (Cursor, Claude Code, OpenCode), la collaboration multi-agents et les appels d'outils imbriqués sont couverts.

  • Evaluate Engine : prend en charge l'évaluation au niveau de l'étendue, de la trace et de la session, avec des modèles intégrés tels que LLM-as-a-judge, la pertinence de la récupération, l'exactitude des réponses et la détection des hallucinations. Problèmes d'acceptation : si les résultats de l'évaluation peuvent être directement attachés à la trace pour former une connexion, et si les normes des juges et les règles de notation peuvent être personnalisées.

  • Gestion des expériences (amélioration) : grâce aux modules Ensembles de données et Expériences, les échantillons de traces en ligne ayant échoué sont précipités dans des ensembles de données versionnés, puis les différences dans les indicateurs d'évaluation des différentes invites, modèles, paramètres et stratégies de récupération sont comparées. Objectif d'acceptation : si l'expérience prend en charge l'exécution par lots, la comparaison des indicateurs et le jugement de signification statistique.

  • Alyx AI Engineering Assistant : officiellement positionné comme « agent d'ingénierie IA », il peut comprendre les problèmes, exécuter des évaluations de manière autonome, déboguer les problèmes et optimiser les invites. Semblable à Cursor ou Claude Code mais conçu spécifiquement pour les scénarios d'ingénierie de l'IA. Problèmes d'acceptation : limites de capacités d'Alyx - il convient au débogage guidé, mais ne convient pas au remplacement de modifications de production manuelles irréversibles.

  • ADB Data Storage (Arize DataBus) : Une couche de stockage de données spécialement conçue pour les traces GenAI. Il est stocké dans un format ouvert et peut être connecté à des entrepôts de données externes tels que BigQuery, Databricks, Snowflake, etc. via DataFabric. Problèmes d'acceptation : si le format de données est véritablement ouvert et si les coûts d'exportation et de migration sont contrôlables.

  • Compétences d'agent et écosystème CLI : fournit officiellement « arize-skills » (guidant l'agent de codage pour ajouter de l'observabilité), « coding-harness-tracing » (traçage du processus de codage de Claude Code/Curseur/Codex) et « arize-ax-cli » (outil CLI). Ces outils font passer l'observabilité de « l'enregistrement passif » à « l'injection active dans le flux de travail de développement ».

Lien implicite : les traces capturées par Observe peuvent être directement envoyées à Evaluate pour générer des scores d'évaluation. Les échantillons de problèmes marqués par Évaluer peuvent être directement ajoutés à l'ensemble de données à des fins d'expérimentation. Les résultats de l'expérience peuvent guider les modifications d'invite ou de configuration - ce cycle "observation → évaluation → amélioration" est la différence fondamentale entre Arize et les outils de traçage isolés ou les outils d'évaluation indépendants. Lorsque les fonctions de trace, d'évaluation, d'ensemble de données, d'expérimentation et d'invite d'une plateforme utilisent le même modèle de données, l'équipe n'a plus besoin de transférer manuellement le contexte entre plusieurs systèmes.

Evolution du modèle et de la version

L'évolution du produit d'Arize peut être divisée en trois fils : la version de la plate-forme open source Phoenix, la version des fonctions de la plate-forme cloud Arize AX et l'évolution de la norme OpenInference. Étant donné qu’AX est un service SaaS fourni en continu, il n’existe pas de numéro de version au sens traditionnel du terme. Ce qui suit utilise la version open source de Phoenix comme ligne principale pour montrer le rythme d'évolution des capacités de la plate-forme.

Version principale

Temps Version Changements clés
2026-07-14 Phénix v18.0.0 Présentation de changements sémantiques de chevauchement d'intervalles de session, affectant le comportement de filtrage de la plage horaire de session
2026-07-14 Phénix v17.30.0 Variables contextuelles de débogage de suivi forcé de l'agent, gestion de la configuration des annotations par lots Nombre d'erreurs de sortie Playground
2026-07-13 Phénix v17.29.0 Traçage PXI déplacé vers le serveur, commande de paramétrage d'exportation à distance
2026-07-13 Phénix v17.28.0 Annotation de session édition aire de jeux panneau pliant Indicateur d'animation des onglets
2026-07-12 Phénix v17.27.0 Réorganisation par glisser-déposer des colonnes du tableau Info-bulle de l'outil d'aperçu Span IO Colonne personnalisée du tableau d'invite
2026-07-11 Phénix v17.26.0 Forcer le menu de sélection d'outils et le filtre de code d'état à ne pas être sensible à la casse
2026-07-11 Phénix v17.25.0 Tableau des métriques de la page de l'ensemble de données de l'outil de synchronisation d'approbation PXI
2026-07-10 Phénix v17.24.0 Les évaluations PXI ont migré vers le plug-in pytest, mise à jour du prix du jeton de modèle intégré
2026-06-02 Phénix v17.0.0 Point de départ de la ligne principale 17.x

Jalons de la plateforme

En plus des numéros de version, Arize dispose de plusieurs nœuds de version de produit importants en 2026 :

  • Alyx AI Engineering Assistant est officiellement publié, positionné comme un « agent IA pour l'ingénierie IA », qui peut déboguer indépendamment des traces et exécuter des évaluations.
  • ADB (Arize DataBus) a été publié en tant que couche de stockage de données dédiée pour les traces GenAI, prenant en charge les formats ouverts et les connexions externes à l'entrepôt de données.
  • Agent Skills est open source, permettant aux agents de codage tels que Claude Code et Cursor d'appeler directement les capacités de Phoenix.
  • OpenInference continue de se développer, couvrant l'instrumentation de nouveaux frameworks tels que MCP, Pydantic AI, Autogen AgentChat, Claude Agent SDK, etc.

À en juger par le rythme de sortie, Arize atteindra une fréquence de version presque quotidienne en juillet 2026. Cette itération à haute fréquence indique une réponse rapide aux changements écologiques, mais cela signifie également que le déploiement en production nécessite la mise en place de processus de verrouillage des versions et de vérification des mises à niveau.

Avantages techniques

La pile technologique d'Arize est construite autour d'un jugement fondamental : l'observabilité de l'IA ne peut pas utiliser le modèle de données propriétaire de l'APM traditionnel. Les traces générées par les applications LLM et Agent ne sont pas de simples chaînes d'appels RPC - chaque travée peut transporter des entrées et des sorties de dizaines de milliers de jetons, des fragments de documents récupérés, des paramètres et des valeurs de retour des appels d'outils, ainsi que le processus de raisonnement intermédiaire de l'agent. Les modèles de données des outils de surveillance traditionnels ne peuvent pas transmettre efficacement des informations de cette granularité.

La priorité OpenInference / OpenTelemetry est la décision technique la plus fondamentale d'Arize. OpenInference, un standard ouvert pour les conventions sémantiques GenAI, est construit sur OpenTelemetry pour garantir que les données de trace ne sont pas verrouillées dans un format privé. L'instrumentation en quatre langages : Python, TypeScript, Java et Go couvre les frameworks et fournisseurs traditionnels tels que OpenAI, Anthropic, Google, AWS Bedrock, LangChain, LlamaIndex, DSPy, CrewAI et MCP. Cela signifie que les équipes peuvent utiliser différents frameworks LLM sur différents projets, mais partager le même ensemble de spécifications de traçage et de plates-formes d'observation.

La trinité Trace-Eval-Experiment est le deuxième avantage architectural. De nombreux outils peuvent bien faire une ou deux de ces choses : l'outil de traçage peut voir la chaîne d'appels mais ne peut pas l'évaluer, et le framework eval peut marquer mais n'a pas le contexte d'exécution. Arize attache les résultats de l'évaluation directement à l'étendue de trace, puis transmet les échantillons ayant échoué dans l'ensemble de données et les processus d'expérimentation. Cette architecture permet de réaliser « de la découverte des anomalies à la vérification et à la réparation » sur la même ligne de données, sans avoir besoin de manipulation manuelle du contexte.

En termes de flexibilité de déploiement, Phoenix peut être démarré immédiatement après l'installation de pip local, ou il peut être exécuté en tant qu'infrastructure de production sur Kubernetes. Fournit officiellement plusieurs portails de déploiement tels que Docker Compose, Helm chart, Railway, Render, Google Cloud Run, Azure Container Instances, AWS CloudFormation, etc. Pour les entreprises qui ont besoin d'auto-hébergement, cette élasticité signifie que vous pouvez commencer avec un prototype de notebook et évoluer progressivement vers un cluster de production sans avoir besoin de plates-formes de migration intermédiaires.

L'intégration native de l'agent de codage est la nouvelle direction en 2026. L'entrepôt « coding-harness-tracing » permet à Arize de suivre directement le comportement de codage des agents de codage tels que Claude Code, Cursor et Codex, amenant le processus de programmation assistée par l'IA dans la plage observable. Cela implique que la vision du produit d'Arize s'est élargie de « l'observation des applications d'IA » à « l'observation de l'IA et le développement de processus d'IA ».

Comment utiliser

Le chemin à parcourir pour démarrer avec Arize varie selon la gamme de produits et la taille de l’équipe. Voici trois points d’entrée typiques.

Entrée 1 : auto-hébergement Phoenix (essai local)

pip installer arize-phoenix
service de phénix

Après le démarrage, visitez « http://localhost:6006 » pour voir l'interface utilisateur de Phoenix. Les traces de l'application LLM sont ensuite envoyées à Phoenix via l'instrumentation OpenInference.

Entrée 2 : Plateforme cloud Arize AX

  1. Visitez app.arize.com pour créer un compte (aucune carte de crédit requise pour le niveau gratuit).
  2. Créez un projet et obtenez le point de terminaison API et la clé API.
  3. Envoyez les traces d'application au point de terminaison AX à l'aide du SDK OpenInference ou directement via l'exportateur OTel.
  4. Affichez les traces, configurez les évaluations, créez des ensembles de données et des expériences dans la console AX.

Entrée 3 : Arize AX Pro/Enterprise Bénéficiez d'options de déploiement de niveau entreprise tout au long du processus de vente, notamment des modules complémentaires auto-hébergés, des SLA de configuration conformes à SOC2/HIPAA et des options de résidence des données. Les clients d'entreprise collaborent généralement avec l'équipe de solutions Arize pour finaliser l'intégration.

Processus d'intégration typique :

  1. Déterminez la portée du traçage : tous les appels LLM + appels d'outils + étapes de récupération, ou simplement les liens critiques.
  2. Accédez à l'instrumentation : sélectionnez le package OpenInference correspondant (Python/JS/Java/Go) en fonction de la pile technologique.
  3. Vérifiez l'arrivée des données : confirmez que les traces sont affichées normalement dans Phoenix ou AX, et que les niveaux d'étendue, le nombre de jetons d'entrée et de sortie et les délais sont terminés.
  4. Établir l'évaluation : commencez par une évaluation de modèle (comme la pertinence des réponses, l'exactitude de la récupération) et ajoutez progressivement des juges personnalisés.
  5. Ensemble de données précipitées : ajoutez la trace d'échec en ligne à l'ensemble de données comme référence de test de régression.
  6. Exécutez l'expérience : comparez les modifications des indicateurs d'évaluation avant et après les modifications d'invite ou de paramètre.
  7. Processus de solidification : intégrez eval dans le pipeline CI et exécutez automatiquement une évaluation de régression avant la fusion du code.

Prix des produits

La stratégie tarifaire d'Arize est « une facturation à plusieurs niveaux open source gratuite + cloud SaaS », couvrant l'ensemble du spectre, des particuliers aux entreprises.

Planifier Orienté groupe Prix ​​public Inclusions de base
Auto-hébergement Phoenix Développeur/Équipe avec des capacités d'exploitation et de maintenance Gratuit (ELv2) Toutes les fonctions, pas de limite de quota, les données restent locales
AXE Gratuit Essai/apprentissage personnel 0 $ 25 000 travées/mois 1 Go, 15 jours de rétention
AXE Pro Petite équipe/équipe native d'IA 50$/mois 50 000 travées/mois 10 Go, 30 jours de rétention
AXE Entreprise Exigences à grande échelle/conformité Devis personnalisé SLA personnalisé, SOC2/HIPAA, module complémentaire auto-hébergé, résidence des données
Programme de démarrage Entreprises d’IA en phase de démarrage Demande requise Tarifs réduits, pour les équipes de startups

Ce qui nécessite une attention particulière, c'est la méthode de facturation une fois le quota gratuit/Pro dépassé. La page de tarification officielle ne divulgue pas le prix unitaire au-delà de la durée et du stockage. Les entreprises doivent confirmer ce coût auprès des ventes lors de l'évaluation du budget. De plus, même si l'auto-hébergement est gratuit, le déploiement au niveau de la production nécessite toujours PostgreSQL (ou une base de données compatible), un stockage d'objets, des ressources informatiques ainsi que de la main d'œuvre d'exploitation et de maintenance. Cette partie du coût total doit être incluse dans le processus décisionnel.

Scénarios d'application

  • AI Agent Production Monitoring : L'agent peut exécuter en continu des dizaines d'appels d'outils dans l'environnement de production. Toute erreur à n’importe quelle étape (l’outil renvoie une hallucination LLM anormale, perte de contexte) peut entraîner l’échec de la tâche globale. Le graphique de trace d'Arize peut étendre l'ensemble du lien d'exécution, marquant la consommation de jetons et les résultats d'évaluation qui prennent beaucoup de temps à chaque étape. Déduction quantitative : la surveillance de base du bâtiment est raccourcie de quelques jours à quelques heures (grâce à des instruments prédéfinis), et la localisation de la cause d'une panne d'agent est raccourcie de plusieurs heures à quelques minutes.

  • Évaluation de la qualité des applications RAG : le goulot d'étranglement en matière de qualité du système RAG n'est souvent pas le LLM lui-même, mais la question de savoir si le contexte correct est trouvé lors de la phase de récupération. Les évaluations de récupération d'Arize peuvent quantifier la précision et le rappel de chaque récupération et les corréler à l'exactitude de la réponse finale. Dérivation quantitative : l'examen manuel de 100 échantillons RAG a été raccourci d'environ 2 heures à 15 minutes (notation automatisée via LLM-as-a-juge + échantillonnage manuel).

  • Tests de régression rapides : le risque le plus courant dans l'itération des produits d'IA est de "réparer un cas et d'en casser trois". Le workflow Ensemble de données + Expérience d'Arize permet aux équipes de maintenir un ensemble de tests couvrant les cas extrêmes et d'exécuter automatiquement l'évaluation à chaque fois que l'invite change. Déduction quantitative : Le test de régression après chaque modification rapide est raccourci d'une vérification manuelle une par une (environ 1 heure/tour) à une exécution automatique (environ 5 minutes/tour).

  • LLM Online Gating : intégrez les évaluations Arize dans CI/CD, définissez des seuils (par exemple, empêchez la fusion lorsque la précision de la récupération < 0,8 ou le score d'hallucination > 0,3). Idéal pour les équipes d’ingénierie qui intègrent la qualité de l’IA dans le processus de publication.

  • Gouvernance interne de l'IA d'entreprise : Phoenix auto-hébergé unifie les spécifications de traçage, les normes d'évaluation et les politiques de conservation des données pour les applications d'IA dans tous les secteurs d'activité. Répondez aux exigences de conformité, d’audit et de résidence des données.

Ne convient pas aux frontières : Arize n'est pas adapté à la surveillance traditionnelle des infrastructures qui nécessite des alertes en temps réel (c'est le domaine de DataDog/Prometheus) ; il ne convient pas aux scénarios qui effectuent uniquement une évaluation hors ligne unique du modèle et ne se soucient pas des traces en ligne ; Il ne convient pas non plus aux équipes qui n'ont aucun besoin de traçage et n'utilisent LLM que pour des tâches de classification simples. Dans de tels scénarios, les coûts de déploiement et d'apprentissage d'Arize peuvent dépasser les avantages.

Personnes concernées

  • Développeur d'applications IA : besoin de comprendre le comportement réel du LLM et de l'agent dans un environnement de production, plutôt que d'essayer encore et encore dans le terrain de jeu. Arize offre des capacités de lecture complètes, de la trace à l'évaluation.

  • Équipe plateforme/infrastructure d'IA : Responsable de l'établissement d'une infrastructure unifiée d'observation, d'évaluation et d'expérimentation pour plusieurs projets d'IA au sein de l'organisation. Phoenix auto-hébergé peut gérer les besoins de résidence des données, de contrôle d’accès et de collaboration en équipe.

  • Chef de produit IA et équipe d'évaluation : des indicateurs de qualité quantifiables sont nécessaires pour décider « s'il peut être lancé en ligne » ou « si la nouvelle invite est meilleure ». Le workflow Dataset + Experiment d'Arize fournit des données comparatives reproductibles.

  • Équipe de conformité et de sécurité : nécessité de garantir que les données d'exploitation des applications d'IA sont auditables, traçables et contrôlables. Le modèle auto-hébergé de Phoenix et la certification de conformité SOC2/HIPAA d'Arize fournissent une assurance fondamentale.

Prérequis et personnes inappropriées : La condition préalable à l'utilisation d'Arize est que l'équipe dispose déjà ou est en train de créer une application LLM/Agent et qu'elle ait généré des données d'exécution qui doivent être observées et évaluées. Pour les équipes de formation de modèles purs, les équipes qui consomment uniquement les sorties de l'API LLM mais ne se soucient pas des détails des appels, ou les projets PoC qui ne nécessitent pas du tout d'observabilité, le ratio entrées-sorties d'Arize n'est pas élevé. De plus, le chemin auto-hébergé nécessite que l'équipe dispose de certaines capacités de conteneurisation ou d'exploitation et de maintenance de Kubernetes, et ne convient pas à une maintenance indépendante par des équipes de développement commercial pur.

Résumé et Outlook

La principale compétitivité d'Arize réside dans l'amélioration de l'observabilité de l'IA, de « l'enregistrement passif » à « l'amélioration active ». La surveillance traditionnelle répond « Que s'est-il passé », Arize tente de répondre « Comment l'améliorer ». La logique produit Observer → Évaluer → Améliorer capture vraiment le problème de l'ère LLM/Agent : lorsque la sortie du modèle n'est plus prévisible, l'équipe a besoin non seulement de journaux, mais d'un ensemble de flux de travail capables de localiser les problèmes, de quantifier les écarts et de vérifier les réparations.

Les restrictions actuelles sont également claires. Premièrement, la valeur d’Arize est fortement liée à la couverture et à la qualité des traces : si elle n’est pas entièrement connectée à l’instrumentation ou ne génère pas d’évaluations significatives, la valeur de la plateforme sera considérablement réduite. Deuxièmement, bien que l’auto-hébergement soit gratuit, les coûts de stockage et de calcul liés au déploiement de production à grande échelle (millions de spans/jour, longue période de rétention) ne peuvent être ignorés. Troisièmement, le prix des produits SaaS pourrait augmenter rapidement dans des scénarios à grande échelle. Les entreprises doivent confirmer auprès d'Arize le prix unitaire et les conditions du contrat une fois le quota dépassé avant d'acheter.

Évaluation des risques d'acquisition/d'adoption : La stratégie open source d'Arize réduit les obstacles à l'adoption (Phoenix auto-hébergé ne coûte aucun coût logiciel), mais les entreprises doivent vérifier les termes suivants avant de standardiser l'observabilité de l'IA sur une plate-forme sur site : coûts de sortie et de migration des données (format ouvert ou verrouillage de la plate-forme), couverture SLA pour la perte de trace et la disponibilité des requêtes, portée spécifique de la certification SOC2/HIPAA et engagements dans le contrat d'entreprise concernant la résidence et les périodes de conservation des données. Il est recommandé de démarrer le PoC avec l'auto-hébergement Phoenix ou AX Free et d'utiliser le trafic professionnel réel pour vérifier la couverture des traces, les résultats de l'évaluation et les coûts d'exploitation et de maintenance dans un délai de 1 à 3 mois, puis de décider s'il faut passer à l'étape payante de Pro ou Enterprise.

Outils associés : hugging-face, replicate

Informations de version

  • Arize Phoenix 18.0.0 :La version principale de la plate-forme Phoenix introduit des changements sémantiques de chevauchement d'intervalles de plage de temps de session ; la plateforme cloud Arize AX est mise à jour simultanément.
  • Arize Phoenix 17.30.0 :Prend en charge le suivi forcé des agents, les variables contextuelles de débogage, la gestion de la configuration des annotations par lots et le nombre d'erreurs de sortie Playground.
  • Arize Phoenix 17.0.0 :17.x est le point de départ de la ligne principale et continue d’itérer les fonctionnalités de traçage, d’évaluation et de terrain de jeu.
  • Arize Phoenix 1.0.0 :Il n’y a pas encore de date officielle précise. La première version officielle de Phoenix est publiée, établissant le positionnement de l'IA Observability & Evaluation.

Avis des utilisateurs

  • Chargement des avis...