Galilée Gratuit

-

Galileo est une plate-forme de garde-corps de production et d'observabilité de l'IA d'évaluation GenAI pour les scénarios , couvrant les indicateurs RAG/Agent expérimentaux hors ligne, les traces en ligne, le modèle d'évaluation Luna-2 à faible latence et le déploiement au niveau de l'entreprise.

Galilée Interface du produit

Galileo

Paramètres et statistiques de base

Galileo se positionne comme une plateforme de fiabilité de l'IA, et sa principale prestation est un flux de travail intégré qui « transforme l'évaluation hors ligne en garde-fous de production ». Le produit couvre trois modules principaux : évaluation de l'IA, observabilité de l'IA et protection en temps réel. Il est accessible via le SDK, l'API et la console Web et prend en charge trois méthodes de déploiement : SaaS, VPC et sur site.

Projets Informations publiques
Positionnement du produit Plateforme de garde-corps d'évaluation, d'observabilité et de production pour les applications GenAI et Agentic
Objets de base traces, sessions, étendues, ensembles de données, invites, métriques, garde-corps
Indicateurs prédéfinis Plus de 20 évaluations prêtes à l'emploi, couvrant RAG, Agent, Sûreté, Sécurité et autres catégories
Méthode d'accès Console Web SDK Python, SDK TypeScript, API REST, intégration du framework d'agent grand public
Couverture du flux de travail Expérience hors ligne (Évaluer), observation en ligne (Observer), garde-corps en temps réel (Protéger)
Formulaires de déploiement SaaS, cloud privé virtuel, sur site
Modèle d'évaluation Luna-2 Jetons de 0,12 $/1 million, précision de 0,95, latence moyenne de 152 ms, contexte de 128 000
Dernière mise à jour publique 2026-06-05 Contrôle des agents pour les entreprises clientes
Plans tarifaires Gratuit / Pro (100 $/mois) / Entreprise (Contactez-nous) trois niveaux

Remarque : Galileo n'est pas un chatbot général ni une pure plateforme de journalisation. Cela nécessite des équipes qui disposent déjà d'une application GenAI, RAG ou Agent et qui sont prêtes à investir du temps dans la création d'une vérité fondamentale, le calibrage des métriques et la définition de stratégies de garde-fou. Si l’équipe n’est pas encore entrée dans le développement d’applications d’IA ou ne dispose pas de méthodologie d’évaluation, le coût d’intégration initial de la plateforme sera supérieur au prix de l’outil lui-même.

Reconnaissance des utilisateurs et du marché

Les signaux de marché de Galileo se concentrent sur les deux dimensions de l'adoption par les clients au niveau de l'entreprise et de la reconnaissance du capital, plutôt que sur la réputation du port C ou sur les étoiles de GitHub.

Financement et croissance de l'entreprise : En octobre 2024, il a été officiellement annoncé qu'il avait réalisé une série B de 45 millions de dollars américains, avec un financement total de 68 millions de dollars américains ; la même annonce a révélé que les revenus ont augmenté de 834 % depuis 2024, que le nombre d'entreprises clientes a été multiplié par 4 et que 6 sociétés Fortune 50 ont été introduites. Les investisseurs n'ont pas été divulgués sur la page publique, mais l'échelle de financement se situe au plus haut niveau dans la piste d'évaluation de l'IA.

Clients et éco-partenaires : les avis de clients ou de partenaires tels que Twilio, Comcast, HP, Writer, Cisco Outshift, Ema, NVIDIA, Satisfi Labs, MongoDB, CrewAI, Clearwater Analytics, etc. apparaissent sur la page produit et la page de tarification. L'évaluation s'est concentrée sur « l'utilisation de Galileo comme agent pour observer l'évaluation de la production de Luna-2 et la gestion de la qualité RAG », indiquant qu'elle se concentre sur les scénarios de gouvernance de l'IA au niveau de l'entreprise.

Communauté de développeurs : L'organisation GitHub « rungalileo » compte 184 abonnés et 58 référentiels. Les principaux projets open source incluent « agent-leaderboard » (224 étoiles, utilisé pour classer les capacités de l'agent LLM), « hallucination-index » (116 étoiles, évalue la tendance aux hallucinations LLM), le SDK « galileo-python » (22 étoiles, licence Apache-2.0). L'entrepôt open source est davantage un exemple de démonstration et d'intégration, et les fonctionnalités de base du produit se trouvent dans la couche SaaS fermée.

Avantage de coût

La structure de coûts de Galileo est fondamentalement différente des outils de surveillance LLM traditionnels : il ne repose pas sur l'appel de GPT-5.4 ou Claude pour juger à chaque fois, mais utilise le modèle d'évaluation dédié Luna-2 pour réduire le coût de l'évaluation haute fréquence à 3 à 5 % de la solution générale.

Client C/particulier : forfait gratuit à 0 $/mois, comprend 5 000 traces/mois, utilisateurs illimités, évaluations personnalisées illimitées. Convient aux développeurs individuels pour réaliser une preuve de concept à petite échelle. La limite est que le quota gratuit est bien inférieur aux exigences de production (les systèmes d'agents à haute fréquence peuvent générer des dizaines de milliers de traces par jour) et qu'il manque de SSO, de RBAC et de support dédié.

Développeur/API : le forfait Pro commence à 100 $/mois (économisez 33 % sur les annotations annuelles) et comprend 50 000 traces/mois, le RBAC standard, des analyses avancées et la prise en charge de Slack. La page de tarification indique que les prix évoluent linéairement avec le nombre de traces. Les coûts réels pour l'équipe de développement incluent non seulement les frais d'abonnement, mais également les frais généraux liés au LLM-as-a-juge appelant les indicateurs Luna, la conservation des données et le stockage des expériences.

Entreprise/Privé : Entreprise est Contactez-nous et comprend des traces illimitées, des limites de débit personnalisées, des options de déploiement hébergé/VPC/sur site, un RBAC/SSO de niveau entreprise, un CSM dédié, une prise en charge de garde-corps en temps réel 24h/24 et 7j/7, des serveurs d'inférence dédiés à faible latence et une assistance technique déployée vers l'avant. Les jetons de 0,12 $/1 million de Luna-2 peuvent permettre d'économiser environ 97 % du coût d'évaluation par rapport aux jetons de 5,00 $/1 million de GPT-5.4. Cependant, les métriques Luna sont ouvertes selon les contrats d'entreprise et ne sont pas disponibles par défaut pour tous les utilisateurs.

Coûts cachés : le véritable coût de la mesure de l'IA ne provient pas seulement de l'abonnement Galileo, mais comprend également : les frais d'appel LLM en tant que juge investis dans la création et l'étalonnage des métriques de mesure, la conservation des données et la bande passante, l'exploitation et la maintenance de serveurs d'inférence dédiés, ainsi que le temps d'équipe pour apprendre et développer le processus de mesure. Luna-2 réduit le coût marginal de l'évaluation haute fréquence, mais l'investissement technique initial dans la construction de la vérité terrain et l'optimisation des indicateurs ne peut être ignoré.

Fonctions principales

Les fonctions de Galileo sont organisées autour des quatre étapes « capture de données → évaluation et construction → analyse des défaillances → lancement du garde-corps », plutôt que d'être empilées indépendamment par modules.

  • Gestion des actifs de données et d'annotations : construisez des ensembles de données à partir de données synthétiques, du contexte de développement et du trafic de production, et prenez en charge les annotations d'experts du domaine pour former des actifs de vérité de terrain continuellement mis à jour. Les principaux points d'acceptation sont de savoir si le flux de travail d'annotation peut être connecté au pipeline de données existant, ainsi que le mécanisme de gestion des versions et de restauration de Groundtruth.
  • 20+ indicateurs d'évaluation prédéfinis + évaluation personnalisée : couvrant les évaluations RAG (qualité de récupération, précision du contexte), les évaluations d'agent (sélection d'outils, avancement de l'action, achèvement de l'action), les évaluations de sécurité (biais, toxicité), les évaluations de sécurité (injection rapide, fuite de PII). Les avis personnalisés prennent en charge la génération automatique basée sur le code ou LLM en tant que juge. Les principaux points d'acceptation sont de savoir si les indicateurs prédéfinis sont alignés sur le domaine d'activité et si le taux de précision (F1) des indicateurs personnalisés peut atteindre plus de 80 %.
  • Observation de l'agent du moteur graphique : développez les branches, les appels d'outils, les chemins de décision et les contextes de session de l'agent, des journaux linéaires aux chemins graphiques, en prenant en charge les protocoles A2A du système multi-agents et le traçage distribué. Le point clé d'acceptation est de pouvoir localiser rapidement un span défaillant et de voir le lien d'attribution complet en 2-3 clics.
  • Analyse automatique des défaillances d'Insights Engine : analysez les données de comportement de l'agent, identifiez les modèles de défaillance, les modèles cachés et les causes profondes, et donnez des suggestions exploitables (telles que « ajouter quelques exemples à la saisie de l'outil »). Les points clés d’acceptation sont l’exactitude et les taux de faux positifs des recommandations, ainsi que la vitesse à laquelle l’équipe d’ingénierie adopte les recommandations.
  • Évaluation au niveau de la production Luna-2 : utilisez SLM avec des paramètres 3B/8B pour remplacer le LLM général en tant que juge, obtenant ainsi une évaluation à faible coût avec une latence inférieure à 200 ms, un contexte de 128 000 $ et des jetons de 0,12 / 1 million de dollars. Les principaux points d'acceptation sont la cohérence des métriques Luna avec les annotations humaines et la stabilité de la latence à des QPS élevés.
  • Gestion centralisée des garde-corps de contrôle d'agent : utilisez un plan de contrôle centralisé pour définir des politiques de garde-corps afin de bloquer les risques tels que l'injection d'invites de contenu nuisible, les fuites de données personnelles et les opérations entre utilisateurs sans modifier le code de l'agent. Les principaux points d'acceptation sont le taux de fausses interceptions, l'intégrité du journal d'audit et les chemins de secours manuels.
  • Auto-tune et apprentissage continu : via CLHF (Continuous Lear

Ning with Human Feedback), en utilisant quelques exemples pour optimiser automatiquement l'invite d'évaluation et améliorer progressivement la précision de l'indicateur. Les points d'acceptation clés sont la période de validité du réglage automatique et la nécessité ou non d'une intervention manuelle fréquente.

Evolution du modèle et de la version

Galileo est une plateforme SaaS qui continue d'évoluer. L'historique des versions peut être divisé en quatre étapes selon les jalons publics officiels :

Jalons de la ligne principale

  • 2024-10-15 : Plateforme d'intelligence d'évaluation. L'annonce de la série B redéfinit la gamme de produits principale en tant qu'intelligence d'évaluation, couvrant les quatre étapes de réglage fin, d'évaluation, d'observation et de protection, en mettant l'accent sur le lien complet entre l'expérimentation hors ligne et la gestion de la production. Il s'agit d'une transition clé pour Galileo d'un premier outil de PNL à une plateforme d'évaluation GenAI.
  • 2025-07-16 : Plateforme de fiabilité des agents. Release Agent Reliability Platform gratuitement, introduisez Graph Engine (observation du chemin de l'agent), Insights Engine (analyse automatique des pannes) et Luna-2 (modèle d'évaluation à faible latence), et étendez l'orientation produit de « l'évaluation RAG » à la « fiabilité du cycle de vie complet de l'agent ».
  • 2026-05-22 : Luna Studio et coûts d'intégration. Release Notes publie les fonctionnalités d'entreprise de Luna Studio, permettant aux entreprises de former des indicateurs SLM personnalisés à faible latence ; et ajoute également la page de gestion des coûts des coûts d'intégration, permettant aux équipes de suivre visuellement LLM-as-juge, Luna et les structures de dépenses retenues.
  • 2026-06-05 : Contrôle des agents. Release Notes publie Enterprise Agent Control, qui utilise un plan de contrôle centralisé pour gérer les garde-fous et les politiques de gouvernance, et bloquer les risques tels que l'injection rapide, les fuites de données personnelles et les opérations entre utilisateurs sans modifier le code. Il s'agit d'une extension de produit de Galileo de « observation + évaluation » à « gouvernance + blocage ».

Points clés de la vérification

05/06/2026 Agent Control est le dernier nœud de fonctionnalité public, mais la disponibilité réelle est affectée par les packages d'entreprise, les formulaires de déploiement et l'activation des ventes. Les métriques Luna sont marquées « Ouvertes uniquement aux clients sur demande » sur la page Luna-2, et toutes les métriques prédéfinies ne peuvent pas être considérées comme prêtes à l'emploi par défaut. Lors de l'achat, les entreprises doivent confirmer les conditions d'activation spécifiques de Luna Studio et Agent Control dans le cadre du contrat en cours.

Avantages techniques

L'avantage technique de Galileo vient de l'intégration à trois niveaux de modèles d'évaluation, de données d'observation et de garde-fous de production, plutôt que d'un modèle ponctuel ou d'un indicateur unique.

Couche de modèle d'évaluation (Luna-2) : Luna-2 utilise un SLM avec décodeur uniquement avec des têtes métriques légères pour une sortie d'évaluation déterministe. Mécaniquement, il s'adapte aux différentes dimensions d'évaluation grâce à un réglage fin et un adaptateur sur la base 3B/8B. En effet, les jetons de 0,12 $/1 million de dollars réduisent le coût de chaque évaluation d'environ 97 % par rapport aux jetons de 5,00 $/1 million de GPT-5.4, tout en conservant une précision de 0,95. Le scénario applicable est une évaluation du contexte de production parallèle multi-index à haute fréquence, telle que l'agent du service client, les questions-réponses RAG et les contrôles de conformité financière. La fenêtre contextuelle de 128 000 de Luna-2 signifie qu'elle prend en charge l'évaluation de bout en bout de longs scénarios de conversation, tandis que la fenêtre de 3 000 kilomètres de concurrents au prix similaire (tels qu'Azure Content Safety) perd le contexte.

Couche d'observation (Graph Engine) : Graph Engine convertit les appels d'agent d'un journal linéaire en un graphique orienté. Chaque nœud est un appel d'outil ou une requête LLM, et les bords sont un flux d'informations et un transfert de contrôle. Mécaniquement, il capture les étendues et les traces via les extensions OpenTelemetry et les bureaux SDK, puis reconstruit la topologie du chemin sur le backend. En effet, l’équipe d’ingénierie peut voir toutes les branches, tentatives et chemins d’erreur de l’agent en une seule observation. Les scénarios applicables sont des scénarios d'orchestration complexes tels que la collaboration multi-agents, les appels au serveur MCP du protocole A2A, etc.

Couche de protection (contrôle des agents) : le contrôle des agents mappe directement les scores d'évaluation aux actions de contrôle d'exécution. Mécaniquement, le garde-corps détermine si l'exécution est autorisée en fonction de politiques prédéfinies avant l'appel de l'outil ; en effet, l'équipe peut bloquer les opérations nuisibles sans modifier le code de l'Agent ; Les scénarios applicables sont la prévention des fuites de PII, le blocage de l'injection rapide, l'interception des opérations entre utilisateurs et le contrôle des risques de perte économique (comme la limite supérieure d'un transfert unique).

Bases de l'ingénierie de l'observabilité : le moteur Insights de Galileo n'est pas une simple agrégation de journaux, mais effectue une reconnaissance de formes sur des millions de signaux (invites de modèle, fonctions, ensembles de données contextuelles, traces, serveur MCP). La page produit présente un cas : Galileo détecte automatiquement "les hallucinations provoquant des saisies incorrectes dans l'outil" et suggère "d'ajouter quelques exemples pour démontrer les saisies correctes de l'outil", indiquant que ses capacités d'analyse des causes profondes ont été mises à niveau du résumé statistique à la génération de règles.

Comment utiliser

Les entrées de Galileo sont divisées en trois catégories : SDK/API de console Web et déploiement d'entreprise. Les développeurs peuvent commencer par s’inscrire gratuitement, mais les équipes d’entreprise doivent souvent d’abord clarifier les limites des données et les exigences de conformité.

Comment utiliser Convient à tout le monde Principales actions Précautions
Console Web Responsable qualité IA produit et fonctionnement Afficher les traces/sessions/métriques, exécuter des expériences, configurer des garde-corps Besoin d'accéder d'abord aux journaux d'application ou d'importer les données d'évaluation
SDK Python (galileo-python) Équipe d'ingénierie Ingénieur ML pip install galileo → Initialiser GalileoLogger → Enregistrer les traces et les expériences Besoin de gérer la clé API, la clé du projet, les champs de journalisation et la stratégie d'échantillonnage
SDK TypeScript (galileo-js) Développeur d'agents, ingénieur full-stack npm install @rungalileo/galileo-js → Initialiser le client → Se connecter au framework Agent Middleware ou callback devant coopérer avec le framework (LangGraph, CrewAI, etc.)
API REST Contexte multilingue, intégration personnalisée Appelez /v1/traces, /v1/experiments, /v1/guardrails et d'autres points de terminaison Besoin de gérer vous-même l'authentification, la limitation de courant et les nouvelles tentatives d'erreur
Déploiements d'entreprise Équipes de sécurité, de conformité et de plateforme Évaluer les scénarios hébergés/VPC/sur site Nécessite un contrat de vérification commerciale, un SLA de résidence des données et une inférence dédiée

Chemin de démarrage typique : Inscrivez-vous gratuitement sur le site officiel → Créez un projet → Installez le SDK et enregistrez la première trace → Exécutez des indicateurs d'évaluation prédéfinis sur les traces → Affichez le mode d'échec dans Insights → Développez les indicateurs stables pour expérimenter et protéger. Pour le système RAG, la priorité est donnée à la vérification de la qualité de la récupération et des hallucinations ; pour le système Agent, la priorité est donnée à la vérification de la qualité de la sélection des outils et de la réalisation des actions.

Exemple d'intégration rapide (Python) :

depuis Galileo importer GalileoLogger

galileo_logger = GalileoLogger(project="mon-projet")
avec galileo_logger.start_trace("user-query") comme trace :
    trace.log_input("Problème utilisateur")
    réponse = llm_call (invite)
    trace.log_output(réponse)
    trace.log_metric("latence", 320)

Prix des produits

La page de tarification de Galileo présente un plan à trois niveaux, les principales dimensions de facturation étant le nombre de traces et la couverture des fonctionnalités premium.

Planifier Prix ​​public Quota de base Capacités clés Limites applicables
Gratuit 0$/mois 5 000 traces/mois, utilisateurs illimités, évaluations personnalisées illimitées Évaluation de base, soutien communautaire Expérimentation et preuve de concept à petite échelle
Pro À partir de 100$/mois (33% de rabais sur le paiement annuel) 50 000 traces/mois, RBAC standard Analyses avancées, prise en charge de Slack Équipes en croissance, production à petite échelle
Entreprise Contactez-nous Traces illimitées, limites de débit personnalisées VPC/sur site, SSO/RBAC, garde-fous en temps réel, inférence dédiée, prise en charge 24h/24 et 7j/7 CSM dédié Exigences à l'échelle de l'entreprise, en matière de conformité et de déploiement

Comparaison des coûts de Luna-2 : Le coût d'évaluation de Luna-2 (3B/8B) est de 0,12 $/1 million de jetons. Comparé aux jetons de 5,00 $/1 million de dollars de GPT-5.4 et aux jetons de 0,15/1 million de dollars de GPT-5.4 mini, il présente des avantages évidents dans les scénarios d'évaluation à haute fréquence. Cependant, il convient de noter que les conditions d'activation, la couverture spécifique des indicateurs et la configuration du serveur d'inférence des métriques Luna doivent toutes être confirmées par le contrat d'entreprise, et le montant total ne peut pas être estimé directement sur la base du prix public.

Point de risque de facturation : le coût final de l'évaluation de l'IA est déterminé par le nombre de traces × taux d'échantillonnage × nombre d'indicateurs × fréquence d'appel. La limite supérieure des traces pour les forfaits Free et Pro peut être rapidement épuisée lors d'une évaluation approfondie ; bien qu'Enterprise n'ait pas de limite supérieure pour les traces, les limites de taux personnalisées et le coût de l'inférence exclusive nécessitent des négociations commerciales. Il est recommandé d'utiliser 1 à 2 semaines de données de traces réelles pour la simulation des coûts avant l'achat, puis de sélectionner la solution correspondante.

Scénarios d'application

  • Mesure et régression de la qualité RAG : mesure la précision de la récupération, la pertinence contextuelle, l'illusion de réponse et la cohérence des citations. L'objectif de l'acceptation est l'alignement de l'indicateur de récupération avec la vérité de base de l'entreprise et la question de savoir si le rapport de régression peut être automatiquement déclenché après chaque mise à jour du modèle, plutôt que de s'appuyer sur une seule évaluation manuelle.
  • Observation du lien complet de l'agent AI : utilisé pour l'appel de l'outil d'agent en plusieurs étapes, la branche, le transfert, l'achèvement des actions et la surveillance de la qualité des conversations. L'objectif de l'acceptation est de savoir si la cause première d'une interaction d'agent ayant échoué peut être localisée dans Insights dans un délai de 5 minutes, et si les améliorations peuvent être renvoyées au schéma d'invite ou d'outil.
  • Garde-corps de sécurité et de conformité en temps réel : utilisés pour les scénarios à haut risque tels que l'injection rapide, la fuite de données personnelles, le contenu nuisible, les opérations entre utilisateurs et les appels d'outils non autorisés. L'acceptation se concentre sur le blocage à faible latence (niveau inférieur à 200 ms de Luna), le taux de fausses interceptions, l'intégrité du journal d'audit et les mécanismes de secours manuels.
  • Plateforme Eval Engineering : utilisée pour intégrer des ensembles de données, des expériences, des métriques personnalisées, des commentaires humains et des portes de publication dans le processus CI/CD. L'objectif de l'acceptation est d'évaluer si le pipeline peut être exécuté automatiquement à chaque fois que le modèle ou l'invite est mis à jour, et de donner un signal de réussite/échec.
  • Gouvernance des opérations d'IA d'entreprise et contrôle des coûts : utilisé pour regrouper les traces de production, les coûts d'évaluation de Luna, les dépenses du LLM en tant que juge et les tendances anormales entre les départements. L'objectif de l'acceptation est de savoir si l'isolement des autorisations, la conservation des données, l'isolement du déploiement et l'attribution des coûts répondent aux exigences de l'organisation.

Personnes concernées

  • Équipe d'ingénierie d'applications IA : une équipe qui construit un RAG, un agent, un robot de service client ou un système de questions-réponses de recherche pour unifier les journaux, les avis et le diagnostic d'anomalies en ligne dans une vue unique. La condition préalable est que l’équipe ait des concepts de base en matière d’enfouissement et de traces des journaux, et qu’aucun ingénieur de plateforme d’IA à temps plein ne soit requis.
  • Ingénieur qualité et évaluation IA (Ingénieur Eval) : Un rôle d'ingénierie spécifiquement responsable de la création d'ensembles de données d'évaluation, du calibrage des indicateurs, de la gestion des expériences et de la conception du contrôle d'accès aux versions. Les évaluations personnalisées, le réglage automatique et Luna Studio de Galileo constituent la chaîne d'outils de base pour ce rôle.
  • Experts produits et domaines (SME) : chefs de produit et experts métier qui doivent participer à l'annotation, évaluer la qualité des réponses et définir des critères de réussite commerciale. Convertissez les jugements subjectifs en indicateurs de qualité traçables et réutilisables grâce à des annotations et des évaluateurs personnalisés.
  • Équipe de plate-forme et d'opérations de sécurité : équipe de plate-forme d'entreprise nécessitant SSO/RBAC, conservation des données, garde-corps de production PII et contrôle des risques d'injection rapide. La solution Enterprise de Galileo et Agent Control sont les principaux atouts de ce groupe.

Situations inappropriées : Équipes qui n'ont besoin que d'un chat général ou de simples appels LLM (tuer un poulet avec un couteau) ; les organisations qui ne disposent pas d’applications d’IA en ligne ou ne peuvent pas fournir de traces/ensembles de données (la plateforme n’a pas de données à analyser) ; les équipes qui ne disposent pas d'un leader d'évaluation clair ni d'un processus de gouvernance des indicateurs (l'outil deviendra « un tableau de bord de plus ») ; des scénarios qui ont des exigences géographiques strictes en matière de résidence des données, mais Galileo n'a pas encore couvert la zone correspondante.

Résumé et Outlook

La compétence principale de Galileo réside dans l'intégration du modèle d'évaluation à faible latence observable Luna-2 de l'agent d'évaluation GenAI et des garde-corps de production dans le même flux de travail. Il résout le problème le plus difficile de l'IA d'entreprise après son passage du POC à la production : comment prouver en permanence que les modèles et les agents sont fiables, explicables, améliorables et peuvent prévenir les risques dans le trafic réel. Dans le domaine de l'évaluation de l'IA, Galileo est l'un des rares produits qui couvre en même temps le lien complet « expérience hors ligne → observation en ligne → garde-corps en temps réel », plutôt qu'un outil indicateur unique.

Limites et incertitudes actuelles : bien que la précision de 0,95 de Luna-2 soit supérieure à celle de 0,94 de GPT-5.4, il s'agit d'un résultat de test de référence dans le cadre d'une dimension d'évaluation spécifique. La possibilité de maintenir la même qualité dans un scénario commercial hautement personnalisé nécessite une vérification réelle ; certaines fonctionnalités d'entreprise (Luna Studio, Agent Control) nécessitent une confirmation commerciale pour être activées ; la profondeur de l'intégration du framework SDK/Agent dépend de la pile technologique actuelle et de la compatibilité OTel ; la précision à long terme des indicateurs d'évaluation dépend de la vérité sur le terrain. Maintenance continue et retour d'information des PME.

Évaluation des risques d'approvisionnement/d'adoption : Il est recommandé de sélectionner d'abord un processus RAG ou Agent mesurable et de grande valeur pendant 2 à 4 semaines en tant que pilote, et de définir des indicateurs tels que la couverture des traces, l'heure de localisation des pannes, le nombre d'examens manuels, le taux de fausses alarmes d'interception et le taux de réussite du contrôle d'accès en ligne. Lorsque les indicateurs sont stables et que l’équipe parvient à un consensus sur le processus d’évaluation, étendez-vous au déploiement multi-équipes, multi-agents ou en entreprise. Avant d'acheter, les entreprises doivent se concentrer sur l'examen : si les conditions du VPC/sur site et la résidence des données répondent aux exigences de conformité ; la portée de l'activation et la structure tarifaire de Luna-2 et Luna Studio dans le cadre du contrat actuel ; la compatibilité du SSO/RBAC et du système de gestion des identités d’entreprise (IdP) ; le temps de réponse réel et le chemin de mise à niveau du support 24h/24 et 7j/7 ; et les conditions de prise en charge de l'exportation et de la migration des données à la résiliation du contrat.

Outils associés : hugging-face, replicate

Informations de version

  • Contrôle des agents pour les entreprises clientes :Les notes de version officielles ont publié Agent Control, qui définit de manière centralisée les garde-fous et gère la gouvernance des agents pour les entreprises clientes. Il peut bloquer l'injection rapide de contenu nuisible, les fuites de données personnelles et d'autres risques sans modifier le code de l'agent.
  • Luna Studio et tableaux des coûts d'intégration :Les notes de version officielles annoncent la sortie des fonctionnalités d'entreprise de Luna Studio pour la formation de métriques SLM à faible latence et à faible coût, ainsi que l'ajout de la page de gestion des coûts d'intégration pour suivre les coûts de LLM en tant que juge.
  • Plateforme de fiabilité des agents :Le blog officiel a annoncé la plateforme gratuite Agent Reliability Platform, qui s'articule autour des garde-corps en temps réel Graph Engine, Insights Engine et Luna-2, prenant en charge l'observation du système multi-agents, l'analyse des modes de défaillance et la protection de la production.
  • Plateforme d'intelligence d'évaluation :Le blog officiel a annoncé un financement de série B de 45 millions de dollars et a défini la principale gamme de produits comme Plateforme d'intelligence d'évaluation, couvrant le cycle de vie de la qualité de l'IA tel que le réglage fin, l'évaluation, l'observation et la protection.

Avis des utilisateurs

  • Chargement des avis...