Base de navigateur Gratuit

-

Browserbase fournit des sessions de navigateur gérées, des fonctionnalités de gestion de la concurrence et d'observabilité pour aider les équipes à créer des agents d'automatisation de pages Web stables.

Base de navigateur Interface du produit

Browserbase : infrastructure d'automatisation du navigateur cloud pour les agents IA

Présentation de l'outil

Browserbase est une plate-forme d'infrastructure de navigateur cloud conçue pour les agents IA et les workflows d'automatisation Web. Sa valeur fondamentale n'est pas de « déplacer le navigateur vers le cloud », mais de « concevoir les opérations des pages Web dans une infrastructure programmable » - permettant aux agents d'exploiter de vrais navigateurs comme l'appel d'API et de gérer la connexion, le rendu dynamique, l'interaction de formulaire, le contournement anti-exploration et d'autres scénarios que les navigateurs sans tête traditionnels ne peuvent pas gérer de manière stable.

En juillet 2026, Browserbase comptait plus de 10 000 entreprises clientes et 100 000 développeurs. Son projet open source Stagehand (IA Browser Automation Framework) a reçu plus de 23 600 étoiles sur GitHub, MCP Server a reçu plus de 3 400 étoiles et les téléchargements hebdomadaires du SDK ont atteint 800 000 fois. La plateforme gère plus de 200 millions de sessions de navigation uniques par mois.

Un bref commentaire : Il ne s'agit pas d'un simple package de "navigateur en tant que service", mais d'une base de couche d'exécution qui met à niveau l'exécution du navigateur de la "logique de script" aux "capacités d'infrastructure".

Jugement de classification : le formulaire de livraison principal de Browserbase est Agent/MCP/outil d'automatisation (fournissant des capacités d'interaction de page Web à l'agent via l'API de recherche/récupération et le navigateur en tant que service, et exposant les interfaces d'outils standard à LLM via le serveur MCP). Deuxièmement, il présente les caractéristiques d'une infrastructure de base pour grands modèles/API (fournissant un accès unifié aux grands modèles à Model Gateway et un contexte d'exécution du runtime).


Fonctions de base

Trois API principales

Browserbase a conçu une API en couches autour du lien « acquisition d'informations → extraction de contenu → exécution d'actions » :

  • API de recherche : portail de moteur de recherche Web orienté agent. Une seule requête POST renvoie des résultats de recherche structurés (URL du titre, résumé, date de publication), prenant en charge une limite de débit de 120 RPM par élément. Utilisation typique : lorsque l'agent doit rechercher les dernières informations sur Internet, il trouve les pages pertinentes via l'API de recherche, puis transmet les résultats à l'API Fetch ou à la session du navigateur.
  • Fetch API : convertissez le contenu d'URL arbitraires au format HTML, JSON ou Markdown, restituez intelligemment le contenu dynamique JS via un réseau proxy et renvoyez du texte structuré aseptisé. Le niveau gratuit comprend 1 000 appels, après quoi vous êtes facturé entre 0,5 $ et 1 000 $ pour 1 000 appels (4 $/1 000 $ en mode proxy).
  • Browser-as-a-Service : fournit un véritable contexte de navigateur Chromium complet pour l'agent, prenant en charge l'accès au protocole CDP (Chrome DevTools Protocol) et WebDriver. Chaque session se voit attribuer 2 processeurs virtuels, s'exécute de manière isolée et prend en charge la persistance des cookies, le téléchargement de fichiers, le chargement d'extensions Chrome, l'interception de requêtes et le routage de proxy personnalisé. Le niveau gratuit comprend 3 navigateurs simultanés et 1 heure de navigation.

Identité de l'agent (Système d'identité de l'agent)

Il s'agit de l'une des principales fonctionnalités différenciées de Browserbase, qui résout le problème du « mur d'identité » lorsque l'agent accède à de vraies pages Web :

  • Résolution automatique du code de vérification : reconnaissance CAPTCHA intégrée et mécanisme de transmission automatique, pas besoin d'intégration de services de code de vérification tiers.
  • Réseau proxy hébergé : fait pivoter automatiquement les adresses IP proxy résidentielles/centre de données, prend en charge le ciblage géographique et peut être configuré indépendamment pour chaque session.
  • Gestion de la sécurité des informations d'identification : stockez et injectez en toute sécurité les informations de connexion avec l'intégration 1Password pour éviter le codage en dur. Prend en charge la persistance des cookies et de l’état de session d’une exécution à l’autre, de sorte que l’agent n’a pas besoin de se reconnecter à chaque fois.
  • Stealth Stealth Mode : la version de base (plan développeur/démarrage) et la version avancée (plan Scale) offrent différents niveaux de camouflage d'empreintes digitales anti-détection pour réduire le risque d'être identifié comme des scripts automatisés par les sites Web cibles.

Observabilité

Browserbase traite l'observabilité comme une fonctionnalité native de la plateforme plutôt que comme un composant rétrochargé :

  • Live View : regardez chaque étape du fonctionnement de l'agent dans le navigateur en temps réel et aidez l'équipe à partager des liens de débogage.
  • Relecture de session : enregistrez automatiquement chaque session de navigateur et lisez-la pour afficher la trace complète des opérations de l'agent.
  • Journalisation structurée : capture automatiquement les requêtes réseau, les sorties de la console, les messages d'erreur et le timing d'exécution par session, prenant en charge le filtrage et la récupération sur des milliers de sessions parallèles.

Runtime (exécution de l'agent)

Fournit un contexte d'exécution de l'agent en bac à sable et prend en charge le déploiement à la demande ou planifié :

  • Chaque agent s'exécute dans un contexte complètement isolé, sans état et sans résidu d'exécution croisée.
  • Prise en charge native de la mise à l'échelle de la concurrence sur des milliers d'agents parallèles sans avoir besoin de provisionner un cluster de serveurs.
  • Isolation des pannes : un agent en panne n'affectera pas les tâches adjacentes ni l'état partagé.

Modèle de passerelle

Grâce à la même clé API Browserbase, vous pouvez accéder aux grands modèles de langages grand public (tels que Gemini, GPT-4o, Claude, etc.) et unifier la gestion des factures. Le niveau gratuit comprend un crédit d’appel modèle de 5 $.

Vue d'expert - Effet de liaison caché :

  • Recherche → Récupérer → L'API à trois couches du navigateur n'est pas un produit indépendant, mais constitue une interaction complète de page Web d'agent comprenant : Rechercher des informations de positionnement → Récupérer un filtrage rapide → Interaction approfondie du navigateur et exécution d'actions. L’effet de liaison des trois est bien supérieur à celui d’une seule couche.
  • Le SDK Stagehand, en tant qu'abstraction de niveau supérieur, décide intelligemment quand utiliser le raisonnement de l'IA (traitement de pages inconnues) et quand utiliser le cache/code (exécution de processus connus), réalisant ainsi un modèle hybride « exploration basée sur l'IA + exécution basée sur le code » pour trouver un équilibre entre le coût du jeton et la certitude d'exécution.
  • MCP Server expose l'ensemble de ces fonctionnalités à LLM via 6 outils standardisés, de sorte que tout client prenant en charge le protocole MCP (tel que Claude Desktop, VS Code, Cursor, etc.) puisse obtenir des fonctionnalités de navigation Web sans aucun codage.

Stratégie de tarification

Modèle de tarification à quatre niveaux (à compter de juillet 2026)

Spécifications Gratuit Développeur (20 $/mois) Démarrage (99$/mois) Échelle (personnalisée)
Nombre de navigateurs simultanés 3 25 100 250+
Durée du navigateur 1 heure/mois 100 heures (plus de 0,12 $/h) 500 heures (plus de 0,10 $/h) Par utilisation
Durées d'exécution des agents 3 15 50 Personnalisé
Appel API de recherche 1 000 1 000 ($ 7/1 000 excédentaires) 1 000 ($ 7/1 000 excédentaires) Personnalisé
Récupérer l'appel API 1 000 1 000 (excédent de 1/1 000 $) 10 000 (0,5 $/1 000 excédent) Par utilisation
Trafic proxy Aucun 1 Go 5 Go 5 Go+
Solution automatique du code de vérification ✅(Agents vérifiés)
Conservation des données 7 jours 30 jours 30 jours 30+ jours
Passerelle modèle Quota de 5 $ Prix ​​du marché basé sur l'utilisation Prix ​​du marché basé sur l'utilisation Prix ​​du marché basé sur l'utilisation
Mode furtif Aucun De base De base Avancé
HIPAA/DPA
Authentification unique SSO

Répartition de la structure des coûts :

  • Client/Petites équipes : le plan gratuit est suffisant pour les projets de validation de principe et expérimentaux, mais les limites d'une heure de navigation et de trois sessions simultanées signifient qu'il ne peut être utilisé pour aucune tâche de niveau production.
  • Développeur : Le forfait Développeur à 20 $/mois est la véritable barrière à l'entrée. Selon les estimations officielles, 100 heures de navigation équivalent à environ 3 000 tâches au niveau de la page (exploration Web typique <2 minutes/heure), ce qui convient aux projets à moyen terme réalisés par des développeurs individuels.
  • Entreprise : la valeur réelle du plan Scale réside dans la conformité HIPAA et le SSO en mode furtif avancé, et non dans l'expansion pure des ressources. Lors de l'achat, le « coût unitaire d'achèvement des tâches » plutôt que le « prix unitaire d'appel unique » doit être utilisé comme indicateur d'évaluation de base.

Conseil sur les coûts cachés : Le prix unitaire par heure de navigation peut ne pas sembler élevé (0,10 $ ~ 0,12 $), mais le temps d'exécution unique de tâches interactives complexes (formulaires en plusieurs étapes, sauts de page en profondeur, réponse anti-exploration) peut être bien plus long que 2 minutes, ce qui rend le coût réel d'une « tâche » nettement supérieur à la valeur estimée du prix. Il est recommandé d'établir un modèle de coût complet de « taux de réussite des tâches × temps d'exécution moyen × taux de tentatives » dans l'environnement de production.


Analyse des avantages et des inconvénients

Avantages

  1. Capacité d'interaction de page Web complète : de la simple saisie de page aux opérations complexes de connexion, de remplissage de formulaires et de fichiers, une seule clé API couvre l'intégralité du lien, éliminant ainsi le besoin de rassembler plusieurs outils.
  2. Conception native de l'agent : la conception de l'API s'articule autour du flux de travail de l'agent plutôt que des opérations manuelles, et la hiérarchie Recherche/Récupération/Navigateur est naturellement adaptée aux frameworks d'agent tels que ReAct.
  3. Forte activité communautaire et écologique : Stagehand 23,6k étoiles, MCP Server 3,4k étoiles, 800k téléchargements hebdomadaires, il est devenu l'un des standards de facto dans le domaine de l'automatisation des navigateurs open source.
  4. Conformité de sécurité mature : conformité SOC 2 Type II + HIPAA, rapport de test d'intrusion 2026 disponible, des contrôles de sécurité au niveau de l'entreprise (cryptage des données, plan BCDR de contrôle d'accès) ont été mis en œuvre.
  5. Observabilité de niveau production : L'affichage en direct + la relecture de session sont essentiels pour résoudre les raisons de l'échec de l'exécution de l'agent. Il n'est pas nécessaire de s'appuyer sur le cycle de débogage inefficace consistant à « ajouter des journaux et réexécuter ».

Inconvénients

  1. Fortement dépendant de la plate-forme Browserbase : bien que le SDK Stagehand puisse être utilisé indépendamment, l'identité complète de l'agent, l'exécution, l'observabilité et d'autres fonctionnalités doivent être liées au service cloud Browserbase, ce qui présente un risque de dépendance vis-à-vis du fournisseur.
  2. Croissance non linéaire des coûts dans les scénarios à forte simultanéité : le nombre de simultanéités dans le plan Scale (250+) nécessite un devis personnalisé, et le prix unitaire des appels Search/Fetch qui dépassent le quota de base est élevé. Dans les scénarios de collecte de données à grande échelle, la facture mensuelle peut augmenter rapidement.
  3. Sensible aux changements dans la structure des pages : bien que l'auto-réparation (mécanisme d'auto-réparation) de Stagehand et les sélecteurs pilotés par l'IA puissent atténuer les ruptures causées par les modifications de page, les opérations clés qui dépendent profondément de la structure DOM nécessitent toujours une intervention manuelle lorsque les versions majeures des pages sont mises à jour.
  4. Ne convient pas aux transactions de base dans les secteurs de conformité stricte : Pour des scénarios tels que l'exécution de transactions financières et les décisions de diagnostic médical qui nécessitent une exécution déterministe et une chaîne d'audit complète, le modèle « piloté par l'IA + sortie probabiliste » de Browserbase n'a pas encore établi suffisamment de confiance.

Comparaison avec les produits concurrents

Dimensions Base de navigateur Dramaturge (auto-construit) Marionnettiste + mandataire Sans navigateur.io Grille de sélénium
Infrastructure d'hébergement ✅ Entièrement géré ❌ Auto-construction/Exploitation et maintenance ❌ Auto-construction ✅ Hébergé ❌ Auto-construit
IA/Agent natif ✅ Rechercher/Récupérer/Machiniste ❌ Framework d'automatisation pure ❌ Framework d'automatisation pure ❌ Hébergement de navigateur pur ❌ Hébergement de navigateur pur
Anti-exploration/Furtif ✅ Identité de l'agent + Solveur de code de vérification ❌ Intégration manuelle requise ⚠️ Services supplémentaires requis ⚠️Agent de base ❌ Aucun
Observabilité ✅ Affichage en direct + Relecture ❌ Doit être construit par vous-même ❌ Doit être construit par vous-même ❌ Journal de base ❌ Doit être construit par vous-même
Support MCP ✅ Serveur MCP officiel ❌ Aucun ❌ Aucun ❌ Aucun ❌ Aucun
Open Source ⚠️ Stagehand Open Source, Core Closed Source ✅ Entièrement Open Source ✅ Entièrement Open Source ⚠️ Source fermée commerciale ✅ Entièrement Open Source
Mise en route Forfait gratuit disponible Gratuit (nécessite la création de votre propre serveur) Gratuit (nécessite la construction de votre propre infrastructure) 0 $+ avec le niveau gratuit Gratuit (nécessite la création de votre propre cluster)
Coût d'échelle Le paiement à l'usage, les petites et moyennes entreprises ont des avantages Dépend du coût du serveur Dépend de l'agent et du serveur Facturé par session Dépend du coût du serveur
Conformité d'entreprise SOC2 + HIPAA Dépend de l'auto-construction Dépend de l'auto-construction SOC2 Dépend de l'auto-construction

Scénarios applicables

Scénario de frappe de réduction de dimensionnalité (le plus approprié)

  • Collecte de données de page Web pilotée par l'agent : lorsque le site cible n'a pas d'API publique, nécessite une connexion, dispose d'un mécanisme anti-exploration ou contient un processus d'interaction dynamique, la structure à trois couches Recherche → Récupération → Navigateur de Browserbase permet à l'agent de terminer indépendamment l'ensemble du processus de « découverte → extraction → interaction ».
  • Surveillance des produits compétitifs et suivi des prix à grande échelle : utilisez des sessions de navigateur simultanées pour surveiller simultanément des centaines de pages de produits concurrents, des prix de commerce électronique et des informations de recrutement, et coopérez avec la planification planifiée du Runtime pour assurer une surveillance continue. La bibliothèque de modèles officielle comprend des cas d'utilisation prêts à l'emploi tels que la comparaison des prix Amazon, les mots-clés tendances de Google, etc.
  • Automatisation des opérations en arrière-plan à forte intensité de formulaire : dans des scénarios tels que les portails de fournisseurs, les plateformes d'affaires gouvernementales et les systèmes de recrutement qui nécessitent une connexion au compte et un remplissage répété de formulaires, la persistance des cookies de Browserbase + la résolution du code de vérification + le traitement auxiliaire MFA peuvent réduire considérablement les interventions manuelles.
  • Tests de bout en bout des agents et surveillance de la qualité : effectuez en continu des tests de régression pilotés par les agents sur le front-end du produit et détectez automatiquement les problèmes lorsque les styles de page/interactions changent. Ce scénario a été validé par des clients tels qu'Amplitude et Vercel.
  • GTM et Sales Process Automation : Amplitude (Sales Demo Automation) et Ramp dans les cas clients démontrent leur valeur en remplaçant la navigation manuelle dans les scénarios GTM.

Décourager/Personnes inapplicables

  • Exploration de données pures à haut débit : si l'entreprise doit explorer des millions de pages chaque jour et que le site cible n'a pas d'exploration inversée, le coût d'utilisation d'un cluster Playwright auto-construit + proxy bon marché est bien inférieur à la facturation à l'utilisation de Browserbase.
  • Opérations financières/médicales de base avec des exigences absolues de certitude : des scénarios tels que l'exécution de transactions boursières et l'émission d'ordonnances médicales nécessitent une certitude à 100 % et une chaîne d'audit complète. L’automatisation des navigateurs basée sur l’IA ne peut actuellement pas fournir de telles garanties.
  • Entreprises couvertes par des API stables : si le processus commercial principal (tel que la synchronisation des données CRM et l'intégration ERP) dispose déjà d'une API officielle stable, le revenu marginal de Browserbase approchera de zéro.
  • Nécessite un déploiement complet hors ligne/privatisé : Browserbase ne propose actuellement pas d'options de déploiement privatisées (la FAQ officielle confirme que le site n'est pas pris en charge), et les clients gouvernementaux et d'entreprise ayant des exigences extrêmement élevées en matière de souveraineté des données ne peuvent pas l'adopter.

Comparaison de l'amélioration de l'efficacité

Ce qui suit est une déduction (valeur promise non officielle) basée sur plusieurs cas de clients publics et des références du secteur :

Scénario de tâche Manuel traditionnel fastidieux Script traditionnel prend beaucoup de temps La déduction de l'agent Browserbase prend beaucoup de temps Levier d'efficacité de base
Surveillance des prix sur 50 sites Web concurrents (quotidiennement) 2-3 jours-personnes 4-6 heures (entretien compris) 10-15 minutes (tentatives automatiques + observabilité) Sessions de navigateur simultanées + résolution automatique de CAPTCHA
Remplissage et soumissions de formulaires sur le portail de 100 fournisseurs 1-2 jours-homme 3 à 5 heures (y compris le débogage) 20 à 30 minutes (y compris les tentatives infructueuses) Persistance des cookies + Système d'identité
Enregistrement d'informations multiplateformes pour les nouvelles versions de produits 0,5-1 personne-jour 2-3 heures (développement de script + débogage) 5 à 10 minutes Exploration basée sur l'IA Stagehand
Suivi mensuel des modifications apportées aux fonctionnalités des pages Web des produits concurrents 3-5 jours-personnes 6 à 8 heures (nécessite une maintenance du sélecteur) 15-20 minutes Auto-guérison + Replay de session
Tests de régression front-end des produits SaaS (20 processus principaux) 4-6 jours-homme 2-4 heures (maintenance du script) 10-15 minutes Test du pilote MCP + Agent

Chemin critique vers la version d'efficacité : Browserbase ne "rend pas l'automatisation un peu plus rapide", mais en éliminant les trois goulots d'étranglement de "Contextual Construction (Runtime)", "Anti-crawling Confrontation (Identity)" et "Failure Troubleshooting (Observability)", il transforme l'automatisation des pages Web du mode "développement et maintenance de scripts" au mode "définir les tâches et observer l'exécution". L'attention de l'équipe est passée de « l'écriture de scripts » à « la définition des tâches des agents et l'analyse des raisons des échecs ».


Limite de l'automatisation

Peut être 100 % automatisé et organisé

  1. Acquisition d'informations à partir de pages Web publiques : exploration de pages, extraction de résultats de recherche et collecte de données structurées qui ne nécessitent pas de connexion.
  2. Remplissage régulier de formulaires : Soumission de formulaires multi-sites avec des champs définis et des processus fixes (tels que l'envoi de CV dans le système de recrutement).
  3. Tâches de surveillance pure : détection de changement de prix, alarmes de changement de contenu de page, inspection de disponibilité.
  4. Exportation de données standardisée : Exportez des rapports, des déclarations de téléchargement et d'autres opérations répétitives depuis le backend SaaS avec un mur de connexion (à condition que les informations de connexion soient stables).

Certaines sections nécessitent une confirmation manuelle (Human-in-the-loop)

  1. Opérations impliquant des flux de capitaux : confirmation de paiement, lancement de transfert, vérification après soumission de la commande - il est recommandé de configurer d'abord des étapes de confirmation manuelle ou d'exécuter le mode essai à sec.
  2. Opérations de compte irréversibles : Pour les opérations telles que l'annulation de compte, les modifications d'autorisation, la suppression de données, etc., AI ne devrait pas avoir les droits d'exécution finaux.
  3. Processus de livraison client à forte valeur ajoutée : l'envoi de devis personnalisés, la signature de contrats et d'autres procédures impliquant une validité juridique nécessitent un examen manuel avant exécution.
  4. Page inconnue visitée pour la première fois : lorsque l'agent rencontre une mise en page qu'il n'a jamais vue auparavant, bien que le mode IA de Stagehand puisse l'explorer, il est recommandé d'activer Live View pour une supervision humaine lors de la première exécution.

Contraintes techniques sur les limites de l'automatisation

  • Évolution du code de vérification : bien que l'identité de l'agent ait une résolution intégrée du code de vérification, la technologie CAPTCHA continue d'évoluer (comme l'analyse comportementale de reCAPTCHA v3) et le taux de réussite de 100 % ne peut pas être garanti. Il est recommandé de configurer la logique de sauvegarde « échec du code de vérification → changer d'agent/identité → nouvelle tentative » dans le flux de travail de l'agent.
  • Interaction profonde des applications monopage (SPA) : le DOM du SPA moderne (React/Angular/Vue) est généré dynamiquement, et le sélecteur d'IA de Stagehand prend mieux en charge cela, mais certains cas extrêmes (tels que l'interface basée sur Canvas mise à jour en temps réel pilotée par WebSocket) nécessitent toujours une spécialisation manuelle.
  • Échec à longue traîne des processus en plusieurs étapes : dans les opérations complexes comportant plus de 10 étapes, même si le taux de réussite en une seule étape atteint 99 %, le taux de réussite global n'est que d'environ 90 %. Des stratégies progressives de points de contrôle, de restauration et de nouvelle tentative doivent être conçues dès la production.

Sécurité et conformité

Certification de conformité

  • SOC 2 Type II : audit annuel 2025 réussi, le rapport du test d'intrusion 2026 est accessible au public.
  • SOC 2 Type I : adopté en 2024.
  • HIPAA : Déjà conformes aux exigences de la Health Insurance Portability and Accountability Act, les plans Scale prennent en charge un accord BAA.
  • DPA : Un accord de traitement des données peut être signé sur demande.

Contrôle de la sécurité des données

Selon les informations publiques du Browserbase Trust Center (trust.browserbase.com) :

  • Chiffrement des données : le chiffrement du transport (TLS 1.2+) et le chiffrement du stockage sont activés.
  • Contrôle d'accès : les droits d'accès liés à la production sont strictement limités et une authentification d'identité unique est appliquée.
  • Gestion des clés : accès contrôlé aux clés de chiffrement, avec injection sécurisée des informations d'identification via l'intégration 1Password.
  • Conservation et suppression des données : 7 jours pour le plan Free/Developer, 30 jours pour Startup/Scale, les données sont supprimées conformément à la politique lorsque le client quitte.
  • Tests d'intrusion : 2026 Tests d'intrusion tiers terminés.

l'évaluation des risques

Risques potentiels nécessitant une attention particulière :

  1. Résidence des données et restrictions géographiques : Browserbase n'a pas divulgué la liste spécifique des régions du centre de données (sous réserve de la réponse à la FAQ officielle « Dans quelles régions vous trouvez-vous »). Pour les clients ayant des exigences en matière de localisation des données (telles que le RGPD de l'UE, la « loi chinoise sur la sécurité des données »), l'emplacement géographique du stockage et du traitement des données doit être confirmé avant l'achat.
  2. Risque de fuite d'informations d'identification : bien que l'identité de l'agent gère les informations d'identification via 1Password, chaque opération de page effectuée par l'agent sera enregistrée et lue, et les informations de connexion des pages sensibles (telles que les antécédents bancaires et médicaux) peuvent être exposées en texte clair dans les journaux de la plateforme - il est recommandé d'évaluer ces scénarios individuellement pour vérifier leur conformité.
  3. Verrouillage du fournisseur : le SDK Stagehand est open source, mais l'infrastructure principale du navigateur est liée à la plate-forme cloud Browserbase, ce qui entraîne des coûts de migration plus élevés. Il est recommandé à l'équipe de concevoir une « couche d'abstraction » (telle que l'encapsulation de la logique de création de session de navigateur via un adaptateur personnalisé) dès le début du projet afin de réduire les coûts de commutation futurs.
  4. Politique d'utilisation des données du modèle d'IA : Il n'a pas été officiellement indiqué clairement si les données transmises dans Model Gateway seront utilisées pour la formation du modèle. Pour le contenu Web impliquant des secrets commerciaux ou des informations personnelles, il est recommandé d'éviter d'utiliser le modèle par défaut de Model Gateway ou de clarifier les limites d'utilisation des données dans le contrat d'approvisionnement.

Écosystème intégré

Prise en charge du SDK et du framework

Catégorie Assistance
SDK officiel TypeScript/Node.js (64 étoiles), Python (89 étoiles)
Stagehand (SDK principal) TypeScript (23 600+ étoiles, licence MIT), prend en charge le sélecteur de langage naturel, mécanisme d'auto-réparation, mode hybride IA/code
SDK dérivé de Stagehand Python (497 étoiles), Go (22 étoiles), Ruby (9 étoiles), Java/Kotlin (Alpha), C#/.NET (Alpha), PHP (Alpha)
Cadre d'automatisation du navigateur Dramaturge (recommandé), Marionnettiste, Selenium
Intégration du framework d'agent LangChain, CrewAI, Mastra
Protocole MCP Le serveur MCP officiel (3 400+ étoiles, Apache 2.0) prend en charge deux modes de transmission : STDIO et SHTTP

Liste des outils du serveur MCP

Browserbase MCP Server expose les 6 outils standardisés suivants à LLM :

Nom de l'outil Fonction Paramètres
démarrer Créer ou réutiliser une session de navigateur Browserbase (aucun)
fin Fermer la session actuelle du navigateur (aucun)
naviguer Accédez à l'URL spécifiée { url : chaîne }
agir Effectuer une action sur la page (cliquer, taper, etc.) { action : chaîne }
observer Observez les éléments interactifs sur la page { instruction : chaîne }
extrait Extraire les données structurées de la page { instruction, : chaîne }

Lien architectural :

LLM (Claude/GPT/Gémeaux)
  ↓ Protocole MCP
Serveur MCP Browserbase (local ou hébergé)
  ↓ SDK de machiniste
API du navigateur Browserbase
  ↓ CDP/WebDriver
Instance Chromium (bac à sable d'isolation cloud)
  ↕ Redistribution des données
Observabilité (Live View + Replay + Logs)

Guide de démarrage rapide en 3 minutes

Méthode 1 : serveur MCP hébergé (recommandé, configuration nulle)

Ajoutez la configuration du client MCP :

{
  "mcpServeurs": {
    "base de navigateur": {
      "type": "http",
      "url": "https://mcp.browserbase.com/mcp"
    }
  }
}

Si le client ne prend pas en charge le transport SHTTP, utilisez un proxy distant :

{
  "mcpServeurs": {
    "base de navigateur": {
      "commande": "npx",
      "args": ["mcp-remote", "https://mcp.browserbase.com/mcp"]
    }
  }
}

Méthode 2 : serveur MCP auto-hébergé (nécessite une clé API)

{
  "mcpServeurs": {
    "base de navigateur": {
      "commande": "npx",
      "args": ["@browserbasehq/mcp"],
      "env": {
        "BROWSERBASE_API_KEY": "<VOTRE_API_KEY>",
        "BROWSERBASE_PROJECT_ID": "<VOTRE_ID_PROJECT>",
        "GEMINI_API_KEY": "<VOTRE_GEMINI_API_KEY>"
      }
    }
  }
}

Méthode 3 : Utilisation de l'exemple Python du SDK Stagehand

à partir de la base du navigateur importer la base du navigateur
depuis playwright.sync_api importer sync_playwright
importer le système d'exploitation

bb = Browserbase(api_key=os.environ["BROWSERBASE_API_KEY"])

# Créer une session de navigateur
session = bb.sessions.create()

avec sync_playwright() comme dramaturge :
    navigateur = playwright.chromium.connect_over_cdp(session.connect_url)
    page = navigateur.contexts[0].pages[0]

    # Accédez à la page cible
    page.goto("https://exemple.com")

    #Extraire le contenu de la page
    contenu = page.text_content("corps")
    imprimer(contenu[:500])

    page.close()
    navigateur.close()

Guide des pièges d'ingénierie

  1. Boucle sans issue et contrôle de l'explosion des jetons : lorsque l'agent rencontre une page complexe, elle peut tomber dans une boucle infinie de "tentatives répétées → échec → nouvelle tentative", provoquant une montée en flèche de la durée de la session du navigateur et de la consommation des jetons LLM. Solution : définissez max_steps (nombre maximum d'étapes d'exécution, 20 à 50 étapes recommandées), le délai d'expiration d'une seule étape (30 à 60 secondes recommandées), la détection des actions répétées (interruption automatique si la même URL/opération est répétée plus de 3 fois) dans l'implémentation de l'agent et contrôlez le comportement de la session via les paramètres --keepAlive et --browserWidth/Height au démarrage du serveur MCP.

  2. Surcharge DOM/Context : Le nombre de nœuds DOM de grandes pages (telles que le tableau de bord SaaS, la page de liste de commerce électronique) peut dépasser 10 000, et le passage direct dans le contexte LLM épuisera rapidement le budget du jeton. Solution : utilisez l'outil observe() de Stagehand pour renvoyer uniquement l'arborescence d'accessibilité des éléments interactifs au lieu du DOM complet, ou obtenez la version récapitulative via la conversion Markdown de l'API Fetch avant de décider de démarrer ou non une session de navigateur complète.

  3. Sécurité et gouvernance ultra vires : L'agent peut effectuer des opérations irréversibles (telles que la suppression de ressources, la soumission de paiements, la publication de contenu) sans surveillance. Solution : activez le mode lecture seule (sans injecter d'informations d'identification) pour la session de navigateur de Browserbase pour la répétition, configurez des étapes de confirmation indépendantes (Human-in-the-loop) pour les opérations impliquant des modifications de fonds/données et utilisez l'ID de contexte pour isoler les tâches avec différents niveaux d'autorisation.


Suggestions de mise en œuvre

Chemin d'adoption de l'équipe

Phase 1 (preuve de concept, 1 à 2 semaines) :

  • Utilisez le plan gratuit + Stagehand pour créer rapidement une tâche d'agent de bout en bout (telle que la surveillance de modifications de contenu spécifiques sur une page Web spécifiée).
  • Vérifiez les fonctionnalités de base : le taux de réussite des appels d'API, les performances du scénario anti-exploration et l'observabilité des sessions sont conformes aux attentes.
  • Afficher la référence « Taux de réussite de la tâche × Coût d'exécution unique ».

Phase 2 (pilote de production, janvier-février) :

  • Passez au plan Développeur ou Startup et choisissez 1 à 2 scénarios commerciaux avec des exigences de stabilité moyennes (comme le suivi des prix des produits compétitifs, l'automatisation des formulaires).
  • Établir une stratégie de publication en niveaux de gris : piloter d'abord avec 20 % de trafic, puis étendre progressivement jusqu'à 100 %.
  • Configurez les alarmes d'observabilité et les processus de prise de contrôle manuels pour les échecs d'exécution de l'agent.
  • Etablir un tableau de bord de suivi continu du « Coût unitaire de tâche ».

Phase 3 (mise à l'échelle, à la demande) :

  • Évaluer le retour sur investissement des initiatives d'échelle, en se concentrant sur la question de savoir si le mode furtif avancé et la conformité HIPAA correspondent aux besoins de l'entreprise.
  • Concevoir des couches d'abstraction pour réduire le risque de dépendance vis-à-vis du fournisseur (par exemple, encapsuler la création de session de navigateur via le modèle Adaptateur).
  • Établir des normes de marché/d'évaluation pour les tâches des agents afin d'éviter que « chaque équipe ne construise sa propre roue d'agent ».

Situations où l'adoption immédiate n'est pas recommandée

  • L'équipe manque d'expérience de base en matière d'exploitation et de maintenance de l'automatisation Web (pas même en dramaturge/marionnettiste). Il est recommandé d’accumuler des capacités de base en interne avant de passer aux solutions d’hébergement cloud.
  • Le scénario commercial concerne principalement la planification des données d'une API stable, plutôt que l'interaction du navigateur.
  • La souveraineté ou la privatisation des données est déployée comme une exigence stricte de conformité.

Liste de contrôle pour l'évaluation des achats

Dimensions de l'évaluation Éléments de confirmation
Taux de réussite des tâches Exécutez 100 tâches de test sur le site Web cible et calculez le taux de réussite de base
Coût unitaire de la tâche (frais mensuels + frais de dépassement + frais de modèle) ÷ nombre de tâches terminées
Vérification anti-crawling/homme-machine Testez le taux de réussite de la résolution du code de vérification sur le site cible
Satisfaction de l'observabilité Si log + Replay répond aux exigences de dépannage
Correspondance de conformité Si SOC 2/HIPAA/SSO/résidence des données répond aux exigences de l'industrie
Coût de la migration Si vous passez à une autre solution, estimation du coût de transformation du code

Résumé et Outlook

L'essence de Browserbase est de concevoir des « opérations de page Web », une « activité technique » qui appartenait à l'origine à la couche de script, en capacités d'infrastructure observables, gérables et évolutives. Dans la chaîne de valeur de l'agent AI, il assume le rôle de « couche d'exécution » : lorsque l'agent doit interagir avec une page Web réelle, Browserbase fournit un ensemble complet de solutions allant de la recherche/récupération (couche d'informations) au navigateur (couche d'interaction) en passant par le Runtime (couche de déploiement).

Jugement des tendances technologiques : à mesure que l'agent IA évolue de Chatbot à Agent d'exécution, la valeur des pages Web en tant que « plus grande interface d'interaction humaine » continuera d'augmenter. Grâce à la double stratégie de l'écosystème open source Stagehand et du protocole standard MCP, Browserbase devient un standard potentiel pour la couche d'infrastructure des « pages Web d'exploitation d'agent ». Mais le paysage concurrentiel évolue également rapidement : le MCP de Playwright, les services d'automatisation de navigateur de divers fournisseurs de cloud et les améliorations continues de Puppeteer poseront tous des défis à Browserbase au cours des 12 à 18 prochains mois.

Limite inappropriée réitérée : Fortement dépendant de transactions financières déterministes, de collecte de données pures à grande échelle extrêmement sensibles aux coûts, de scénarios gouvernementaux et d'entreprise qui nécessitent un déploiement 100 % privatisé - ces trois types de besoins devraient donner la priorité à l'évaluation de solutions non-Browserbase.

Évaluation des risques d'approvisionnement/d'adoption : le plus grand risque à l'heure actuelle n'est pas le manque de capacités techniques (la maturité de Browserbase est en tête parmi les produits similaires), mais ① le degré de dépendance vis-à-vis du fournisseur - l'infrastructure de base est liée à la plate-forme cloud et le coût de migration est élevé ; ② l'expansion non linéaire des coûts – la facture des scénarios simultanés à grande échelle peut dépasser les attentes budgétaires ; ③ transparence de la conformité - la région de résidence des données et la politique d'utilisation des données de formation du modèle d'IA doivent encore être claires dans le contrat. Il est recommandé qu'une fois que l'équipe de l'entreprise a terminé le POC, elle apporte les données de coût du scénario réel aux négociations commerciales avec les ventes pour le plan Scale et exige que la clause de restriction d'utilisation des données (avenant d'utilisation des données) et les normes SLA soient écrites dans le contrat.

Outils associés : crewai, langchain

Principales fonctions de Browserbase

  • Capacités de traitement de base : fournit des fonctionnalités d'IA de base dans les scénarios correspondants pour aider les utilisateurs à effectuer rapidement des tâches.
  • Interaction multimodale : prend en charge la saisie de texte et la sortie des résultats, et certaines scènes prennent en charge le téléchargement d'images ou de fichiers.
  • Intégration du workflow : peut être intégré aux workflows existants ou lié à d'autres outils via des API pour réduire le changement de contexte.

Scénarios d'application de Browserbase

  • Création personnelle : générez ou traitez rapidement du contenu pour améliorer l'efficacité du travail quotidien.
  • Collaboration en équipe : unifiez le flux de travail et réduisez les investissements répétitifs en main-d'œuvre.
  • Déploiement de niveau entreprise : intégrez des fonctionnalités dans des systèmes sur site via une API ou un déploiement privé.

Groupes applicables de Browserbase

  • Utilisateurs individuels : créateurs de contenu et travailleurs du savoir qui ont besoin de l'aide de l'IA pour améliorer leur efficacité au travail quotidien.
  • Développeurs : équipes techniques qui doivent intégrer des fonctionnalités d'IA dans leurs propres produits ou services via des API.
  • Entreprise : organisations cherchant à déployer l'IA à grande échelle dans leur domaine.

Les avantages techniques de Browserbase

  • Optimisation de l'algorithme : une optimisation spéciale au niveau du modèle ou de l'algorithme a été réalisée pour le scénario correspondant afin d'atteindre un équilibre entre vitesse de réponse et qualité des résultats.
  • Architecture à faible latence : adopte une architecture de traitement en continu ou asynchrone pour réduire le temps d'attente des utilisateurs et convient aux scénarios d'interaction à haute fréquence.

Paramètres et statistiques de base de Browserbase

Les paramètres techniques spécifiques (tels que la taille du modèle, la longueur du contexte, les formats de fichiers pris en charge, les restrictions d'entrée et de sortie, etc.) sont soumis à la page officielle du produit. Il est recommandé aux utilisateurs de vérifier les dernières spécifications techniques et exigences système avant de choisir pour s'assurer qu'elles correspondent à leurs propres scénarios d'utilisation.

Reconnaissance des utilisateurs et du marché de Browserbase

Sensibilisez progressivement les utilisateurs sur le terrain et les capacités du produit sont utilisées par les créateurs de contenu et les équipes pour améliorer l'efficacité du travail. Certains utilisateurs de l'industrie l'ont intégré à leur flux de travail quotidien. Il est recommandé de se référer aux dernières divulgations officielles pour connaître les données spécifiques sur l’échelle des utilisateurs et le taux d’adoption par l’industrie.

L'avantage de coût de Browserbase

  • C-side/Individuel : Généralement, une version gratuite est fournie pour découvrir les fonctions de base, et l'utilisation à haute fréquence nécessite un abonnement payant.
  • API/Développeur : Facturé au volume d'appels, adapté aux équipes de développement qui peuvent être intégrées de manière flexible dans leurs propres systèmes.
  • Entreprise/Privatisé : contactez le propriétaire de l'entreprise pour un devis personnalisé et un plan de déploiement. Le prix spécifique est soumis à la page officielle de tarification en temps réel.

Evolution du modèle et de la version de Browserbase

Mises à jour itératives continues, la dernière version introduit une optimisation des performances et de nouvelles fonctionnalités. Les informations sur la version historique peuvent être consultées sur la page de version officielle. Il n’existe pas encore de calendrier complet d’évolution de la version publique. Il est recommandé de prêter attention à l'annonce officielle pour comprendre le rythme des mises à jour des fonctionnalités.

Comment utiliser Browserbase

  • Client Web : Vous pouvez l'utiliser en visitant le site officiel et en créant un compte. La plupart des fonctions ne nécessitent pas d'installation.
  • Accès API : fournit une API RESTful, les développeurs peuvent obtenir la clé API et l'intégrer dans leurs propres applications.

Prix des produits de base du navigateur

Le modèle de tarification est soumis à la page officielle en temps réel. Habituellement, un système freemium ou d'abonnement est utilisé et les fonctions de base peuvent être utilisées gratuitement. Les fonctions avancées ou l'utilisation à haute fréquence nécessitent des abonnements payants, et il est conseillé aux utilisateurs d'évaluer la solution optimale en fonction de l'utilisation réelle.

Informations de version

  • Base de navigation juillet 2026 :Optimisez en permanence la stabilité de la session du navigateur, l'environnement d'exécution sandbox d'Agent Runtime et développez l'ensemble d'outils MCP pour l'intégrer à Stagehand v3.7+. Les fonctionnalités spécifiques sont soumises à une publication officielle en temps réel.
  • Base de navigation juin 2026 :Présentation de la fonction Agent Identity pour améliorer les capacités de résolution automatique du code de vérification et de gestion IP des agents.
  • Base de navigation mars 2026 :MCP Server a officiellement publié la version 3.0.0, prenant en charge 6 outils standardisés ; Le SDK Stagehand a atteint 23,6 000 étoiles.
  • première sortie publique :Les informations sur la première version n'ont pas été entièrement divulguées, veuillez vous référer au journal de mise à jour officiel.

Avis des utilisateurs

  • Chargement des avis...