IA des travailleurs Cloudflare

-

Cloudflare Workers AI est une plateforme mondiale d'inférence d'IA de pointe lancée par Cloudflare. Basé sur l'architecture Workers Serverless, il prend en charge l'exécution de modèles LLM et image/audio open source sur des nœuds périphériques dans plus de 310 villes pour obtenir une inférence d'IA à faible latence.

IA des travailleurs Cloudflare Interface du produit

CloudflareWorkersAI

Paramètres et statistiques de base

Élément de paramètre Descriptif
Positionnement du produit Plateforme sans serveur d'inférence Global Edge AI
Nœuds de couverture Plus de 310 villes, plus de 120 pays
Types de modèles pris en charge Génération de texte LLM Intégration, génération d'images, reconnaissance vocale, traduction
Origine du modèle Modèles open source (Llama, Mistral, Stable Diffusion, Whisper, etc.)
Modèles personnalisés Prise en charge du téléchargement de modèles privés (mise au point ou déploiement complet via LoRA)
Durée d'exécution Cloudflare Workers (architecture V8 Isolate)
Accélération GPU Les nœuds Workers AI sont équipés de GPU, alloués à la demande

La principale différence de Workers AI est qu'elle « n'a pas besoin de se soucier du GPU » : l'inférence traditionnelle de l'IA nécessite la location d'un serveur GPU, la configuration du cadre d'inférence et le traitement de l'expansion et de la contraction automatiques. Workers AI résume tout cela en une seule ligne d’appels API, exécutant automatiquement l’inférence sur les nœuds les plus proches dans le monde. Pour les applications d'IA en temps réel sensibles à la latence, l'inférence de périphérie peut réduire la latence du réseau de 50 à 80 % par rapport au cloud central.

Reconnaissance des utilisateurs et du marché

Sensibilisez progressivement les utilisateurs sur le terrain et les capacités du produit sont utilisées par les créateurs de contenu et les équipes pour améliorer l'efficacité du travail. Certains utilisateurs de l'industrie l'ont intégré à leur flux de travail quotidien. Il est recommandé de se référer aux dernières divulgations officielles pour connaître les données spécifiques sur l’échelle des utilisateurs et le taux d’adoption par l’industrie.

Avantage de coût

  • C-side/Individuel : Généralement, une version gratuite est fournie pour découvrir les fonctions de base, et l'utilisation à haute fréquence nécessite un abonnement payant.
  • API/Développeur : Facturé au volume d'appels, adapté aux équipes de développement qui peuvent être intégrées de manière flexible dans leurs propres systèmes.
  • Entreprise/Privatisé : contactez le propriétaire de l'entreprise pour un devis personnalisé et un plan de déploiement. Le prix spécifique est soumis à la page officielle de tarification en temps réel.

Fonctions principales

  • API d'inférence en un clic : appelez env.AI.run('@cf/meta/llama-4', { prompt }) via le SDK @cloudflare/ai pour terminer l'inférence de modèle sans avoir besoin de gérer l'infrastructure et le GPU.
  • Catalogue de modèles : prend en charge le pré-déploiement de plus de 50 modèles open source - génération de texte (Llama, Mistral, Gemma), intégration (BGE), génération d'images (Stable Diffusion), reconnaissance vocale (Whisper), traduction.
  • AI Gateway : gestion unifiée de la mise en cache, de la limitation du débit, du repli et des journaux pour les API IA. Les requêtes de modèle vérifient d'abord le cache → se replient automatiquement après un échec → file d'attente lorsque le quota est dépassé, réduisant ainsi les coûts de l'API de 30 à 50 %.
  • Déploiement de modèle personnalisé : téléchargez un adaptateur personnalisé via le réglage fin de LoRA ou déployez vos propres fichiers de modèle pour exécuter une inférence privée sur les nœuds périphériques.
  • Base de données vectorielles Vectorize : une base de données vectorielles Edge profondément intégrée à Workers AI, prenant en charge le stockage intégré et la recherche de similarité pour la construction d'applications RAG.
  • Streaming Streaming Response : prend en charge nativement l'inférence de streaming SSE, renvoie les résultats jeton par jeton et les utilisateurs n'ont pas besoin d'attendre la génération complète.

Evolution du modèle et de la version

Mises à jour itératives continues, la dernière version introduit une optimisation des performances et de nouvelles fonctionnalités. Les informations sur la version historique peuvent être consultées sur la page de version officielle. Il n’existe pas encore de calendrier complet d’évolution de la version publique. Il est recommandé de prêter attention à l'annonce officielle pour comprendre le rythme des mises à jour des fonctionnalités.

Avantages techniques

  • Optimisation de l'algorithme : une optimisation spéciale au niveau du modèle ou de l'algorithme a été réalisée pour le scénario correspondant afin d'atteindre un équilibre entre vitesse de réponse et qualité des résultats.
  • Architecture à faible latence : adopte une architecture de traitement en continu ou asynchrone pour réduire le temps d'attente des utilisateurs et convient aux scénarios d'interaction à haute fréquence.

Comment utiliser

  • Client Web : Vous pouvez l'utiliser en visitant le site officiel et en créant un compte. La plupart des fonctions ne nécessitent pas d'installation.
  • Accès API : fournit une API RESTful, les développeurs peuvent obtenir la clé API et l'intégrer dans leurs propres applications.

Prix des produits

Workers AI est facturé en fonction du temps d'inférence et du type de modèle, en utilisant un modèle de paiement à l'utilisation.

Catégories de modèles Tarifs
Génération de texte LLM 0,001-0,003 $/temps d'inférence (selon la taille du modèle)
Génération d'intégration 0,0005 $/mille fois
Génération d'images 0,003-0,005 $/image
Reconnaissance vocale 0,002 $/minute Audio
Demandes des travailleurs Forfait gratuit : 100 000 requêtes/jour, y compris les appels IA

Par rapport aux clusters d'inférence GPU auto-construits, Workers AI présente des avantages évidents en termes de coûts dans les scénarios de trafic faible à moyen, mais les appels de grands modèles à haute fréquence peuvent dépasser la solution GPU auto-construite. Le plan Workers Free est entièrement gratuit pour les petits projets et le développement de prototypes avec son quota de 100 000 demandes/jour.

Scénarios d'application

  • Service client IA en temps réel : Workers AI exécute l'inférence LLM sur les nœuds périphériques du monde entier, les demandes des utilisateurs sont traitées au nœud le plus proche et le délai du premier mot (TTFT) peut être contrôlé en 500 ms, ce qui est bien inférieur aux 2-3 secondes des services cloud centraux.
  • Questions et réponses sur la base de connaissances RAG : Le modèle d'intégration de Workers AI + la base de données vectorielles Vectorize implémente les applications RAG de pointe - questions des utilisateurs → vectorisation → récupération de documents similaires → LLM génère des réponses, l'ensemble du processus est terminé en périphérie.
  • Passerelle de traduction multilingue : combinée à la fonction de routage Workers, les requêtes Web passent automatiquement par la couche de traduction IA et le contenu de la réponse est traduit dans la langue préférée de l'utilisateur en temps réel sans modifications back-end.
  • Audit de contenu et filtrage de sécurité : avant que la requête n'entre sur le site d'origine, Workers AI exécute le modèle d'audit de contenu (texte/image), intercepte automatiquement le contenu illégal et coopère avec Cloudflare WAF pour obtenir une protection multicouche.
  • Génération et traitement d'images : exécutez Stable Diffusion sur les nœuds périphériques pour générer des images de produits, des créations publicitaires ou des avatars personnalisés, combinés à la mise en cache des Workers pour réduire les raisonnements répétés.

Personnes concernées

  • Utilisateurs individuels : créateurs de contenu et travailleurs du savoir qui ont besoin de l'aide de l'IA pour améliorer leur efficacité au travail quotidien.
  • Développeurs : équipes techniques qui doivent intégrer des fonctionnalités d'IA dans leurs propres produits ou services via des API.
  • Entreprise : organisations cherchant à déployer l'IA à grande échelle dans leur domaine.

Résumé et Outlook

La principale compétitivité de Cloudflare Workers AI réside dans "infrastructure distribuée mondiale + expérience d'exploitation et de maintenance sans serveur" - elle permet aux développeurs indépendants d'exécuter l'inférence d'IA à la périphérie mondiale sans nécessiter un budget GPU de plusieurs millions. L'intégration profonde avec le réseau Cloudflare (file d'attente des files d'attente de stockage de la base de données D1 R2) rend sa synergie significative lors de la création d'applications d'IA full-stack.

Limite inappropriée : la formation et le réglage fin (uniquement le déploiement d'inférence) ne sont pas pris en charge ; la sélection de modèles est limitée aux modèles open source, et les modèles fermés tels que GPT-4 et Claude ne peuvent pas être utilisés pour s'exécuter de manière native (ils doivent être transmis via AI Gateway). Risque d'approvisionnement : l'architecture V8 Isolate peut déclencher des limites de délai d'attente du processeur (30 secondes par défaut) lors de l'exécution d'une inférence pendant de longues périodes ; les instances GPU dédiées peuvent connaître des retards de démarrage à froid dans les scénarios de concurrence élevée. Il est recommandé aux entreprises sensibles aux délais d'utiliser d'abord PoC pour vérifier les performances réelles avant de décider de migrer complètement.

Outils associés : github-copilot, cursor

Informations de version

  • Travailleurs IA été 2026 :Ajout de la prise en charge du modèle de la série Llama 4, du raisonnement parole-texte en temps réel AI Gateway 2.0 (mise en cache + repli + limite de débit) et de la fonction de téléchargement de modèle personnalisé (réglage précis LoRA).
  • Travailleurs IA automne 2025 :Lancement de l'interface de gestion unifiée AI Gateway, prise en charge de la restauration multi-fournisseurs (Workers AI → OpenAI → Anthropic) et introduction d'une base de données vectorielles accélérée par GPU.
  • Travailleurs AI GA :Workers AI est officiellement publié en tant que GA, prenant en charge les modèles open source grand public tels que Mistral, Llama et Stable Diffusion, et est facturé en fonction du temps d'inférence.

Avis des utilisateurs

  • Chargement des avis...