Hy3 (Tencent Hunyuan 3) Gratuit

-

Hy3 (Tencent Hunyuan 3) est le grand modèle de langage expert hybride (MoE) de troisième génération lancé par l'équipe de Tencent Hunyuan. Il a un paramètre total de 295B, un paramètre d'activation de 21B, 192 routes expertes Top-8, 256K fenêtres contextuelles et une licence open source Apache 2.0. Il atteint 74,4% sur SWE-bench Verified et 90,4% sur GPQA Diamond. Il dispose de puissantes capacités de génération de code, d'appel d'outils et d'agent, et a été appliqué à plus de 50 produits internes de Tencent.

Hy3 (Tencent Hunyuan 3) Interface du produit

Hy3 (Tencent Hunyuan 3) : Le benchmark des capacités d'agent et de code du grand modèle open source MoE

Paramètres de base et statistiques de Hy3

Hy3 (Hunyuan 3) est le grand modèle linguistique Mixture-of-Experts (MoE) de troisième génération lancé par l'équipe Hunyuan de Tencent. Il s’agit également du modèle de base le plus solide et le plus ouvert de Tencent à ce jour. Par rapport à la génération précédente Hy2, Hy3 a réalisé des améliorations intergénérationnelles en termes d'ampleur des paramètres, d'échelle d'expert, de longueur de contexte et de capacités de raisonnement. Il est entièrement open source sous licence Apache 2.0 et n’a aucune restriction géographique.

Projet Spécifications
Nom du produit Hy3 (Hunyuan 3 / Tencent Hunyuan troisième génération)
Type de produit Grand modèle de base (MoE)
Paramètres totaux 295B (299B incluant la couche MTP)
Paramètres d'activation 21B
Paramètres de la couche MTP 3,8B
Nombre d'experts 192 experts, routage Top-8
Nombre de couches réseau 80 couches (hors MTP)
Têtes d'attention 64 (GQA, têtes 8 KV, dim tête 128)
Dimension de couche cachée 4096
Dimension de la couche intermédiaire 13312
Fenêtre contextuelle 256 000 jetons
Taille du vocabulaire 120 832
Précision du support BF16/FP8
Contrat de licence Apache2.0
Formulaire de livraison Poids open source (HuggingFace / ModelScope) + API (OpenRouter et autres tiers)
Accueil CN (Tencent)
Langues prises en charge Chinois, Anglais
Date de sortie Aperçu : 2026-04-23 ; Complet : 2026-07-06

Hy3 ne se positionne pas comme un modèle général omniscient et omnipotent, mais « recherche plutôt la plus haute qualité d'inférence dans le cadre d'un budget de paramètres spécifique ». Les paramètres d'activation 21B ne nécessitent qu'environ 4,2 % du réseau pour participer au calcul (8/192 experts) lors de l'exécution de l'inférence, ce qui rend son coût de déploiement bien inférieur à celui des modèles denses de même niveau d'intelligence. La fenêtre contextuelle de 256 Ko peut traiter environ 384 pages de documents A4 à la fois, ce qui convient à l'analyse de documents longs et à la compréhension de la base de code inter-fichiers.

Signification réelle de l'amélioration de l'efficacité : Par rapport à d'autres modèles avec des paramètres d'activation 21B et 100B+, Hy3 présente un avantage naturel en termes de débit d'inférence. Lorsqu'il est déployé avec vLLM ou SGLang, l'utilisation de la mémoire et le délai de génération de jetons d'une seule inférence sont inférieurs à ceux des modèles denses du même niveau d'intelligence. Pour les appelants d’API à haute fréquence, cela se reflète directement dans la baisse des prix unitaires des jetons et dans la latence du traitement par lots.

Conception du mode de raisonnement : prend en charge trois niveaux de contrôle reasoning_effort - no_think (mode simple, adapté aux tâches déterministes telles que la traduction et le résumé), low (pensée légère, adaptée aux questions et réponses régulières), high (raisonnement en chaîne profonde, adapté aux preuves mathématiques, à la programmation de compétitions, à la planification complexe d'agents). Lorsque le mode « élevé » est sélectionné, la quantité de jetons émise augmentera de 3 à 8 fois et le coût d'un seul appel augmentera en conséquence.

Utilisateurs et reconnaissance du marché de Hy3

La reconnaissance de Hy3 sur le marché montre un modèle à deux roues motrices de « vérification interne de la production de Tencent + réputation de la communauté open source ».

Échelle de production interne : Hy3 a été intégré dans plus de 50 gammes de produits internes de Tencent avant sa sortie officielle, couvrant des activités principales telles que WeChat, QQ, Tencent Cloud et les plateformes de jeux. Ce niveau de déploiement interne signifie que le modèle a été testé sur un trafic réel et une logique métier complexe, notamment la stabilité des dialogues multi-tours, le contrôle de l'atténuation du contexte long, le mixage multilingue et d'autres défis d'ingénierie qui ont été peaufinés dans l'environnement de production.

Réponse de la communauté open source : en juillet 2026, l'entrepôt « Tencent-Hunyuan/Hy3 » sur GitHub a reçu plus de 530 étoiles, plus de 120 fourchettes, et les téléchargements mensuels de poids de modèles sur HuggingFace dépassent 14 000 fois. La communauté autour de Hy3 a produit plus de 10 variantes affinées et plus de 65 versions quantifiées (prenant en charge des chaînes d'outils telles que lama.cpp, LM Studio, Jan, etc.), et 15 espaces HuggingFace offrent des entrées d'expérience en ligne.

Performances d'évaluation tierce : selon l'indice d'intelligence d'Artificial Analysis, Hy3 s'est classé 8e parmi les modèles open source à très grande échelle de paramètres avec un score de 41 (un total de 97 comparaisons de modèles), nettement supérieur à la médiane de la catégorie de 25 points. Les principaux scores de référence comprennent :

  • GPQA Diamond : 90,4 % (raisonnement de connaissances, niveau supérieur du modèle open source)
  • SWE-bench Verified : 78 % (taux réel de résolution des tâches de codage)
  • SWE-bench Pro : 57,9 % (tâches d'ingénierie complexes)
  • Dernier examen de l'humanité : 53,2 % (défi de connaissances globales)
  • Deep-SWE : 28 % (réparation de code indépendante)
  • Agents Apex : 25,6 % (tâches d'agent)
  • LHTB (tâche terminale longue durée) : 28,8% (tâche Agent longue durée)

Évaluation par des experts en aveugle : Tencent a mené conjointement un test en aveugle avec 270 experts du secteur. Hy3 a reçu une note globale de 2,67/4, dépassant la note de 2,51/4 de GLM-5.1. Les plus grands avantages se concentrent sur le développement front-end, le stockage de données et les tâches CI/CD. Ce résultat reflète mieux l’utilité du modèle dans des scénarios réels qu’un seul benchmark.

Avantages de coût de Hy3

La structure de coûts de Hy3 se compose de trois couches : « Apache 2.0 open source sans frais de licence + faible efficacité de raisonnement des paramètres d'activation + prix bas de l'API tierce ». Il s’agit actuellement de l’un des grands modèles open source les plus rentables.

Client C/utilisateurs individuels : téléchargez directement les poids des modèles via HuggingFace (tencent/Hy3), entièrement gratuitement. Les développeurs individuels peuvent exécuter l'inférence sur leur propre matériel sans payer de frais de licence ou d'API. Cependant, vous devez supporter vous-même le coût de la puissance de calcul du GPU : pour exécuter une inférence Hy3 pleine précision avec 8 × H20-80G ou une configuration équivalente, un seul investissement matériel est de l'ordre de dizaines à centaines de milliers de yuans. Pour des scénarios d’utilisation occasionnelle, il est plus économique de payer au fur et à mesure pour les API tierces.

Appel développeur/API (en prenant OpenRouter comme exemple) :

Éléments de facturation Prix ​​(USD/million de jetons) Référence de comparaison
Entrée (accès au cache) 0,035$ (-75% de réduction) Claude Sonnet 5 : 3 $/M
Entrée (standard) 0,14 $ GPT-5.6 : ~15 $/M
Sortie 0,58 $ Grok 4.5 : 6 $/M
Prix ​​mixte (ratio 7:2:1) Env. 0,11 $ Flash DeepSeek V4 : env. 0,08 $

Le prix de l’API de Hy3 est d’environ 1/10 à 1/50 de celui des modèles fermés de niveaux d’intelligence similaires. Pour une application légère qui traite 1 million d'entrées de jetons et 500 000 sorties de jetons par jour, le coût mensuel est d'environ (0,14 $ × 30 + 0,58 $ × 15) = 12,9 $/mois, ce qui est presque négligeable.

Déploiement en entreprise/privé : le poids open source est gratuit (Apache 2.0), mais le coût de l'infrastructure - en prenant un serveur 8 × H20-80G comme référence, le coût de location mensuel d'une seule unité est d'environ 8 000 à 12 000 $ (le fabricant d'Evian et la durée du contrat fluctuent), ce qui peut prendre en charge une inférence Hy3 modérément simultanée. Le coût total de l'entreprise doit être évalué sur la base du modèle « frais annuels de l'API par rapport au coût total de possession privé sur trois ans », et les coûts cachés de la main-d'œuvre d'exploitation et de maintenance, des mises à jour itératives des versions du modèle et du déploiement quantitatif (le FP8 réduit encore les besoins en mémoire vidéo) doivent être inclus.

Conseils d'achat : la tarification de l'API est basée sur la page en temps réel de chaque fournisseur de services. Il existe des différences de prix selon les régions (comme la Chine continentale et l'étranger). La configuration matérielle recommandée et les indicateurs de performances pour le déploiement privé sont basés sur le chapitre Déploiement du référentiel GitHub.

Principales fonctions de Hy3

La conception fonctionnelle de Hy3 est centrée sur les quatre lignes de capacités principales de « Génération de code + Appel d'outil d'agent + Raisonnement profond + Contexte long ».

  • Génération de code et tâches d'ingénierie : couvrant la génération, l'achèvement, la refactorisation, le diagnostic de bogues et la génération de tests unitaires de code pour les langages courants tels que Python, JavaScript/TypeScript, Java et Go. Un taux de solution de 78 % sur SWE-bench Verified signifie que le modèle est capable de comprendre les descriptions réelles des problèmes GitHub, de localiser les fichiers de code pertinents et de proposer des correctifs fusionnables. Conseils de mise en œuvre : Pour les tâches d'ingénierie complexes, il est recommandé d'activer le mode reasoning_effort=high. En mode direct, le traitement des conditions aux limites peut être manqué.

  • Agent Tool Calling (Function Calling) : la capacité d'appel d'outils de Hy3 est le point fort de cette mise à niveau. Le modèle prend en charge de manière native plusieurs séries d'appels d'outils, la récupération d'erreurs et la généralisation du framework multi-agents : la précision vérifiée par le banc SWE fluctue dans les 4 % selon différents échafaudages (CodeBuddy, Cline, KiloCode). Liste ouverte des outils : prend en charge les comportements d'outils standard tels que « naviguer » (navigation dans une page Web), « cliquer » (élément de clic), « type/saisie » (saisie de texte), « capture d'écran » (capture d'écran de page), « extraire » (extraction d'informations), « attendre » (conditions d'attente), « lire_fichier »/« écrire_fichier » (lecture et écriture de fichiers), « exécuter_commande » (exécution de commande), « terminer » (rapport de fin de tâche). Lien d'architecture : LLM (Hy3) → Serveur API/MCP → Environnement d'exécution d'outils → L'observation renvoie LLM, formant une boucle fermée interactive de « Planification → Exécution → Observation → Ajustement ».

  • Raisonnement profond et chaîne de pensée : prend en charge le raisonnement en chaîne de pensée réglable. Atteindre le plus haut niveau des modèles open source dans la réponse aux questions de connaissances (GPQA Diamond 90,4 %) et les tâches de raisonnement complexes (Humanity's Last Exam 53,2 %). Des examens internes montrent que le taux d’hallucinations de Hy3 est passé de 12,5 % dans Hy3 Preview à 5,4 %, et son taux d’erreur de bon sens est passé de 25,4 % à 12,7 %, une amélioration significative de l’exactitude factuelle et de la cohérence logique.

  • Compréhension du contexte long (256 000 jetons) : peut traiter environ 384 pages de contenu texte à la fois, adapté à des scénarios tels que la révision d'ensembles de contrats juridiques, l'analyse globale de grandes bases de code, la compréhension de l'historique des conversations longues, etc. Grâce à l'optimisation conjointe de SFT et RL, le taux de résolution référentielle, de récupération d'omission et de problèmes d'héritage de contraintes dans les conversations à plusieurs tours est réduit de 17,4 % à 7,9 %. Conseils de mise en œuvre : la latence d'inférence et la surcharge du cache KV augmenteront considérablement dans les scénarios à contexte long. Il est recommandé d'activer le contexte complet dans les tâches qui nécessitent réellement une corrélation entre les chapitres et de contrôler les tâches quotidiennes dans la limite de 32 000 pour équilibrer les coûts.

  • Extension multimodale : le cœur de Hy3 est un modèle de texte, mais il peut être étendu à la compréhension d'images et de textes via le pipeline de modèles de langage visuel de Tencent. Le mode visuel natif pondéré Hy3 n’est pas pris en charge et les scènes en texte brut n’ont pas besoin de prêter attention à cette limitation.

  • Chaîne d'outils d'optimisation d'ingénierie : fournit un pipeline complet de réglage fin (Finetune) (basé sur vLLM/SGLang), une post-formation RL (GRPO via verl + Megatron-LM + déploiement vLLM) et des outils de quantification (AngelSlim prend en charge les algorithmes de quantification courants, la quantification à bits faibles et l'échantillonnage spéculatif). Les développeurs peuvent créer des modèles verticaux spécifiques à un domaine basés sur des pondérations Hy3.

Evolution du modèle et de la version Hy3

L'itération de la version Hy3 suit le rythme de « Vérification de l'aperçu → Collecte des commentaires → Optimisation de la version complète ».

Version principale

  • Hy2 (~2025-12) : modèle Hunyuan de deuxième génération, le banc SWE représente environ 53,0 %, établissant une base de référence pour la mise à niveau de l'architecture MoE de Hy3. Il n’y a pas encore de date de sortie officielle précise.
  • Hy3 Preview (2026-04-23) : Le premier lot de modèles de formation sur la nouvelle infrastructure, utilisant pour la première fois l'architecture 295B MoE (activation 21B) et 192 routages experts Top-8. SWE-bench Verified a atteint 74,4%, attirant l'attention de la communauté des développeurs. Après la sortie, Tencent a collecté plus de 50 commentaires internes sur l'utilisation des produits.
  • Hy3 Full (06/07/2026) : optimisation post-formation à grande échelle basée sur les commentaires de l'aperçu. Les principales améliorations comprennent :
    • La stabilité des appels d'outils et les capacités de récupération d'erreur ont été considérablement améliorées
    • Taux d'illusion réduit de 12,5% à 5,4%, taux d'erreur de bon sens réduit de 25,4% à 12,7%
    • Taux de problèmes de suivi des intentions de conversation à plusieurs tours réduit de 17,4 % à 7,9 %
    • Le résultat est plus concis tout en empêchant les intentions complexes de se dégrader lors d'interactions à longue distance
    • Sortie simultanée de la version quantitative FP8 (Hy3-FP8) pour abaisser le seuil de déploiement

Vérification des candidats

  • Hy3-FP8 (sorti le même jour que Full) : Une version quantifiée de FP8 qui fonctionne avec la chaîne d'outils AngelSlim, ce qui réduit considérablement les besoins en mémoire graphique tout en conservant la qualité de l'inférence, permettant à davantage de développeurs d'exécuter Hy3 sur un matériel limité.

Notes de version : la politique open source de Hy3 est publiée sous la licence Apache 2.0, sans conditions supplémentaires ni restrictions géographiques. Les poids de l'ancienne version (Hy2) ont également été rendus publics via la page de l'organisation Tencent HuggingFace. Les plans d'itération des versions ultérieures sont soumis aux informations publiées par l'entrepôt GitHub et le compte Twitter/X officiel.

Avantages techniques de Hy3

Le choix de l'itinéraire technique de Hy3 reflète l'accumulation d'ingénierie de Tencent pour « maximiser la qualité du raisonnement avec un budget de puissance de calcul limité ».

Architecture MoE et routage de 192 experts Top-8 : Le MoE de Hy3 n'augmente pas simplement le nombre d'experts, mais déploie 192 sous-réseaux experts par couche dans le Transformer à 80 couches, et seulement 8 d'entre eux sont activés par jeton (taux d'activation d'environ 4,2 %). Cela signifie que seuls 21B des 295B paramètres participent à chaque étape du raisonnement, stockant des connaissances approfondies tout en contrôlant la quantité de calculs de raisonnement. Différents jetons seront acheminés vers différents experts : les jetons de code ont tendance à activer les experts en expertise de code, et les jetons en langage naturel activent les experts en expertise linguistique, formant une partition de tâches implicite.

Couche MTP (couche de prédiction multi-tâches) : la couche MTP partagée de 3,8 B coordonne la sortie de différents experts, garantissant que même si différents jetons sont traités par différents experts, la séquence globale maintient la cohérence sémantique. Il s’agit du mécanisme clé permettant à Hy3 de maintenir une sortie stable dans un raisonnement complexe en plusieurs étapes.

Effort de raisonnement : le modèle peut être ajusté dynamiquement entre "vitesse" et "profondeur" via le paramètre reasoning_effort. En mode « no_think », le modèle produit directement des réponses, ce qui convient aux scénarios sensibles aux délais ; en mode « élevé », le modèle développe un raisonnement en chaîne complet. Cette conception permet d'ajuster de manière adaptative les mêmes pondérations de modèle sous différents budgets de retard sans qu'il soit nécessaire de déployer plusieurs versions.

Pipeline post-formation (SFT + RL) : le pipeline d'apprentissage par renforcement SFT et GRPO de Hy3 fonctionne sur le framework verl + Megatron-LM, prenant en charge la formation distribuée à grande échelle. L'amélioration de la qualité et de la diversité des données post-formation est la principale raison du saut de qualité de la version Hy3 Preview à la version complète. L'évaluation interne montre que l'effet d'optimisation conjoint sur le taux d'hallucinations, les erreurs de bon sens et la cohérence sur plusieurs tours est significatif.

Stabilité des appels d'outils de qualité production : Hy3 résout plusieurs problèmes de fiabilité de base pour amener les appels d'outils aux normes de qualité de production sous différentes configurations et contraintes de sortie. La variance de la précision vérifiée du modèle par le banc SWE sur différents frameworks d'agents (CodeBuddy, Cline, KiloCode) reste inférieure à 4 %, ce qui indique que la capacité d'appel de l'outil n'est pas liée à une implémentation de framework spécifique.

Adaptation du déploiement technique : Hy3 propose des solutions d'adaptation officielles sur les deux principaux moteurs d'inférence vLLM et SGLang, prenant en charge l'accélération du décodage spéculatif MTP. Il est recommandé d'utiliser un GPU de mémoire 8 × H20-80G ou supérieur pendant le déploiement. La version quantifiée FP8 peut réduire davantage les besoins en mémoire. L'outil de quantification AngelSlim est open source par Tencent et prend en charge les algorithmes de quantification courants et la quantification à bits faibles.

Référence de performances et de débit : selon les mesures réelles par analyse artificielle, la vitesse de sortie médiane de Hy3 sur l'API tierce est d'environ 60,3 jetons/s (inférieure à la médiane de la catégorie de 64,2, mais l'écart n'est pas grand), et le TTFT médian (délai du premier mot) est d'environ 2,65 secondes (légèrement supérieur à la médiane de la catégorie de 1,83 secondes). Les valeurs spécifiques varient en fonction du matériel de déploiement, de la méthode de quantification et de la concurrence, et sont soumises à des tests réels.

Limites d'adaptation et contraintes de scène de Hy3

Best in : génération de code et tâches d'agent, raisonnement mathématique et questions et réponses de connaissances, traitement bilingue chinois/anglais, appel d'outils et planification en plusieurs étapes.

Pas bon dans : la finesse du style des documents en anglais est légèrement inférieure à celle des modèles de formation en anglais pur ; la familiarité avec les cadres et outils occidentaux à longue traîne n’est pas aussi bonne que celle des modèles plus matures sur le plan écologique tels que DeepSeek ; la modalité visuelle n'est pas prise en charge (modèle textuel pur) ; le délai de raisonnement augmente considérablement dans un scénario de contexte ultra-long (proche de la limite de 256 Ko).

Comparaison avec des produits concurrents :

Comparaison Hy3 DeepSeek V4 Pro GLM-5.2 Claude Sonnet 5
Paramètres totaux 295B 1.6T À propos du 744B Non divulgué
Paramètres d'activation 21B À propos de 49B Environ 100B+ Non divulgué
Contexte 256 Ko 1M ~256K ~200 000
Licence Apache2.0 MIT MIT Source fermée
Prix ​​d'entrée API 0,14 $/M 1-3 ¥/M 0,5-1 $/M 3 $/M
Banc SWE 78% environ 75% environ 62% environ 70%

Le principal avantage de Hy3 est d’obtenir les performances les plus élevées du banc SWE avec les plus petits paramètres d’activation et la licence entièrement ouverte d’Apache 2.0. L'inconvénient est que la maturité écologique n'est pas aussi bonne que DeepSeek et que la scène contextuelle ultra-large 1M n'a pas encore été couverte.

Comment utiliser Hy3

Hy3 propose deux modes d'utilisation : « auto-hébergement open source + API tierce », couvrant tous les scénarios, des expériences personnelles au déploiement au niveau de l'entreprise.

Comment utiliser Convient aux personnes Caractéristiques Coût
API tierce (OpenRouter, etc.) Développeurs, petites équipes Prêt à l'emploi, aucun GPU requis Paiement à l'utilisation (0,14 $/0,58 $ par jeton M)
Auto-hébergement (vLLM) Entreprise, équipe technique Les données ne quittent pas le domaine, contrôle total Coût de calcul GPU
Auto-hébergé (SGLang) Entreprise, équipe technique Adaptation officielle, accélération MTP Coût de la puissance de calcul du GPU
Téléchargement du poids HuggingFace Chercheurs, développeurs de modèles Mise au point/quantification/développement secondaire Gratuit (vous devez apporter votre propre matériel)

Démarrage rapide de l'API (OpenRouter compatible avec le SDK OpenAI) :

depuis openai importer OpenAI

client = OpenAI (
    base_url="https://openrouter.ai/api/v1",
    api_key="<VOTRE_API_KEY>",
)

réponse = client.chat.completions.create(
    modèle="tencent/hy3",
    message=[
        {"role": "user", "content": "Utilisez Python pour implémenter un calcul de séquence de Fibonacci en cache."}
    ],
    température = 0,9,
    top_p=1.0,
    extra_body={
        "chat_template_kwargs": {"reasoning_effort": "élevé"}
    }
)
imprimer(response.choices[0].message.content)

Description du paramètre clé : il est recommandé que "température" soit de 0,9, "top_p" soit de 1,0 ; reasoning_effort est facultatif no_think (directement), low (pensée légère), high (raisonnement profond). Il est recommandé d'utiliser le mode « élevé » pour le code et les scénarios de raisonnement complexes.

Auto-hébergé - Déploiement vLLM (8 GPU recommandés) :

# Besoin de compiler et d'installer vLLM en premier (en fonction du code source)
export VLLM_FLASHINFER_ALLREDUCE_BACKEND=trtllm
vllm sert tencent/Hy3 \
  --tensor-parallel-size 8 \
  --speculative-config.method mtp \
  --speculative-config.num_speculative_tokens 2 \
  --tool-call-parser hy_v3 \
  --reasoning-parser hy_v3 \
  --enable-auto-tool-choice \
  --port 8000 \
  --served-model-name hy3

Auto-hébergé - Déploiement SGLang :

python3 -m sglang.launch_server \
  --modèle tencent/Hy3 \
  --tp-taille 8 \
  --tool-call-parser hunyuan \
  --raisonnement-analyseur hunyuan \
  --speculative-num-steps 2 \
  --speculative-eagle-topk 1 \
  --speculative-num-draft-tokens 3 \
  --algorithme-spéculatif EAGLE \
  --port 8000 \
  --served-model-name hy3

Une fois le déploiement terminé, les services locaux peuvent être appelés via l'interface compatible OpenAI. Les documents de déploiement détaillés sont soumis au README du référentiel GitHub « Tencent-Hunyuan/Hy3 ».

Prix des produits pour Hy3

La tarification de Hy3 poursuit le modèle « open source sans poids + API tierce, paiement à l'utilisation ».

Poids open source : licence Apache 2.0, aucune restriction d'utilisation, aucune restriction géographique, aucun plafond d'utilisation commerciale. Les utilisateurs sont libres de le télécharger, de l'utiliser, de le modifier et de le redistribuer. Contrairement à la licence communautaire Llama de Meta, Hy3 ne nécessite pas de demande supplémentaire de licence commerciale.

Tarifs des API tierces : sur la base du prix médian sur OpenRouter, saisissez 0,14 $/million de jetons et produisez 0,58 $/million de jetons. 75 % de réduction sur les accès au cache (0,035 $/million de jetons). Les prix des différents fournisseurs de services (tels que Fireworks AI, Together AI, etc.) peuvent être légèrement différents et dépendent de la page en temps réel de chaque plateforme.

Coût de déploiement privé : Les poids sont gratuits, mais les coûts d'infrastructure sont à votre charge. Il est recommandé de configurer 8 × H20-80G ou un GPU équivalent, et le coût de location mensuel d'une seule unité est d'environ 8 000 à 12 000 $. La version quantitative FP8 (Hy3-FP8) peut supporter une concurrence plus élevée sur le même matériel, ou abaisser le seuil matériel à une seule carte A100-80G (scénarios expérimentaux uniquement).

Achat en volume pour entreprise : Tencent n'a pas divulgué les prix officiels de l'API d'hébergement pour Hy3. Pour les scénarios de trafic important, il est recommandé de contacter l'équipe Tencent via « [email protected] » pour obtenir des solutions commerciales, ou négocier des remises basées sur des contrats au niveau de l'entreprise sur des plateformes telles que OpenRouter.

Scénarios d'application Hy3

Les scénarios d'application de Hy3 couvrent quatre dimensions : le développement de logiciels, l'automatisation des agents, l'analyse à forte intensité de connaissances et l'amélioration de la productivité de l'entreprise.

  • Développement de logiciels (génération de code et tâches d'ingénierie) : il s'agit du scénario le plus fort pour Hy3. Couvre l'achèvement du code, la localisation et la réparation des bogues, la génération de tests unitaires, la révision du code, les suggestions de refactorisation, la rédaction de documents techniques, etc. Des performances vérifiées par SWE-bench de 78 % signifient que Hy3 est capable de comprendre les descriptions complexes des problèmes GitHub et de générer du code de correctif fusionnable. Conseils de mise en œuvre : Il est recommandé de l'utiliser conjointement avec des frameworks d'agents tels que CodeBuddy, Cline ou KiloCode pour exploiter pleinement ses capacités d'appel d'outils. Activez le mode reasoning_effort=high pour les tâches d'ingénierie complexes.

  • Agent IA et flux de travail automatisé : la stabilité des appels d'outils de Hy3 a été vérifiée par plus de 50 produits internes de Tencent. Convient à l'automatisation de pages Web (collecte d'informations, remplissage de formulaires), à la disposition de la chaîne d'outils en ligne de commande, au pipeline de traitement de données en plusieurs étapes et à d'autres scénarios. Lien architectural : LLM(Hy3) → Analyseur d'outils → Exécution de fonctions → Observation → Re-planification LLM. Guide des pièges de l'ingénierie :

    1. Contrôle de boucle infinie et de gonflage des jetons : limitez le nombre maximum de tours d'exécution via le paramètre max_steps (10 à 20 est recommandé) et définissez un délai d'attente en une seule étape, en conjonction avec la détection d'actions répétées (terminez lorsque la même observation est renvoyée pendant 3 étapes consécutives) pour empêcher le modèle de tourner au ralenti.
    2. Surcharge DOM/Context : pour les tâches de l'agent de page Web, il est recommandé de désactiver la livraison de captures d'écran et de renvoyer uniquement l'arborescence d'accessibilité ou le résumé DOM pour empêcher l'intégralité du document HTML de remplir la fenêtre contextuelle.
    3. Sécurité et gouvernance d'ultra-autorité : définissez un point de confirmation (Human-in-the-loop) pour les opérations irréversibles (suppression de fichiers, envoi de messages, paiement et publication) ou démarrez en mode lecture seule dans l'environnement d'exécution pour éviter les erreurs d'opération du modèle.
  • Questionnement des connaissances et analyse de documents : la performance de 90,4 % de GPQA Diamond montre que Hy3 est proche des modèles fermés de pointe sur les tâches à forte intensité de connaissances. Le contexte 256K le rend adapté à des scénarios tels que la révision de longs articles universitaires, la comparaison des termes de contrats juridiques et la synthèse de livres blancs techniques. Conseils de mise en œuvre : dans les scénarios d'analyse de documents, utilisez simplement le mode reasoning_effort=no_think ou low. Il n’est pas nécessaire d’activer un raisonnement approfondi, ce qui contribue à réduire la latence et la consommation de jetons.

  • Productivité d'entreprise (outils internes et systèmes RAG) : en combinant l'auto-hébergement pondéré open source et le cadre RAG (Retrieval Augmented Generation), les entreprises peuvent créer des systèmes de réponses aux questions de connaissances privées. La licence Apache 2.0 garantit que les données ne quittent pas l'infrastructure de l'entreprise et qu'il n'y a aucun risque de confidentialité lié aux appels d'API tiers. Conseils de mise en œuvre : Pour les scénarios de documents mixtes multilingues, il est recommandé de coopérer avec la recherche hybride (mot clé + récupération sémantique) et le mécanisme de reclassement pour améliorer la qualité du rappel. Hy3 lui-même ne fournit pas de RBAC au niveau du document et l'isolation des autorisations doit être implémentée au niveau de la couche de structure RAG.

Ne convient pas aux scénarios : rédaction de marque qui nécessite une créativité extrême (le style de sortie de Hy3 est plus orienté vers l'ingénierie et la richesse créative n'est pas aussi riche que celle de la série Claude) ; des scénarios sans codage qui nécessitent un style de document en anglais extrêmement élevé (comme le polissage de papiers académiques) ; scénarios qui nécessitent une entrée multimodale (comme la reconnaissance d’images, la compréhension vidéo).

Groupes applicables de Hy3

  • Développeurs et ingénieurs logiciels : public cible de Hy3. Qu'il s'agisse d'une assistance quotidienne au codage, d'un diagnostic de bugs, d'une révision de code ou de tâches d'ingénierie complexes, les performances de Hy3 de 78 % sur SWE-bench signifient qu'il peut devenir un partenaire de programmation fiable pour les développeurs. Ne convient pas aux limites : pour les équipes qui ont des exigences de qualité extrêmement élevées pour la génération de documents en anglais (tels que les documents en anglais pour les projets open source), il est recommandé d'utiliser des outils tels que Grammarly pour le polissage secondaire.

  • Développeurs d'agents IA et ingénieurs en automatisation : développeurs qui ont besoin de créer des flux de travail automatisés - de la collecte de données de pages Web à l'orchestration de la chaîne d'outils en ligne de commande, la stabilité des appels d'outils de Hy3 et les capacités de généralisation inter-framework en font un modèle de base idéal pour les systèmes d'agents. Prérequis : Vous devez configurer le framework d'agent (tel que Cline, CodeBuddy) et définir un budget d'étape raisonnable et une stratégie de point de confirmation.

  • Équipe Entreprise et Technologie (Déploiement privé) : Entreprises axées sur la souveraineté et la conformité des données. Les capacités de licence et d'auto-hébergement Apache 2.0 de Hy3 le rendent idéal pour l'infrastructure d'IA privatisée. Conditions préalables d'achat : les entreprises doivent disposer ou pouvoir louer un cluster GPU de niveau 8 × H20-80G et disposer des capacités d'exploitation et de maintenance correspondantes. Il est recommandé de vérifier le ROI en mode API avant de décider de passer ou non à l'auto-hébergement.

  • Chercheurs et développeurs de modèles en IA : des pondérations open source et un pipeline complet de réglage fin/RL font de Hy3 un excellent modèle de base pour la recherche et le développement secondaire. 192 experts L'architecture du MoE elle-même a également une valeur de recherche. Limite inadaptée : la configuration matérielle requise pour la reproduction expérimentale est élevée (le poids total est d'environ 600 Go de stockage + GPU multi-cartes).

À utiliser avec prudence : dans les scénarios d'interaction en temps réel extrêmement sensibles aux délais de réponse (tels que les réponses en temps réel du service client en ligne), le TTFT de Hy3 d'environ 2,65 secondes peut ne pas être idéal. Il est recommandé de choisir un petit modèle ou une version distillée spécialement optimisée pour le retard. Pour le traitement de documents extrêmement longs (proche de la limite de 256 Ko), il est recommandé de les soumettre par sections plutôt que de les saisir tous en même temps pour éviter le risque de débordement de la fenêtre contextuelle.

Résumé et Outlook

Hy3 représente un tournant important dans la voie open source de la Chine pour les grands modèles : Tencent a publié un modèle open source MoE sous la licence Apache 2.0 qui surpasse la plupart des modèles fermés sur le banc SWE sans aucune restriction géographique. Il ne s’agit pas seulement d’une réponse aux voies open source occidentales telles que Meta LLaMA et Mistral, mais aussi d’un choix stratégique : établir une influence écologique grâce à l’open source plutôt que de s’appuyer sur les revenus des API.

Principaux avantages actuels : l'architecture MoE avec seulement 21 B de paramètres activés sur 295B apporte d'excellentes performances en termes de coûts ; Les performances SWE-bench Verified 78 % et GPQA Diamond 90,4 % se situent au premier échelon parmi les modèles open source ; La licence Apache 2.0 élimine complètement les barrières juridiques à l'utilisation commerciale ; fiabilité technique vérifiée par plus de 50 produits internes Tencent.

Principales limitations actuelles : La maturité écologique est inférieure à DeepSeek et Qwen - les chaînes d'outils tierces, les tutoriels communautaires et les articles techniques chinois s'accumulent encore ; Le contexte ultra-large 1 M n'est pas encore pris en charge ; Les scénarios anglais non codés ne sont pas aussi sophistiqués que les modèles anglais purs ; bien que le seuil matériel de déploiement soit inférieur à celui du même modèle à forte densité d'intelligence, le 8 × H20-80G n'est toujours pas facilement abordable pour les petites et moyennes équipes.

Points d'observation de suivi : si Tencent étendra la série Hy3 aux domaines multimodaux (visuels, vocaux) ; si la communauté formera une variante de réglage suffisamment riche et une chaîne d'outils dédiée autour de Hy3 ; si Tencent lancera une API gérée officielle pour simplifier le processus d'accès de l'entreprise ; si la prochaine version (Hy3.5 ou Hy4) prendra en charge une fenêtre contextuelle plus grande et un budget de paramètres d'activation plus élevé.

Évaluation des risques d'approvisionnement et d'adoption : pour les développeurs individuels et les équipes entrepreneuriales, vous pouvez découvrir les fonctionnalités de base de Hy3 sans risque en payant au fur et à mesure via des API tierces telles que OpenRouter. Il est recommandé de l'intégrer dans votre chaîne d'outils de codage quotidienne pour les tests A/B. Pour les entreprises planifiant un déploiement privatisé, il est recommandé de déployer des essais dans des processus non critiques (tels que la révision du code interne, la génération de tests automatisés) pour vérifier la qualité du résultat du modèle et l'acceptation de l'équipe avant d'étendre les tâches d'agent au niveau de la production. Avant d'acheter, il est important de confirmer : si le modèle de GPU et la quantité de matériel déployé peuvent répondre à la charge cible (se référer aux données de performances officielles de vLLM/SGLang), la garantie de compatibilité ascendante des mises à jour des versions du modèle (il n'y a actuellement aucun engagement officiel) et si la licence Apache 2.0 couvre entièrement l'utilisation attendue de l'entreprise (comme la redistribution affinée du modèle). Dans les secteurs sensibles à la conformité (finances, soins de santé, affaires gouvernementales), il est recommandé d'effectuer une série complète de tests et d'audits par l'équipe rouge dans un environnement privatisé avant de passer en production.

Outils associés : ÉquipageAI, langchain

Informations de version

  • Hy3 :La version officiellement publiée est basée sur une optimisation post-formation à grande échelle après avoir collecté plus de 50 commentaires sur les produits de la version préliminaire, ce qui améliore considérablement les capacités de l'agent, la stabilité des appels d'outils et les capacités anti-hallucinations.
  • Aperçu Hy3 :La version préliminaire, le premier lot de modèles formés sur la nouvelle infrastructure, vérifie la faisabilité de l'architecture MoE 295B, SWE-bench vérifié à 74,4 %.
  • HY2 (énergie hu 2) :Le modèle hybride de deuxième génération, SWE-bench, représente environ 53,0 %, fournissant une base de référence pour la mise à niveau de l'architecture de Hy3. Il n’y a pas encore de date officielle précise.

Avis des utilisateurs

  • Chargement des avis...