Kimi K2
Kimi K2 est une grande série de modèles de langage MoE open source lancée par Moonshot AI. Il a un paramètre total de 1T et un paramètre d'activation de 32B. Il est spécialement conçu pour les scénarios d'agents tels que l'appel d'outils, la génération de code et la résolution de tâches autonomes. Il propose deux variantes, Base et Instruct, prend en charge le contexte 128K, atteint le niveau open source SOTA sur les benchmarks Agent tels que SWE-bench et Tau2-bench, et l'API est compatible avec l'interface OpenAI/Anthropic.
KimiK2
Paramètres et statistiques de base
Kimi K2 est une grande série de modèles de langage open source par Moonshot AI en juillet 2025. Elle adopte une architecture experte mixte (MoE) avec un volume total de paramètres de 1 000 milliards (1T) et seuls 32 B de paramètres sont activés par jeton. Il atteint le niveau de pointe de connaissance, de raisonnement et de programmation sur la voie du modèle non pensant, et sur cette base, il est profondément optimisé pour les tâches des agents - non seulement « répondre aux questions », mais aussi « exécuter des actions ».
| Éléments de paramètres | Kimi K2-Instruct / K2-Base | Kimi K2-0905 (version améliorée) | Kimi K2.6 (phare universel) |
|---|---|---|---|
| Architecture | MoE (Expertise Mixte) | Ministère de l'Environnement | Ministère de l'Environnement |
| Paramètres totaux | 1T | 1T | Non divulgué |
| Paramètres d'activation | 32B | 32B | Non divulgué |
| Nombre d'experts | 384 (choisissez 8 par jeton) | 384 | Non divulgué |
| Mécanisme d'attention | MLA (Attention Latente Multiple) | Député | Député |
| Fenêtre contextuelle | 128 000 jetons | 256 000 jetons | 256 000 jetons |
| Taille du vocabulaire | 160 000 | 160 000 | Non divulgué |
| Données de formation | Jetons 15,5T | — | — |
| Optimiseur | MuonClip (optimiseur de stabilisation auto-développé) | MuonClip | — |
| Entrée visuelle | Non pris en charge | Non pris en charge | Pris en charge (image + vidéo) |
| Raisonnement en chaîne de pensée | Non pris en charge (modèle sans réflexion) | Non pris en charge | Pris en charge (mode double réflexion/non-réflexion) |
| Licence Open Source | MIT modifié | MIT modifié | Pas Open Source (API uniquement) |
| Moteur d'inférence | vLLM / SGLang / KTransformers / TensorRT-LLM | Comme ci-dessus | Service API |
Interprétation des paramètres : Seuls 8 des 384 experts sont activés par jeton (+1 expert partagé). Cette conception très parcimonie (le taux d'activation est d'environ 2,3 %) est la principale raison pour laquelle Kimi K2 parvient à un raisonnement déployable avec des paramètres totaux de 1T. Par rapport à DeepSeek-V3 (671 milliards de paramètres au total/37 milliards d'activations), qui se trouve également sur la route MoE, K2 a des paramètres totaux 49 % plus grands, mais des paramètres d'activation 13 % plus petits, ce qui signifie qu'il a une quantité inférieure de calculs d'inférence dans les mêmes conditions matérielles.
Transition de contexte 128 Ko → 256 Ko : la version initiale prend en charge 128 Ko de jetons, et la version améliorée 0905 et la K2.6 ultérieure sont étendues à 256 Ko. Pour le contexte au niveau du référentiel de code, l'analyse de documents longs et plusieurs cycles de conversations d'agent, la fenêtre de 256 Ko peut couvrir un contexte plus complet et réduire les interruptions de planification causées par la troncature. Cependant, veuillez noter : après avoir doublé le contexte, la surcharge du cache KV augmente simultanément et la capacité de la mémoire vidéo doit être évaluée dans des scénarios d'auto-déploiement.
Différences de positionnement des modèles non pensants : La version initiale de K2 est positionnée comme un modèle non pensant de « niveau réflexe » (niveau de réflexion) - elle n'effectue pas de chaîne de pensée explicite, mais s'appuie sur un pré-entraînement et un apprentissage par renforcement pour internaliser les capacités dans des réponses intuitives. Cela rend la latence de raisonnement de K2 inférieure à celle des modèles de pensée contemporains (tels que DeepSeek-R1), mais le modèle de pensée présente toujours des avantages dans les tâches de raisonnement complexes qui nécessitent une expansion logique en plusieurs étapes. La version K2.6 suivante a ajouté la prise en charge du raisonnement en chaîne, comblant ainsi cette lacune.
Reconnaissance des utilisateurs et du marché du Kimi K2
L'influence de Kimi K2 sur le marché est particulièrement importante dans la communauté open source et l'écosystème des développeurs. Les utilisateurs finaux C entrent principalement en contact avec les modèles de la série K2 via le portail de discussion gratuit de kimi.com.
Popularité de la communauté Open Source : le référentiel GitHub « MoonshotAI/Kimi-K2 » a reçu plus de 11 000 étoiles et plus de 880 Forks, et 10 mainteneurs actifs continuent de contribuer. Il s’agit de l’un des entrepôts modèles bénéficiant de la plus grande attention de la part de la communauté parmi les projets open source des sociétés chinoises d’IA. La communauté a donné naissance à un grand nombre de projets écologiques autour de K2 (tels que kimi-writer, kimiflare, Kimi-K2.7 Swarm Workstation, etc.).
Adoption de l'API par les développeurs : la plate-forme API Kimi a servi des millions de développeurs professionnels et ses partenaires incluent Vercel, Cursor, Windsurf, TRAE, GenSpark, Xiaohongshu, Huawei, Coze, CodeBuddy et d'autres sociétés et outils de développement de premier plan. Surtout dans le domaine de la programmation IA, de nombreux plug-ins IDE bien connus (tels que Kilo Code, Cursor) intègrent la série K2 comme modèle sous-jacent. Tencent CodeBuddy intègre le modèle K2 Thinking pour aider les développeurs à résoudre des tâches de programmation complexes ; Genspark utilise la version K2 0905 pour piloter des agents autonomes sur sa plateforme Agent.
Vérification des clients de l'industrie : des cas publics montrent que K2 a été utilisé dans des domaines professionnels tels que la recherche financière (AlphaEngine FinGPT Agent), la science des matériaux (compréhension de la littérature chimique XtalPi), l'IA pour la science (DP Technology RxnBench Top 2), etc. Ces scénarios ont des exigences extrêmement élevées en matière de précision des appels d'outils et de fiabilité des contextes longs. La mise en œuvre de K2 dans ces scénarios verticaux montre que les capacités de ses agents ont atteint des niveaux de production.
Performance de référence : Surpassant tous les modèles open source au cours de la même période avec 65,8 % de réussite à 1 sur SWE-bench Verified (Agentic Coding) ; se classant premier en open source dans les trois sous-domaines de Tau2-bench (utilisation des outils), parmi lesquels le sous-élément télécoms arrive en deuxième position avec plus de 40 %. Dans l'évaluation Math & STEM, AIME 2024/2025, MATH-500, GPQA-Diamond et d'autres benchmarks ont atteint ou approché le niveau du modèle phare à source fermée (voir le tableau d'évaluation GitHub README). Il convient de noter que ces résultats ont été obtenus dans des conditions de modèle sans réflexion - il est prévu qu'il y ait encore place à l'amélioration après avoir rejoint la chaîne de réflexion (K2.6 et au-delà).
Avantage en termes de coût : la tarification à double voie Open Source + API couvre tous les scénarios
La structure des coûts de Kimi K2 est différente d'un modèle purement fermé ou d'un modèle purement open source. Il propose à la fois un « frais de licence d'auto-hébergement open source nul » et un « prix unitaire extrêmement bas d'API de paiement au volume », couvrant différents budgets et besoins de conformité des développeurs individuels aux grandes entreprises.
Côté : utilisation gratuite sur kimi.com : les utilisateurs ordinaires peuvent choisir gratuitement les modèles de la série K2 pour dialoguer sur kimi.com, sans limite de nombre de fois. Il s'agit de la stratégie principale de Dark Side of the Moon visant à attirer les utilisateurs finaux C : renforcer la notoriété de la marque grâce à une expérience gratuite, puis guider les développeurs et les entreprises dans l'utilisation d'API payantes. La version gratuite ne prend actuellement pas en charge les fonctions haut de gamme telles que l'appel d'outils MCP et la saisie visuelle.
Tarif API (niveau développeur) : le prix API de Kimi K2.6 se situe dans la fourchette faible à moyenne parmi les grands modèles grand public, et le coût marginal des entrées répétées est encore réduit grâce au mécanisme de mise en cache contextuelle.
| modèle | entrée (accès au cache) | entrée (manque de cache) | sortie | fenêtre contextuelle |
|---|---|---|---|---|
| Kimi K2.6 | 0,16 $/million de jetons | 0,95 $/million de jetons | 4,00 $/million de jetons | 256 Ko |
| Code Kimi K2.7 | 0,19 $/million de jetons | 0,95 $/million de jetons | 4,00 $/million de jetons | 256 Ko |
| Kimi K2.7 Code haute vitesse | 0,38 $/million de jetons | 1,90 $/million de jetons | 8,00 $/million de jetons | 256 Ko |
| Comparaison : DeepSeek-V4-Flash | ~0,14 $/million de jetons | ~0,14 $/million de jetons | ~0,28 $/million de jetons | 1M |
| Comparaison : GPT-4o | ~ 2,50 $/million de jetons | ~ 2,50 $/million de jetons | ~ 10,00 $/million de jetons | 128 Ko |
Déploiement en entreprise/privé : les poids K2 Base et Instruct sont open source sous la licence MIT modifiée. Les entreprises peuvent librement les télécharger, les héberger et les affiner sans payer de frais de licence. Les coûts cachés de l'auto-déploiement comprennent : le serveur GPU (recommandé à partir de 4 × A100-80G, plus pour une concurrence élevée), la main d'œuvre d'exploitation et de maintenance, la bande passante du réseau et le réglage du moteur d'inférence. Pour les secteurs ayant des exigences de souveraineté des données ou des besoins élevés en matière d’audit de conformité (finances, soins médicaux, affaires gouvernementales), l’auto-hébergement est la seule voie possible ; pour les petites et moyennes équipes, appeler directement des API est bien plus économique que l’auto-construction.
Considérations de coûts implicites : la version initiale de K2 ne prend pas en charge la saisie visuelle ni le raisonnement en chaîne de pensée. Si le scénario commercial nécessite un raisonnement multimodal ou complexe, vous devez passer à la version K2.6 ou supérieure. K2.6 n'est pas open source et ne peut être appelé que via des API, ce qui pose un « plafond de capacités » pour les équipes qui s'attendent à un auto-hébergement de bout en bout : un compromis doit être fait entre l'auto-hébergement (licence gratuite + capacités limitées) et l'API (paiement à l'utilisation + capacités complètes).
Principales caractéristiques de Kimi K2
L'ensemble des capacités de Kimi K2 s'articule autour des deux axes principaux « invocation d'outils » et « exécution de tâches autonomes ». C’est différent du modèle de chat traditionnel. La logique de base de son produit est de « laisser le modèle exploiter directement les outils et effectuer des tâches en boucle fermée ».
-
Appel d'outils/Appel de fonctions : la capacité de différenciation fondamentale de K2. Le modèle peut décider indépendamment quand appeler des outils externes, quels paramètres transmettre et comment analyser les résultats renvoyés. Prend en charge la définition de schéma d'outil compatible OpenAI/Anthropic, les développeurs n'ont qu'à transmettre le paramètre « tools » dans la requête pour l'activer. Applications typiques : requête météo, requête de base de données, appel API externe, exécution de code. Dans l'évaluation Tau2-bench, K2 est nettement en avance sur les autres modèles open source dans les trois domaines vente au détail/compagnie aérienne/télécommunications, démontrant sa capacité à contrôler des scénarios de combinaison d'outils complexes.
-
Agentic Coding : K2 est devenu le champion du modèle open source avec 65,8 % pass@1 (version unique, calculée sans test) sur SWE-bench Verified. Cela signifie que K2 peut comprendre les problèmes de GitHub, localiser les fichiers de code pertinents, générer des correctifs, exécuter des tests et apporter des corrections de manière itérative, le tout sans intervention humaine. Il atteint également 47,3 % pass@1 sur SWE-bench Multilingual, surpassant la plupart des modèles à code source fermé. Pour les développeurs, cela signifie que K2 peut servir de moteur sous-jacent pour les assistants de révision des relations publiques, l'automatisation de la correction des bogues et la refactorisation du code.
-
Planification et exécution autonomes des tâches : K2 peut accepter une description de tâche de haut niveau (telle que "Analyser l'impact du travail à distance sur le salaire en 2020-2025"), puis la décomposer de manière autonome en un plan en plusieurs étapes : charger des données → nettoyer → analyse statistique → visualiser → générer un rapport. La démo officielle de K2 montre l'exécution autonome d'un flux de travail complet de science des données dans 16 appels IPython, y compris l'exécution de code Python, la détection des erreurs, la correction de stratégies et la génération de rapports HTML interactifs.
-
Compréhension du contexte long (128K→256K) : basé sur le mécanisme MLA (attention latente multi-têtes), K2 maintient une faible surcharge de cache KV dans les scénarios de contexte long. Version initiale 128 Ko, version améliorée 0905 et versions ultérieures 256 Ko. Fenêtres contextuelles pour gérer des référentiels de code complets, des centaines de pages de documentation ou des dizaines de cycles d'historique de conversations d'agent. Dans la tâche de récupération de contexte long, le taux de rappel d'informations de stade intermédiaire et avancé de K2 est meilleur que celui des modèles de même échelle, ce qui est particulièrement critique pour son scénario d'agent - les agents doivent souvent revoir les premières instructions plus tard dans la conversation.
-
Ensemble d'outils écologiques API : la plateforme API Kimi intègre de riches outils officiels, notamment : Recherche Web (recherche sur Internet), Code-Runner (exécution de code Python), Excel (analyse de fichiers Excel/CSV), Mémoire (persistance de la mémoire de conversation), Fetch (extraction de contenu d'URL), Rethink (réorganisation d'idées), etc. Ces outils sont profondément intégrés aux modèles K2 et peuvent être utilisés immédiatement sans que les développeurs aient besoin de développer les leurs.
Evolution du modèle et de la version
Depuis que Kimi K2 a été open source pour la première fois en juillet 2025, il a été itéré en 4 nœuds de version majeurs avec un chemin clair : open source initial → Amélioration du codage agent → Produit phare général multimodal → Branche spécialisée de programmation.
Version principale
| Version | Date de sortie | Changements fondamentaux | Caractéristiques | Statut Open Source |
|---|---|---|---|---|
| K2-Base/K2-Instruire | 2025-07 (~2025-07-22) | Version Open Source initiale | 128 000 contexte, non-réflexion, appels d'outils | Open Source (MIT modifié) |
| K2-0905 | 2025-09-05 | Amélioration du codage agent | Le contexte est étendu à 256 Ko et le taux de réussite des tâches de programmation est amélioré | Open source (MIT modifié) |
| K2.6 | 2026-04 | Mise à niveau des capacités générales | Prise en charge de la saisie visuelle + texte, contexte 256K, raisonnement en chaîne de réflexion, ajout du mode double réflexion/non-réflexion | API uniquement |
| Code K2.7 / Code K2.7 haute vitesse | 2026-05 | Branche de spécialisation en programmation | Optimisation des tâches de programmation, version HighSpeed ~180 jetons/s, contexte 256K, raisonnement en chaîne de réflexion | API uniquement |
Interprétation du contexte de la version
Étape V1 (K2-Base/Instruct) : The Dark Side of the Moon a choisi d'ouvrir entièrement le modèle MoE du paramètre 1T sous la licence MIT modifiée. C’était à l’époque l’un des modèles open source avec le plus grand nombre de paramètres. La version Base est destinée aux chercheurs et aux équipes qui ont besoin d'un réglage approfondi, tandis que la version Instruct est destinée au dialogue général plug-and-play et aux scénarios d'agent. La version initiale était positionnée comme un « modèle non pensant » et était intentionnellement différenciée de la voie de raisonnement en chaîne dominante de l'époque.
Étape V2 (K2-0905) : version améliorée environ 1,5 mois plus tard, axée sur l'amélioration des capacités de codage agent et le doublement du contexte à 256 Ko. Cette version reflète l’orientation de Dark of the Moon vers la scène des développeurs – les performances de pointe sur le banc SWE prouvent l’efficacité de son approche technique.
Étape V3 (K2.6) : Il s'agit de la version clé de la transition de la série K2 du « modèle de texte pur sans réflexion » au « modèle de pensée multimodal ». Avec l’ajout de l’entrée visuelle, du raisonnement en chaîne de pensée et des modes doubles pensée/non-pensée, la couverture des capacités est considérablement élargie. Mais il s'agit également de la première version qui n'est pas open source, marquant la différenciation de la stratégie open source de Dark Side of the Moon : les capacités des modèles de base restent open source et les capacités de pointe sont commercialisées sous la forme d'API.
Étape V4 (code K2.7) : une branche profondément spécialisée pour la programmation de scénarios, fournissant une version à haut débit (180 jetons/s) qui cible directement les exigences du modèle sous-jacent des plug-ins IDE tels que Cursor et Windsurf. La famille Code complète la gamme universelle K2.6 : l'une garantit la qualité du code, l'autre couvre un large éventail d'applications.
Avantages techniques : pile technologique de MuonClip à Agentic RL à grande échelle
L'avantage technique de Kimi K2 ne réside pas dans une innovation unique, mais dans une percée technologique systématique complète, de l'optimiseur pré-entraînement à l'apprentissage par renforcement post-entraînement.
MuonClip Optimizer : résout le problème d'instabilité de l'entraînement Muon : L'optimiseur Muon est nettement meilleur que l'AdamW largement utilisé en termes d'efficacité des jetons, mais il est sujet à une explosion du logit de l'attention lors d'un entraînement à grande échelle, provoquant une interruption de l'entraînement. L'équipe Kimi K2 a proposé la technologie qk-clip : redimensionner directement le poids de projection de la requête/clé après la mise à jour de Muon pour contrôler l'échelle du logit d'attention à partir de la source. En introduisant un facteur adaptatif (seuil dynamique basé sur un logit maximum), MuonClip atteint zéro pic d'entraînement en pré-entraînement sur des jetons de 15,5T. L'implication technique derrière cela est que le coût et le risque de la formation MoE à grande échelle sont considérablement réduits, permettant à Dark Side of the Moon de former des modèles de paramètres 1T avec un budget bien inférieur à celui de ses pairs.
Conception MoE à haute parcimonie : 384 experts + 8 sélectionnés par jeton (+1 expert partagé), le taux d'activation n'est que d'environ 2,3 %. Une parcimonie élevée signifie que la quantité de calcul augmente de manière sublinéaire à mesure que le nombre total de paramètres augmente, et seuls 32 B de paramètres d'activation sont chargés dans la mémoire vidéo pendant l'inférence. Cela permet à une seule carte A100-80G d'exécuter l'inférence, abaissant ainsi le seuil matériel pour l'auto-déploiement.
Pipeline de synthèse de données agentiques à grande échelle : les capacités d'agent de K2 proviennent de deux innovations clés. Premièrement, un pipeline de synthèse de données automatisé inspiré d'ACEBench - fait évoluer systématiquement des milliers d'outils (y compris de véritables outils MCP et outils de synthèse) dans des centaines de domaines, génère des centaines d'agents dotés de divers outils et leur permet d'interagir avec les agents utilisateurs lors de plusieurs tours dans un environnement simulé. LLM Judge note et filtre les résultats d'interaction en fonction de rubriques pour produire des données de formation de haute qualité. Deuxièmement, un système général d'apprentissage par renforcement - fait la distinction entre les récompenses vérifiables (mathématiques, programmation de concours) et les récompenses non vérifiables (écriture, recherche), et adopte un mécanisme « d'autocritique » pour ces dernières : le modèle agit comme son propre critique et fournit un retour d'information évolutif basé sur des rubriques. Dans le même temps, le déploiement de récompenses vérifiables selon la politique met continuellement à jour les critiques, formant ainsi une boucle de rétroaction positive.
Conception de compatibilité API : L'API est compatible avec les formats d'interface d'OpenAI et d'Anthropic. Cela réduit les coûts de migration pour les développeurs : les applications existantes basées sur le SDK OpenAI peuvent passer à K2 en modifiant simplement la base_url et la clé API. La température de l'interface compatible Anthropic est cartographiée via real_temperature = request_temperature × 0.6 pour garantir la compatibilité avec les applications existantes.
Prise en charge de plusieurs moteurs d'inférence : les moteurs d'exécution recommandés incluent vLLM, SGLang, KTransformers et TensorRT-LLM, couvrant différentes exigences de performances, de la recherche universitaire au déploiement en production. vLLM et SGLang se concentrent sur l'optimisation du débit, KTransformers convient aux expériences sur une seule carte et TensorRT-LLM est utilisé pour l'optimisation d'inférence extrême.
Comment utiliser
Kimi K2 propose trois chemins d'utilisation, couvrant le niveau d'accès complet, des utilisateurs ordinaires aux développeurs.
| Comment utiliser | Entrée | Convient à la foule | Restrictions fondamentales |
|---|---|---|---|
| Chat Web | kimi.com | Utilisateurs ordinaires, expérimentateurs de produits | Les outils de saisie visuelle et MCP (version initiale) ne sont pas pris en charge ; connexion requise |
| Appel API | plateforme.kimi.ai | Développeur, intégration d'entreprise | Besoin d'enregistrer un compte et de créer une clé API ; facturation basée sur le volume |
| Déploiement auto-hébergé | GitHub + Visage câlin | Équipe de recherche, entreprise hautement conforme | Serveur GPU requis ; le moteur d'inférence doit être construit par vous-même |
Exemple d'accès rapide à l'API (Python, compatible avec OpenAI SDK) :
depuis openai importer OpenAI
client = OpenAI (
api_key="<VOTRE_API_KEY>",
base_url="https://api.moonshot.ai/v1"
)
réponse = client.chat.completions.create(
modèle="kimi-k2.6",
message=[
{"role": "system", "content": "Vous êtes Kimi, l'assistante IA créée par Dark Side of the Moon."},
{"role": "user", "content": "Écrire un algorithme de tri rapide en Python."}
],
température = 0,6,
max_tokens=2048,
flux=Faux
)
imprimer(response.choices[0].message.content)
Exemple d'API avec appels d'outils :
outils = [{
"type": "fonction",
"fonction": {
"name": "get_weather",
"description": "Obtenir les informations météorologiques actuelles de la ville spécifiée",
"paramètres": {
"type": "objet",
"obligatoire": ["ville"],
"propriétés": {
"city": {"type": "string", "description": "nom de la ville"}
}
}
}
}]
réponse = client.chat.completions.create(
modèle="kimi-k2.6",
messages=[{"role": "user", "content": "Quel temps fait-il à Pékin aujourd'hui ?"}],
outils=outils,
tool_choice="auto",
température=0,6
)
Déploiement auto-hébergé (exemple vLLM) :
# Installer vLLM (doit prendre en charge la version Kimi K2)
pip installer vllm
# Démarrez le service d'inférence (en prenant K2-Instruct comme exemple)
python -m vllm.entrypoints.openai.api_server \
--model moonshotai/Kimi-K2-Instruct \
--tensor-parallel-size 4 \
--max-model-len 131072 \
--gpu-memory-utilisation 0.9
# Une fois le service démarré, il peut être appelé via l'interface compatible OpenAI
Processus d'utilisation typique : Visitez kimi.com ou platform.kimi.ai → S'inscrire/Connexion → Créer une clé API (mode API) → Sélectionner un modèle (code K2.6/K2.7) → Message d'entrée et définition de l'outil (facultatif) → Obtenir les résultats générés → Analyser les appels d'outils (si nécessaire) → Examiner manuellement la sortie de la clé.
Prix des produits
La stratégie de tarification de la série Kimi K2 adopte une structure à trois niveaux : « open source gratuit + API payante à l'utilisation + personnalisation d'entreprise », qui complète la stratégie open source.
Côté C : gratuit sur kimi.com : Tous les modèles de la série Kimi (y compris le code K2/K2.6/K2.7) peuvent être utilisés gratuitement sur kimi.com sans limite supérieure. Le but de cette stratégie de tarification est de maximiser la base d'utilisateurs et de cultiver des conversions payantes pour le service API. Il convient de noter que la version gratuite a des fonctions limitées (telles que la non prise en charge des appels d'outils, des requêtes haute fréquence limitées et aucune garantie SLA).
API : paiement à l'utilisation : les prix des API sont différenciés selon la version du modèle et l'état d'accès au cache.
| Modèle | Entrée (accès au cache) / millions de jetons | Entrée (manque de cache) / millions de jetons | Sortie / million de jetons | Sortie de version à haut débit |
|---|---|---|---|---|
| Kimi K2.6 | 0,16 $ | 0,95 $ | 4,00 $ | — |
| Code Kimi K2.7 | 0,19 $ | 0,95 $ | 4,00 $ | — |
| Kimi K2.7 Code haute vitesse | 0,38 $ | 1,90 $ | 8,00 $ | — |
| Kimi K3 (produit phare) | 0,30 $ | 3,00 $ | 15,00 $ | — |
Solution personnalisée pour entreprise : la plate-forme fournit des services de « solutions d'entreprise et de personnalisation », notamment des limites de débit flexibles, une prise en charge du déploiement multi-projets, une garantie SLA, la conformité des données et la protection de la confidentialité, ainsi qu'un support technique exclusif. Les prix d'entreprise doivent être obtenus en contactant l'équipe commerciale, et les prix standard n'ont pas été divulgués. Pour les entreprises ayant des besoins d'auto-hébergement, les pondérations open source K2 Base/Instruct sont disponibles gratuitement, mais les coûts de l'infrastructure GPU, de la main-d'œuvre d'exploitation et de maintenance et du réglage du moteur d'inférence doivent être évalués par vous-même.
Quota gratuit et détails de facturation : après l'enregistrement de l'API, il existe un quota d'essai gratuit par défaut (la valeur spécifique est soumise à la page platform.kimi.ai). La mise en cache contextuelle prend effet automatiquement - les prix d'accès au cache sont automatiquement appliqués lorsque le même préfixe est saisi à plusieurs reprises. Les interfaces de téléchargement de fichiers et d’extraction de contenu sont actuellement gratuites. La facturation réelle est basée sur la page en temps réel. Il est recommandé de calculer l'utilisation estimée de l'API via Token avant le déploiement.
Scénarios d'application
Les capacités de base de Kimi K2 déterminent qu'il est le plus adapté aux scénarios de tâches nécessitant une manipulation active d'outils plutôt qu'une simple génération de texte. Les types de scénarios suivants ont le rapport entrées-sorties le plus élevé.
-
Programmation d'agent et maintenance de l'entrepôt de code : les performances SOTA de K2 sur le banc SWE signifient qu'il est capable d'effectuer des tâches d'ingénierie telles que la réparation des problèmes GitHub, la révision du code, la génération de tests et la refactorisation. L'effet d'utilisation réel dépend de la modularité de l'entrepôt de codes et de la clarté de la description du problème - dans une ancienne base de code hautement couplée, la précision de localisation des problèmes de K2 diminuera. Problèmes d'acceptation : Il est recommandé de commencer la vérification à partir des tâches de réparation de fichiers uniques dans les entrepôts de petite et moyenne taille (<50 000 lignes) et de l'étendre progressivement à la reconstruction multi-fichiers.
-
Génération de rapports de recherche et d'analyse approfondis : combinant des fonctionnalités de recherche sur le Web, de Code-Runner et de contexte long, K2 peut servir d'assistant de recherche pour réaliser un flux de travail complet depuis la collecte de données, l'analyse statistique jusqu'à la rédaction du rapport. La démo officielle démontre la capacité d'effectuer une analyse des données de paie et de générer des rapports HTML interactifs en 16 appels IPython. Problèmes d'acceptation : plus les exigences faisant autorité pour la source de données sont élevées, plus il est nécessaire de configurer des points de révision manuelle dans le lien de conclusion clé ; L'analyse statistique de K2 peut être automatisée, mais il n'est pas recommandé de laisser entièrement l'inférence causale et les recommandations commerciales au modèle.
-
Workflow automatisé et système d'agent : K2 est un modèle sous-jacent idéal pour créer des systèmes d'agent autonomes. Les développeurs peuvent créer des systèmes de collaboration multi-agents sur l'API Kimi. Chaque agent dispose d'un ensemble d'outils différent et complète une logique métier complexe grâce à l'orchestration des tâches. Les plateformes Tencent CodeBuddy et Genspark Agent sont des cas typiques de ce scénario. Problèmes d'acceptation : dans le scénario Agent, il faut prêter attention à la croissance de la consommation de jetons - plusieurs séries d'appels d'outils augmenteront considérablement la quantité de jetons de sortie. Il est recommandé de définir une seule tâche max_steps et une limite supérieure de budget de jeton.
-
Service client et intelligence conversationnelle : les capacités de suivi de commandes et la longue fenêtre contextuelle de K2 le rendent adapté à la création de systèmes de service client intelligents. Peut gérer des conversations à plusieurs tours durant des dizaines de tours, en maintenant une compréhension précise de l’intention et du contexte de l’utilisateur. Avec l'outil Mémoire, la persistance de l'historique des conversations et l'accumulation de portraits d'utilisateurs peuvent être obtenues. Problèmes d'acceptation : Il est nécessaire de créer des exemples de haute qualité et des mots d'invite système pour le domaine des affaires ; pour les opérations commerciales sensibles (remboursements, annulation de compte, etc.), des points de confirmation manuelle doivent être définis.
-
Révision juridique et contractuelle : la capacité de contexte long de K2 lui permet de traiter des dizaines, voire des centaines de pages de documents contractuels à la fois, d'extraire les termes clés, de marquer les points à risque et de comparer les différences de version. Objectif d'acceptation : La terminologie particulière et la structure logique des textes juridiques nécessitent une compréhension de haute précision. Il est recommandé d'utiliser des échantillons contractuels dans le champ cible pour l'évaluation du système avant le lancement officiel. L’avis juridique final doit encore être confirmé par un avocat en exercice.
Personnes concernées
Le public de Kimi K2 couvre des développeurs individuels, des équipes de recherche et de grandes entreprises, mais les valeurs et les conditions préalables des différents rôles varient considérablement.
-
Développeurs d'applications IA : il s'agit du public principal de K2. Qu'il s'agisse de créer des applications d'agent, des assistants de programmation ou des flux de travail automatisés, les capacités d'appel d'outils et la licence open source de K2 fournissent une base d'intégration flexible. Prérequis : Familiarité avec le format API OpenAI/Anthropic, compréhension de la définition du schéma de l'outil et de l'architecture de l'agent. Pour les développeurs qui ont besoin d’un auto-hébergement, une expérience du déploiement de clusters GPU est également requise. Scénarios non applicables : applications multimodales qui nécessitent une compréhension visuelle élevée (recommander l'API K2.6 ou changer de modèle multimodal) ; conversations en temps réel qui nécessitent une latence extrême (recommander de petits modèles dédiés ou une version API haut débit).
-
Équipe de recherche IA : les pondérations open source de K2-Base fournissent aux chercheurs une plate-forme de recherche prenant en compte les paramètres 1T qui peut être utilisée pour le réglage fin, la recherche d'alignement, la compression de modèles et l'analyse du comportement des agents. La mise en œuvre de l'optimiseur MuonClip constitue également une référence pour la recherche sur la stabilité de l'entraînement. Conditions préalables : Puissance de calcul GPU suffisante (8 × A100-80G ou plus recommandée) et expérience de formation/réglage précis du modèle MoE. Scénario non applicable : chercheurs individuels avec un budget serré (poids du modèle supérieur à 600 Go, coûts de stockage et de chargement élevés).
-
Enterprise AI Team : le système de licences open source et d'API à double voie de K2 offre aux entreprises des choix flexibles : choisissez l'auto-hébergement si les exigences de conformité sont élevées, et choisissez l'API si les exigences de vitesse sont élevées. Les petites et moyennes entreprises peuvent rapidement prouver leurs concepts grâce à l'API, et les grandes entreprises peuvent créer des déploiements privés basés sur le poids de l'open source. Conditions préalables : le coût total de possession (TCO) de l'auto-hébergement par rapport à l'API doit être évalué, y compris les frais d'achat/de location du GPU, la main d'œuvre d'exploitation et de maintenance et la fréquence de mise à jour du modèle. Non applicable aux scénarios : Scénarios qui ont un fort besoin de multi-modalité (entrée image/vidéo) et ne souhaitent pas utiliser l'API (la version initiale de K2 ne prend pas en charge la vision) ; les scénarios qui nécessitent un contexte très long de plus de 1 million de jetons (DeepSeek ou d'autres modèles prenant en charge le contexte 1 million sont recommandés).
-
Opérations auto-médias et créateurs de contenu : L'entrée gratuite sur kimi.com permet aux utilisateurs ordinaires de découvrir les capacités de génération de texte de K2 sans frais, ce qui convient aux tâches légères telles que la rédaction d'articles, la synthèse de contenu et le brainstorming. Ne s'applique pas aux scénarios : Scénarios qui nécessitent une génération visuelle (comme la mise en page de graphiques et de texte, la conception d'affiches) ; des scénarios qui nécessitent une écriture créative longue et approfondie (le résultat du mode sans réflexion K2 peut ne pas être aussi logique créative et narrative que le modèle d'écriture dédié).
Résumé et Outlook
Kimi K2 représente la position précise de Dark Side of the Moon dans le segment du « modèle d'agent open source » - ce n'est pas le modèle avec les paramètres les plus grands ni le contexte le plus long, mais c'est le premier produit à amener le modèle open source au niveau phare du code source fermé en termes d'appels d'outils et de tâches d'agent. La combinaison technologique de 1T MoE + optimiseur MuonClip + Agentic RL à grande échelle est un différenciateur clair dans le paysage des modèles open source de 2025.
Compétences de base : Les capacités agentiques (banc SWE 65,8 %, open source Tau2 en premier) constituent le fossé le plus difficile à copier de K2, qui vient de l'investissement à long terme de Dark Side of the Moon dans la synthèse de données agentiques et les systèmes RL généraux. La stratégie open source (Modified MIT) réduit les coûts d'essais et d'erreurs de l'entreprise, et la compatibilité des API avec OpenAI/Anthropic abaisse le seuil de migration. Le modèle présente également des avantages évidents en termes d'efficacité d'inférence : les paramètres d'activation 32B signifient qu'il peut être exécuté sur une seule carte et le coût d'inférence est inférieur à celui des modèles denses du même niveau de capacité.
Limites actuelles : La version initiale ne prend pas en charge la saisie visuelle ni le raisonnement en chaîne de pensée (K2.6 a compensé cela via l'API) ; la version open source reste K2-0905, et le code K2.6/K2.7 ultérieur ne fournit que des appels API, et les utilisateurs auto-hébergés ne peuvent pas obtenir de fonctionnalités multimodales et de chaîne de pensée. Il est inférieur aux produits concurrents tels que DeepSeek dans des scénarios à contexte ultra-long (1M+). Dans certaines tâches de raisonnement complexes, un gaspillage de jetons et des appels d'outils incomplets se produisent occasionnellement (officiellement reconnu dans Limitations).
Observation de suivi de l'évolution : (1) Si Dark Side of the Moon continuera à ouvrir la source avec le poids des versions ultérieures - cela déterminera l'état écologique à long terme de K2 dans la communauté open source ; (2) La poursuite de l'intégration de la série K2 dans le sens du « modèle de réflexion » - la version initiale ne suit clairement pas la voie CoT, mais K2.6 commence à ajouter un support de chaîne de réflexion, ce changement stratégique mérite d'être suivi ; (3) Construction écologique d'agent - si les projets communautaires autour de K2 (Swarm, intégration d'outils MCP, etc.) peuvent former une LangChain similaire Ou l'effet d'agglomération écologique d'AutoGPT.
Évaluation des risques d'approvisionnement/d'adoption : la voie d'entrée la plus économique pour les petites et moyennes équipes consiste à commencer par l'API Kimi et à effectuer une vérification des compétences avec K2.6, qui ne nécessite pas d'investissement initial en GPU. Pour les grandes et moyennes entreprises, il est recommandé d'utiliser d'abord l'API pour effectuer un PoC afin de vérifier les performances de K2 dans le scénario cible (en se concentrant sur la précision des appels de l'outil de test, le taux de rappel de contexte long et le taux d'achèvement des tâches), puis d'évaluer s'il vaut la peine de créer un environnement auto-hébergé. L'auto-hébergement doit se concentrer sur la vérification : (1) des termes de la licence concernant l'utilisation commerciale et la distribution secondaire (restrictions spécifiques du MIT modifié) ; (2) le coût d'achat/location du cluster GPU et les capacités de l'équipe d'exploitation et de maintenance ; (3) la prévisibilité des mises à jour du modèle et le soutien de la communauté. Dans les secteurs où la conformité est forte (finance, médecine, affaires gouvernementales), les pondérations open source K2 assurent la protection de la souveraineté des données, mais les entreprises doivent toujours effectuer des audits de sécurité internes et des tests contradictoires avant la production formelle.
Outils associés :
Informations de version
- Kimi K2.6 :La version phare universelle de la série K2 prend en charge la saisie visuelle et textuelle, le raisonnement en chaîne de pensée et les contextes 256K. Le prix de l'API est de 0,95 $/million de jetons en entrée et de 4,00 $/million de jetons en sortie.
- Code Kimi K2.7 :Une version de programmation spécialisée qui prend en charge le contexte de 256 Ko et le raisonnement en chaîne de pensée, a un taux de réussite plus élevé dans les tâches de programmation et fournit une version à grande vitesse (~ 180 jetons/s). Le prix de l'API est de 0,95 $/million de jetons en entrée et de 4,00 $/million de jetons en sortie.
- Kimi K2-0905 :Protection améliorée des droits d'auteur, capacités de codage agent améliorées, contexte étendu à 256 Ko et Hugging Face est disponible en téléchargement.
- Kimi K2-Instruire :Version de réglage fin des instructions initiales, contexte 128 Ko, mode sans réflexion, optimisé pour les scénarios généraux de chat et d'agent.
- Kimi K2-Base :Modèle de pré-formation de base, paramètres totaux 1T/activation 32B, adapté aux chercheurs pour affiner et personnaliser.
Avis des utilisateurs