Le benchmark Android de Google : Gemini coûte 17,5 fois plus cher que DeepSeek V4 Flash
La liste Google Android Bench montre que le coût de fonctionnement unique de Gemini 3.5 Flash est de 147 $, tandis que DeepSeek V4 Flash ne coûte que 8,4 $, soit une différence de prix de 17,5 fois. GPT-5.5 s'est classé premier avec un score de 74, et les modèles nationaux GLM, Kimi et DeepSeek figuraient collectivement sur la liste.
Le test de référence de Google annulé : Gemini coûte 17,5 fois celui de DeepSeek
Google a mis à jour la liste Android Bench - un test de référence qui mesure spécifiquement la capacité des modèles d'IA à accomplir des tâches de développement Android, ce qui présente une forte valeur de référence permettant aux développeurs de sélectionner des modèles. Les résultats sont assez ironiques : Gemini 3.5 Flash, que Google a revendiqué lors de l'I/O 2026 comme « le modèle Flash le plus puissant à ce jour », n'a obtenu que 63,7 points et s'est classé sixième. Le coût moyen d'un seul essai s'élève à 147,1$ (environ 996 yuans), ce qui en fait le modèle le plus cher de toute la liste. Le coût de fonctionnement unique de DeepSeek V4 Flash n'est que de 8,4$ (environ 57 yuans) - le premier est 17,5 fois celui du second.
Répertoriez les résultats et les détails des coûts :
| Classement | Modèle | Score | Coût par voyage |
|---|---|---|---|
| 1 | GPT-5.5 | 74,0 | — |
| 2 | GPT-5.4 | 72.4 | — |
| 3 | Aperçu de Gemini 3.1 Pro | 72.4 | ~49$ |
| 4 | Claude Opus 4.7 | 68,7 | — |
| 5 | Claude Opus 4.6 | 66,6 | — |
| 6 | Gémeaux 3.5 Flash | 63,7 | 147,1 $ |
| 7 | GLM 5.1 | 59,7 | — |
| 8 | Kimi K2.6 | 58,6 | — |
| 10 | DeepSeek V4 Pro | 55.4 | — |
| 12 | DeepSeek V4 Flash | 52,7 | 8,4 $ |
En termes de modèles nationaux, GLM 5.1 (59,7 points), Kimi K2.6 (58,6 points) et DeepSeek V4 Pro (55,4 points) figuraient simultanément sur la liste, reflétant la présence collective des modèles d'IA chinois dans le domaine des outils de développement.
Google avait affirmé lors de l'I/O 2026 que les capacités d'encodage Flash du Gemini 3.5 étaient plus robustes, avec des vitesses de sortie jusqu'à 4 fois supérieures à celles des modèles de pointe concurrents, et surpassaient le Gemini 3.1 Pro dans certains tests internes. Cependant, les données réelles du scénario de développement Android d'Android Bench donnent une conclusion complètement différente : non seulement le score ne figure pas dans le top cinq, mais le rapport prix/performance est même écrasé par DeepSeek V4 Flash. Même les propres benchmarks de Google ne peuvent pas sauver la face de ses propres modèles. À une époque où les développeurs votent avec leurs pieds, le discours marketing des fabricants est systématiquement falsifié par des données rentables issues de scénarios réels.
Avis