Le mode de reconnaissance d'images DeepSeek est officiellement lancé : une étape clé vers la productisation de capacités multimodales
Le mode de reconnaissance d'images de DeepSeek est officiellement lancé sur le Web et sur l'application, en utilisant le cadre Thinking with Visual Primitives, aux côtés du « Mode rapide » et du « Mode Expert », marquant la transition des capacités multimodales de la recherche et du développement à la production.
Le chercheur multimodal de DeepSeek, Xiaokang Chen, a annoncé que le mode de reconnaissance d'image de DeepSeek a été officiellement lancé sur le Web et l'application. Le « Mode lecture d'images » est juxtaposé au « Mode rapide » et au « Mode expert ». Lorsqu'il est activé, les utilisateurs peuvent télécharger directement des images pour DeepSeek afin de comprendre le contenu visuel. Ses capacités dépassent la simple extraction de texte (OCR).
Le cadre technologique sous-jacent au lancement de ce mode de reconnaissance d'images est le cadre principal "Thinking with Visual Primitives" publié par DeepSeek en avril de cette année. L'idée principale du cadre est de permettre au modèle de décomposer les informations visuelles en « primitives » pour raisonner comme le font les humains, plutôt que de simplement mapper des images sur du texte de bout en bout. Cette voie technique est unique parmi les modèles multimodaux nationaux.
Le lancement du mode de reconnaissance d'images est une étape clé pour DeepSeek pour passer du statut de « roi du raisonnement textuel pur » à celui d'« acteur multimodal polyvalent ». Auparavant, la compétitivité principale de DeepSeek se concentrait sur le raisonnement mathématique, la génération de code et le traitement de textes longs, et ses capacités visuelles ont toujours été ses défauts évidents face à la concurrence de produits concurrents tels que Doubao.
Il y a également eu un épisode dramatique le jour de son lancement : selon The Paper, le mode de reconnaissance d'image de DeepSeek n'a pas pu identifier correctement les photos du fondateur Liang Wenfeng, mais l'a plutôt identifié comme étant Dong Yuhui, Zhang Xuefeng et même Lei Jun. La photo de Lei Jun a été identifiée avec précision. Une explication est que Liang Wenfeng agit extrêmement discrètement et qu'il existe peu de photos et d'informations publiques sur Internet, ce qui rend difficile pour le modèle de former des caractéristiques d'identification stables. Cet oolong "ne pas connaître le patron" prouve simplement que DeepSeek n'a pas fait d'optimisation spéciale de la reconnaissance pour son propre patron - la capacité de reconnaissance faciale du modèle est basée sur la distribution de données de formation publiques, et non sur des privilèges internes.
La sortie officielle de ce mode de reconnaissance d’image, combinée à la mise à niveau globale des modèles de la série V4, complète le puzzle multimodal de DeepSeek. Ce qui mérite l'attention à l'avenir est de savoir si les performances de compréhension visuelle dans des scènes réelles peuvent atteindre le même niveau que les capacités de raisonnement de la série V4, et si elles chevaucheront la version multimodale prévue dans la V4.1.
Avis