DeepSeek open source OCR-2 : Re-comprendre les documents longs avec un « flux causal visuel »
DeepSeek a publié une nouvelle génération de modèle OCR open source DeepSeek-OCR-2 sur GitHub. Il est open source sous le protocole Apache-2.0. La solution technique adopte le « Visual Causal Flow » et est meilleure que la première génération en matière d'OCR de documents longs et de reconnaissance de mises en page complexes. Le projet de première génération a reçu environ 23 700 étoiles.
Loin de l'agitation de la course aux armements à grande échelle, DeepSeek a utilisé une source ouverte discrète pour attirer l'attention sur le "renseignement documentaire", le champ de bataille terrestre le plus proche de la production. DeepSeek-OCR-2 a été lancé sur GitHub le 3 février et est open source sous le protocole Apache-2.0. Le mot-clé technique est « Visual Causal Flow » - une nouvelle solution pour une modélisation causale et une compression plus efficaces des informations visuelles.
De la « compression optique » au « flux causal »
Le point culminant technique de DeepSeek-OCR de première génération est la « compression optique de contextes », qui a reçu environ 23 700 étoiles et 2 187 forks depuis son lancement en open source. Il s’agit actuellement de l’un des projets open source OCR les plus populaires. La deuxième génération a évolué sur cette base : en mettant l'accent sur une modélisation causale et une compression plus efficaces des informations visuelles, et en obtenant de meilleures performances dans des scénarios tels que l'OCR de documents longs et la reconnaissance de mises en page complexes. À la mi-2026, l’entrepôt avait accumulé environ 3 200 étoiles et continue d’itérer.
L'Open Source n'est pas une action fragmentaire, mais une pile technologique
En regardant les actions open source de DeepSeek au cours de l'année écoulée, l'OCR n'est qu'une pièce du puzzle : en termes d'infrastructure d'inférence, DeepEP (communication parallèle experte), DeepGEMM (noyau GPU BLAS), FlashMLA (noyau d'attention potentielle multi-têtes) et 3FS (système de fichiers distribués de formation/inférence IA) ont été successivement open source, couvrant l'ensemble du lien « algorithme-noyau-communication-stockage ». Cette stratégie consistant à « non seulement donner du poids, mais aussi donner des projets » constitue l'atout unique de confiance de DeepSeek dans la communauté open source.
Du point de vue de l'industrie, l'OCR semble être une « vieille voie », mais il s'agit en fait d'une fonctionnalité d'entrée de gamme pour le RAG, l'intelligence documentaire et la mise en œuvre multimodale. DeepSeek est open source sous le protocole Apache-2.0 plutôt qu'une licence commerciale plus souple, qui non seulement maintient une influence écologique mais laisse également la place à une source commerciale fermée. Pour les équipes nationales effectuant l'analyse de documents, la base de connaissances et la reconnaissance de factures, DeepSeek-OCR-2 fournit une base adaptée aux scénarios chinois qui peut être directement commercialisée. C'est précisément le défaut de nombreux modèles OCR étrangers qui échouent dans les longs documents chinois.
Plusieurs orientations à suivre dans le futur :
- Performances de DeepSeek-OCR-2 sur le benchmark chinois des documents longs : Le responsable n'a pas divulgué le benchmark complet, et les tests communautaires sont la clé pour juger de sa qualité.
- Collaboration avec des modèles multimodaux (Qwen2.5-VL, etc.) : La frontière entre l'OCR et les modèles de langage visuel s'estompe. DeepSeek profitera-t-il de la tendance et lancera-t-il le support VLM ?
- Le « flux causal visuel » peut-il s'étendre à la compréhension vidéo : L'extension du même ensemble d'idées de modélisation causale dans la dimension temporelle mérite d'être observée.
- Accord open source et équilibre de commercialisation : la question de savoir si Apache-2.0 introduira des conditions plus strictes à l'avenir affectera les décisions d'adoption par les entreprises.
Avis