Dauphin ByteDance
Gratuit
ByteDance Dolphin est le modèle d'analyse de documents open source de ByteDance. Il effectue la reconnaissance de structure, l'extraction de contenu et la sortie Markdown/JSON autour de PDF, de documents numérisés et de documents de mise en page complexes. Son principal avantage réside dans l’efficacité de la compréhension des documents en deux étapes et de l’analyse parallèle.
ByteDanceDolphin
Paramètres et statistiques de base
[Un bref commentaire en une phrase] : Il ne s'agit pas d'un « autre modèle OCR », mais d'un moteur de structuration de documents qui divise la compréhension de la mise en page, l'ordre de lecture, le recadrage des éléments et l'analyse du contenu en deux étapes d'exécution.
[Vérification de la publicité] : L'entrepôt officiel décrit Dolphin-v2 comme un modèle universel d'analyse de documents. Cette affirmation n’est pas exagérée, car elle fait clairement la distinction entre les documents nés numériques et les documents photographiés, et adopte différentes stratégies d’analyse pour différents chemins de documents. Toutefois, « universel » ne signifie pas « insensé et inclusif ». Les documents numérisés complexes, la logique interpages et les tableaux extrêmes nécessitent encore une vérification supplémentaire.
| Projets | Informations publiques |
|---|---|
| Ligne principale actuelle | Dauphin-v2 |
| Échelle des paramètres | v1/v1.5 est de 0,3B, la v2 est mise à niveau vers 3B |
| Statut du papier | Acceptation ACL 2025 |
| Portail open source | GitHub, visage câlin, arXiv |
| Prise en charge de la sortie | JSON, Markdown, résultats au niveau des éléments |
| Capacités clés | Analyse de mise en page, prédiction de l'ordre de lecture, analyse de tableau/formule/code, PDF multipage |
| Représentation publique | Les métriques Dolphin-v2 sur OmniDocBench sont nettement meilleures que les versions 1.5 et 1 |
| Taille de la communauté | GitHub environ 9 000 étoiles, 772 forks |
Point de vue de l'expert : Ce qui vaut la peine d'être observé chez Dolphin n'est pas de « rivaliser avec les autres », mais d'avoir fait de « comprendre d'abord la mise en page, puis d'analyser le contenu » une voie d'ingénierie. Cela détermine directement qu'il est plus facile d'obtenir des résultats structurés et consommables en aval dans des scénarios de documents complexes que des solutions qui effectuent uniquement l'OCR de bout en bout.
Reconnaissance des utilisateurs et du marché
Environ 9 000 étoiles et 772 forks sur GitHub indiquent que Dolphin a reçu une attention significative des développeurs. Pour un modèle open source d'analyse de documents, cette taille est suffisante pour montrer qu'il ne s'agit pas d'un projet temporaire au sein du laboratoire, mais d'un composant de chaîne d'outils qui sera expérimenté et réintégré par de vraies équipes.
Reconnaissance des utilisateurs et du marché : le responsable a également publié simultanément la carte modèle et la démo du papier ACL Hugging Face, ce qui signifie qu'elle s'adresse à la fois aux chercheurs et aux équipes d'ingénierie. Surtout pour les équipes effectuant la numérisation de documents, le nettoyage de la base de connaissances et le traitement des factures/rapports, ce type de modèle capable d'implémenter JSON/Markdown est plus pratique que la simple reconnaissance de texte.
Vérification de la publicité : Si vous l'interprétez comme "le remplacement de toutes les suites OCR commerciales", c'est évidemment trop ; mais si vous le positionnez comme le moteur principal de la plateforme d’analyse de documents open source, les limites officielles des capacités sont crédibles.
Avantages cachés : par rapport à l'OCR qui ne renvoie qu'une page complète de texte brut, la sortie structurée de Dolphin peut réduire considérablement les règles de post-traitement et les coûts de nettoyage manuel, ce qui est particulièrement évident dans les longs documents, tableaux et scénarios de formules.
Avantage de coût
La vérité sur la gratuité : Dolphin est open source et gratuit, mais gratuit ne signifie pas un seuil bas. Après la mise à niveau de la v2 vers la 3B, bien que l'effet soit plus fort, la complexité des ressources d'inférence, du téléchargement et du déploiement du modèle augmentera également. Pour les équipes effectuant uniquement de l'OCR légère, la véritable comparaison est le « coût total du système » plutôt que le prix de la licence.
| Couche de coûts | Divulgation | Ce que cela signifie réellement |
|---|---|---|
| Côté C/personnel | Pas de produit de consommation indépendant | Plus comme un composant de R&D qu'une application utilisateur ordinaire |
| Développeur/API | Open source et gratuit, peut être déployé par vous-même | Le coût réside dans la puissance de calcul, le téléchargement du modèle, le cadre d'inférence et la maintenance |
| Entreprise | Pas de package commercial public | Si vous entrez en production, vous devez effectuer vous-même les autorisations, l'audit, la flexibilité et le SLA |
Coûts cachés : le premier est la sélection du modèle et du cadre d'inférence. Les solutions vLLM, TensorRT-LLM et Transformers présentent chacune des compromis en matière d'ingénierie. Le deuxième est le coût du prétraitement des documents. Une mauvaise qualité d’image, une rotation, un ombrage et un mixage multilingue amplifieront les erreurs. Le troisième est l’alignement du schéma en aval. Être capable d'identifier la structure ne signifie pas être capable de l'écrire directement et sans perte dans le système d'entreprise.
Avantages cachés : si l'entreprise utilise toujours l'ancienne méthode de « reconnaissance OCR du texte intégral + démolition matérielle d'un ensemble de règles », les modèles structurés tels que Dolphin peuvent réduire considérablement les coûts de maintenance des règles et de retouche manuelle.
Fonctions principales
- Analyse de document en deux étapes : commencez par classer et effectuer une analyse de mise en page, puis analysez le contenu par élément ou par page entière.
- Prédiction de l'ordre de lecture : identifie non seulement les éléments, mais tente également de restaurer l'ordre naturel de lecture, ce qui est particulièrement important pour la sortie Markdown.
- Analyse multi-granularité : prend en charge les méthodes de traitement au niveau de la page et au niveau des éléments.
- Extraction d'éléments complexes : couvrant le texte, les tableaux, les formules, les codes et autres éléments.
- Prise en charge des PDF multipages : Le journal des modifications officiel a divulgué des capacités d'analyse PDF multipages.
- Inference Acceleration Adaptation : la prise en charge de vLLM, TensorRT-LLM, etc. indique qu'il est orienté vers un déploiement réel, et non vers une pure reproduction papier.
Point de vue d'expert : Le lien caché le plus critique ici est "Mise en page -> Découpage d'éléments -> Analyse de mots d'invite spéciale". Cela signifie que différents éléments ne partagent plus le même ton d'analyse et le même modèle de sortie, ce qui constitue la principale source d'amélioration de la qualité des documents complexes.
Evolution du modèle et de la version
Étape initiale
Dolphin 1.0 : 20/05/2025 Le modèle de pré-formation et le code d'inférence sont rendus publics, établissant une entrée open source.
Étape d'amélioration légère
Dolphin-1.5 : 2025-10-16 Amélioration des performances d'analyse tout en conservant l'architecture 0,3B, indiquant que l'équipe a d'abord peaufiné la « convivialité légère ».
Étape d'expansion des capacités
Dolphin-v2 : mis à niveau vers 3B le 12/12/2025, ajoutant 21 nouveaux éléments de détection, d'extraction d'attributs, de capacités de documents photo, de formules et d'analyse spéciale de code. Il s'agit d'une version clé de « légère et pratique » à « structure plus générale et plus solide ».
Limitation actuelle : L'entrepôt ne dispose pas de mécanisme de versions GitHub et l'évolution des versions repose davantage sur le journal des modifications README. Il convient pour épingler des commits ou des branches avant d'y accéder, plutôt que de suivre aveuglément le maître.
Avantages techniques
ByteDance Dolphin est un type croisé de composants de base [RAG / base de connaissances / centre de données] et d'analyse de documents. Il est évalué ici par sa forme de livraison principale "infrastructure d'analyse de documents".
Limite des données : le responsable prend clairement en compte à la fois les documents numériques et les documents photographiés, indiquant qu'il ne se concentre pas uniquement sur la couche de texte PDF, mais cible également les images de documents réels plus complexes. L'avantage est qu'il peut gérer des documents numérisés et des documents photographiés ; la limitation est qu'un flou extrême, une distorsion de perspective importante et des numérisations à faible résolution entraîneront toujours une perte de qualité significative.
Rappel des points faibles : la véritable difficulté de l'analyse de documents n'est pas seulement la reconnaissance des caractères, mais aussi le mélange multilingue, la terminologie professionnelle, la répartition des tableaux, les formules imbriquées et les sauts de mise en page. Bien que Dolphin soit plus puissant que l'OCR traditionnel dans ces sections, une fois qu'il entre dans un RAG ou un lien de base de connaissances, il est toujours recommandé d'utiliser la recherche hybride, le filtrage des métadonnées et le regroupement mixte au niveau de la page et au niveau de l'élément pour réduire le biais de récupération.
Conformité en matière de sécurité : l'entrepôt public officiel ne divulgue pas les informations de gouvernance d'entreprise telles que RBAC, l'isolation des locataires et si les données sont utilisées pour la formation secondaire. Le plus grand avantage de l'auto-déploiement open source est que les données sont contrôlables, mais le coût le plus important est que ces capacités de gouvernance doivent être complétées par vous-même.
Comment utiliser
Le référentiel officiel a fourni les principaux chemins d'installation et de raisonnement.
clone git https://github.com/ByteDance/Dolphin.git
cd Dauphin
pip install -r exigences.txt
installer git lfs
clone git https://huggingface.co/ByteDance/Dolphin-v2 ./hf_model
python demo_page.py --model_path ./hf_model --save_dir ./results --input_path ./demo/page_imgs/page_1.png
Description de l'entrée :
| Comment utiliser | Convient à qui | Instructions |
|---|---|---|
demo_page.py |
Équipe qui effectue l'analyse d'une page entière | Afficher directement les résultats de la structure au niveau de la page |
demo_element.py |
Équipe effectuant l'extraction d'éléments fins | Convient au traitement séparé des tableaux, formules et codes |
demo_layout.py |
Une équipe qui fait la compréhension et la pré-analyse de la mise en page | Convient au diagnostic préalable à l'implantation |
Limite de la collaboration homme-machine : l'extraction par lots peut être automatisée, mais les contrats de grande valeur, les documents médicaux, les états financiers et les PDF académiques complexes doivent toujours être examinés par des humains avant d'être mis en ligne, en se concentrant sur l'alignement des tableaux, les formules manquantes et les relations entre pages rompues.
Prix des produits
La tarification publique n'existe pas car il s'agit d'un modèle open source et non d'un SaaS standard.
Côté C/Individuel : Il n'y a pas d'entrée d'achat pour les utilisateurs ordinaires.
Développeur/API : les coûts les plus importants sont le téléchargement du modèle, le déploiement d'inférences, la mémoire graphique et l'optimisation du débit.
Entreprise : si vous souhaitez créer une plate-forme d'analyse interne, en plus du coût du raisonnement, vous devez également inclure les autorisations, la mise en cache, les files d'attente de tâches, la vérification des résultats et la gestion des journaux.
La vérité gratuite : L'Open Source permet d'économiser les frais de licence, pas les coûts du système. Une fois que l’analyse des documents atteint la production, la puissance de calcul et la gestion des données ne seront plus négligées.
Scénarios d'application
- Prétraitement de la base de connaissances : structurez d'abord les PDF, les rapports et les articles, puis envoyez-les vers des liens de récupération et de questions-réponses.
- Analyse de documents académiques et de formules : Particulièrement adapté aux documents de recherche scientifique contenant des formules, des tableaux et du texte mixtes.
- Numérisation des documents d'entreprise : Extraction structurée de contrats, de documents techniques et de rapports commerciaux.
- Traitement par lots de PDF multipages : convertissez de grandes quantités de documents historiques en données structurées indexables et consommables en aval.
Scénario de réduction de dimensionnalité : lorsque l'équipe a été gravement torturée par l'OCR traditionnelle en raison de tableaux, de formules et de problèmes d'ordre de lecture, son utilisation entraînera une amélioration très évidente de la qualité structurelle.
Limites actuelles : Si une entreprise n'a besoin que d'une OCR de ticket simple ou d'une extraction de texte de document sur une seule colonne, cela n'est pas nécessairement l'option la plus rentable en raison de la complexité technique plus élevée.
Personnes concernées
- Équipe plateforme travaillant sur la base de connaissances/RAG : un prétraitement des documents de haute qualité est requis.
- Équipe produit Document AI : vous souhaitez mettre à niveau l'OCR de la reconnaissance de texte brut à la compréhension de la structure.
- Équipe de recherche et d'éducation : plus utile lorsqu'il s'agit d'articles, de manuels, de tests et de matériels avec des formules.
Scénario de persuasion :
- Les personnes qui souhaitent simplement une utilisation prête à l'emploi à faible barrière : il s'agit plutôt de composants de modèle, pas de SaaS standard.
- Équipes sans expérience en matière de déploiement de GPU ou de modèles : la configuration du déploiement et de l'accélération entraînera de nombreux obstacles.
- Considérez-le comme une équipe « OCR universelle et sans erreur » : l'analyse de documents complexes nécessite toujours une inspection aléatoire et une correction en aval.
Résumé et Outlook
La compétitivité de ByteDance Dolphin réside dans sa capacité à faire progresser la compréhension des documents depuis « l'alphabétisation d'une page entière » jusqu'à « la structure d'abord, le contenu plus tard ». Ceci est essentiel pour les bases de connaissances, les documents d'entreprise et le traitement des documents de recherche, car ce qui détermine réellement la convivialité en aval n'est souvent pas la précision des caractères, mais la fidélité des tableaux, des formules, des blocs de code et de l'ordre de lecture.
[Évaluation des risques d'approvisionnement/d'adoption] : La chose la plus importante à évaluer avant l'adoption est votre type de document, plutôt que de simplement regarder le score de la liste. Si un grand nombre de documents sont des PDF académiques complexes, des rapports de plusieurs pages, des tableaux et des formules mixtes, Dolphin est précieux ; s'il ne s'agit que d'OCR de texte léger, le problème de « surcapacité et de suringénierie » peut survenir. Ce qui mérite de continuer à observer à l'avenir, c'est l'écosystème d'accélération des inférences de suivi de la v2, la stabilité des documents photographiés et la vitesse de reconstitution de la communauté autour de la normalisation des schémas et de la gouvernance d'entreprise.
Informations de version
- Dauphin-v2 :La dernière version principale divulguée dans le journal des modifications officiel de l'entrepôt a été mise à niveau vers les paramètres 3B, ajoutant 21 types de détection d'éléments, d'extraction de champs d'attributs, d'analyse spécialisée de formules et de codes et de capacités de traitement de documents photo plus fortes.
- Dauphin-1.5 :Améliorer considérablement l'effet d'analyse tout en conservant l'architecture légère 0,3B est un nœud important pour passer de la première version à une utilisation pratique.
- Dauphin 1.0 :Le responsable a divulgué pour la première fois le modèle de pré-formation et le code d'inférence, établissant ainsi une entrée open source complète pour l'analyse de documents.
Avis des utilisateurs