バイトダンスドルフィン
無料
ByteDance Dolphin は、ByteDance のオープンソースのドキュメント解析モデルです。 PDF、スキャンされたドキュメント、複雑なレイアウトのドキュメントに関する構造認識、コンテンツ抽出、Markdown/JSON 出力を実行します。その中心的な利点は、2 段階の文書理解と並列解析の効率性です。
バイトダンスドルフィン
コアパラメータと統計
[一文で簡単なコメント]: これは「別の OCR モデル」ではなく、レイアウトの理解、読み取り順序、要素のトリミング、およびコンテンツの解析を 2 つの実行段階に分割するドキュメント構造化エンジンです。
[宣伝の検証]: 公式ウェアハウスでは、Dolphin-v2 をユニバーサル文書解析モデルとして説明しています。この記述は誇張ではありません。デジタルで作成された文書と写真で撮影された文書を明確に区別し、文書パスごとに異なる解析戦略を採用しているからです。ただし、「普遍的」とは「無知ですべてを包括する」という意味ではありません。スキャンされた複雑なドキュメント、ページをまたがるロジック、および極端なテーブルには、引き続き追加の検証が必要です。
| プロジェクト | 広報 |
|---|---|
| 現在のメインライン | ドルフィンv2 |
| パラメータスケール | v1/v1.5 は 0.3B、v2 は 3B にアップグレードされます。 |
| 用紙ステータス | ACL 2025 承認 |
| オープンソースポータル | GitHub、ハグフェイス、arXiv |
| サポート出力 | JSON、マークダウン、要素レベルの結果 |
| 主な機能 | レイアウト分析、読み順予測、表・数式・コード分析、複数ページPDF |
| パブリックパフォーマンス | OmniDocBench の Dolphin-v2 メトリクスは、v1.5 および v1 よりも大幅に優れています。 |
| コミュニティの規模 | GitHub 約 9,000 スター、772 フォーク |
専門家の視点: Dolphin で注目すべき点は、「他社との競争」ではなく、「まずレイアウトを理解し、次にコンテンツを分析する」というエンジニアリング ルートを確立したことです。これは、エンドツーエンド OCR のみを実行するソリューションよりも、複雑なドキュメント シナリオで構造化された下流の消耗品の結果を取得する方が簡単であることを直接的に決定します。
ユーザーと市場の認識
GitHub 上の約 9,000 個のスターと 772 個のフォークは、Dolphin が開発者の大きな注目を集めていることを示しています。文書解析のオープンソース モデルの場合、このサイズは、それが研究室内の一時的なプロジェクトではなく、実際のチームによって試行され、再統合されるツール チェーン コンポーネントであることを示すのに十分です。
ユーザーと市場の認識: 当局者は、ACL 論文の Hugging Face モデル カードとデモも同時にリリースしました。これは、研究者とエンジニアリング チームの両方を対象としていることを意味します。特にドキュメントのデジタル化、ナレッジベースのクリーニング、請求書/レポートの処理を行うチームにとって、JSON/Markdown を実装できるこのタイプのモデルは、単にテキストを認識するよりも実用的です。
宣伝の検証: これを「商用 OCR スイートをすべて置き換える」と解釈するなら、これは明らかにやりすぎです。しかし、これをオープン ソースの文書解析プラットフォームのコア エンジンとして位置付ける場合、公式の機能境界は信頼できるものになります。
隠れたメリット: プレーンテキストの全ページを返すだけの OCR と比較して、Dolphin の構造化出力は後処理ルールと手動クリーニングのコストを大幅に削減できます。これは特に長い文書、表、数式のシナリオで顕著です。
コストメリット
無料に関する真実: Dolphin はオープンソースで無料ですが、無料だからといって敷居が低いというわけではありません。 v2 が 3B にアップグレードされた後は、効果はより強力になりますが、推論リソース、モデルのダウンロード、デプロイメントの複雑さも増加します。軽い OCR のみを実行しているチームの場合、実際の比較はライセンス価格ではなく「システムの総コスト」になります。
| コスト層 | 開示 | 実際の意味 |
|---|---|---|
| Cサイド/個人 | 独立した消費者向け製品はありません | 通常のユーザー アプリというよりは研究開発コンポーネントに近い |
| 開発者/API | オープンソースで無料、自分でデプロイ可能 | コストは、コンピューティング能力、モデルのダウンロード、推論フレームワーク、メンテナンスにかかっています。 |
| エンタープライズ | 公開された商用パッケージはありません | 運用環境に移行する場合は、権限、監査、柔軟性、SLA を自分で完了する必要があります。 |
隠れたコスト: 1 つ目は、モデルと推論フレームワークの選択です。 vLLM、TensorRT-LLM、および Transformers ソリューションには、それぞれエンジニアリング上のトレードオフがあります。 2 つ目は、文書の前処理にかかるコストです。画質の低下、回転、シャドウイング、多言語の混在によりエラーが増幅されます。 3 つ目は、下流のスキーマの調整です。構造を識別できることは、それをビジネス システムに直接かつロスなく書き込むことができることを意味するわけではありません。
隠れたメリット: 企業が「全文の OCR 認識 + 多数のルールのハード削除」という古い方法をまだ使用している場合、Dolphin などの構造化モデルを使用すると、ルールのメンテナンスと手動でのやり直しのコストを最も節約できます。
主な機能
- 2 段階のドキュメント解析: 最初に分類してレイアウト分析を実行し、次にコンテンツを要素またはページ全体ごとに解析します。
- 読み取り順序の予測: 要素を識別するだけでなく、マークダウン出力で特に重要な自然な読み取り順序の復元も試みます。
- 多粒度分析: ページレベルおよび要素レベルの処理方法をサポートします。
- 複雑な要素の抽出: テキスト、表、数式、コード、その他の要素をカバーします。
- 複数ページの PDF サポート: 公式の変更ログでは、複数ページの PDF 解析機能が公開されています。
- 推論アクセラレーションの適応: vLLM、TensorRT-LLM などのサポートは、純粋な紙の複製ではなく、実際のデプロイメントを指向していることを示しています。
専門家の視点: ここで最も重要な隠れたつながりは、「レイアウト -> 要素クリッピング -> 特別なプロンプト単語分析」です。これは、さまざまな要素が同じ解析トーンと出力テンプレートを共有しなくなることを意味します。これは、複雑なドキュメントの品質を向上させるための中心的なソースです。
モデルとバージョンの進化
初期段階
Dolphin 1.0: 2025-05-20 事前トレーニング モデルと推論コードが公開され、オープンソースの入り口が確立されました。
軽量強化ステージ
Dolphin-1.5: 2025-10-16 0.3B アーキテクチャを維持しながら解析パフォーマンスが向上しました。これは、チームが最初に「軽量の使いやすさ」に磨きをかけたことを示しています。
能力拡張段階
Dolphin-v2: 2025 年 12 月 12 日に 3B にアップグレードされ、21 の新しい要素検出、属性抽出、写真ドキュメント機能、数式、およびコードの特殊分析が追加されました。これは、「軽量かつ実用的」から「より一般的で強力な構造」への重要なバージョンです。
現在の制限: ウェアハウスには GitHub リリース メカニズムがなく、バージョンの進化は README 変更ログに大きく依存します。これは、マスターに盲目的に従うのではなく、アクセスする前にコミットまたはブランチを固定するのに適しています。
技術的な利点
ByteDance Dolphin は、[RAG / ナレッジベース / データセンター] のクロスタイプとドキュメント解析の基本コンポーネントです。ここでは、その主要な提供形式である「文書解析インフラストラクチャ」によって評価されます。
データ境界: 公式はデジタルで作成された文書と写真で撮影された文書の両方を明確に考慮しており、PDF テキスト レイヤーに焦点を当てているだけでなく、より複雑な現実の文書画像も対象にしていることを示しています。利点は、スキャンした文書や写真を撮った文書を処理できることです。ただし、極端なぼやけ、深刻な遠近歪み、および低解像度のスキャンでは依然として大幅な品質低下が発生するという制限があります。
問題点を思い出してください: 文書解析の本当の難しさは、文字認識だけではなく、多言語の混合、専門用語、表の広がり、ネストされた数式、レイアウトの中断などにもあります。これらのセクションでは、Dolphin は従来の OCR よりも強力ですが、RAG またはナレッジ ベース リンクに入ると、取得バイアスを減らすために、ハイブリッド検索、メタデータ フィルタリング、ページ レベルおよび要素レベルの混合チャンクを使用することをお勧めします。
セキュリティ コンプライアンス: 公式のパブリック ウェアハウスは、RBAC、テナントの分離、データが二次トレーニングに使用されるかどうかなどのエンタープライズ ガバナンス情報を公開していません。オープンソースの自己展開の最大の利点は、データを制御できることですが、最大のコストは、これらのガバナンス機能を自分で補完する必要があることです。
使い方
公式リポジトリには、コアのインストールと推論のパスが提供されています。
「」バッシュ git クローン https://github.com/ByteDance/Dolphin.git cd ドルフィン pip install -r 要件.txt git lfs インストール git clone https://huggingface.co/ByteDance/Dolphin-v2 ./hf_model pythondemo_page.py --model_path ./hf_model --save_dir ./results --input_path ./demo/page_imgs/page_1.png 「」
入り口の説明:
| 使い方 | 誰に適しています | 説明書 |
|---|---|---|
デモページ.py |
フルページ解析を行うチーム | ページレベルの構造結果を直接出力 |
demo_element.py |
細かい要素の抽出を行うチーム | テーブル、数式、コードの個別処理に適しています。 |
デモ_レイアウト.py |
レイアウトの理解と事前分析を行うチーム | レイアウト前の診断に最適 |
人間とコンピューターのコラボレーションの境界: バッチ抽出は自動化できますが、高額な契約書、医療文書、財務諸表、複雑な学術 PDF は、オンラインにする前に、表の位置合わせ、数式の欠落、ページ間の関係の破損に焦点を当てて、依然として人間がレビューする必要があります。
製品の価格設定
これは既製の SaaS ではなくオープンソース モデルであるため、公開価格は存在しません。
C-side/個人: 一般ユーザーには購入入り口がありません。
開発者/API: 最も重要なコストは、モデルのダウンロード、推論の展開、グラフィックス メモリ、およびスループットの最適化です。
エンタープライズ: 内部分析プラットフォームを構築する場合は、推論のコストに加えて、権限、キャッシュ、タスク キュー、結果の検証、およびログ管理も含める必要があります。
無料の真実: オープンソースはシステムコストではなく、ライセンス料を節約します。ドキュメントの解析が本番環境に到達すると、コンピューティング能力とデータ管理が無視されることはありません。
アプリケーションのシナリオ
- ナレッジベースの前処理: まず PDF、レポート、論文を構造化してから、それらを検索リンクと Q&A リンクに送信します。
- 学術文書および数式分析: 数式、表、テキストが混在する科学研究資料に特に適しています。
- 企業文書のデジタル化: 契約書、技術文書、ビジネスレポートを構造的に抽出します。
- 複数ページの PDF バッチ処理: 大量の履歴ドキュメントを、インデックス付け可能で下流で利用可能な構造化データに変換します。
次元削減ストライキ シナリオ: テーブル、数式、読み取り順序の問題により、チームが従来の OCR にひどく悩まされている場合、これを使用すると、構造の品質が明らかに向上します。
現在の制限事項: 企業が単純なチケット OCR または単一列ドキュメント テキスト抽出のみを必要とする場合、エンジニアリングがより複雑になるため、必ずしも最もコスト効率の高いオプションではない可能性があります。
該当する人
- ナレッジ ベース/RAG に取り組むプラットフォーム チーム: 高品質のドキュメント前処理が必要です。
- Document AI 製品チーム: OCR をプレーン テキスト認識から構造理解にアップグレードしたいと考えています。
- 研究教育チーム: 論文、教科書、試験問題、数式が含まれる資料を扱う場合、より価値があります。
説得シナリオ:
- 敷居の低いすぐに使える使用を希望する人: 既製の SaaS ではなく、モデル コンポーネントに似ています。
- GPU やモデルのデプロイメントの経験がないチーム: デプロイメントとアクセラレーションの構成には多くの障壁があります。
- 「汎用的でエラーのない OCR」チームと考えてください: 複雑な文書の解析には、依然としてランダムな検査と下流の修正が必要です。
概要と展望
ByteDance Dolphin の競争力は、文書の理解を「ページ全体の読み書き能力」から「構造が先、コンテンツは後」に進める能力にあります。これは、ナレッジ ベース、企業ドキュメント、および研究資料の処理にとって重要です。下流での使いやすさを実際に決定するのは、多くの場合、文字の正確さではなく、表、数式、コード ブロック、および読み取り順序が正しいままであるかどうかであるためです。
[調達/採用リスク評価]: 採用前に評価する最も重要なことは、単にリストのスコアを見るのではなく、文書の種類です。大量の文書が複雑な学術 PDF、複数ページのレポート、表と数式が混在している場合、Dolphin は役に立ちます。単なる軽いテキスト OCR の場合、「過剰な容量と過剰なエンジニアリング」の問題が発生する可能性があります。今後も観察し続ける価値があるのは、v2 のフォローアップ推論高速化エコシステム、写真撮影されたドキュメントの安定性、スキーマの標準化とエンタープライズ ガバナンスに関するコミュニティの補充の速度です。
バージョン情報
- ドルフィンv2 :公式ウェアハウスの変更ログで公開されている最新のメインラインバージョンは、3Bパラメータにアップグレードされ、21種類の要素検出、属性フィールド抽出、特殊な数式とコード分析、および強力な写真ドキュメント処理機能が追加されています。
- ドルフィン-1.5 :0.3Bの軽量アーキテクチャを維持しながら解析効果を大幅に向上させることは、最初のバージョンから実用化に移行するための重要なノードです。
- ドルフィン 1.0 :同関係者は事前トレーニングモデルと推論コードを初めて公開し、文書解析のための完全なオープンソースの入り口を確立した。
ユーザーレビュー