바이트댄스 돌고래
무료
ByteDance Dolphin은 ByteDance의 오픈 소스 문서 구문 분석 모델입니다. PDF, 스캔 문서, 복잡한 레이아웃 문서에 대한 구조 인식, 콘텐츠 추출, Markdown/JSON 출력을 수행합니다. 핵심 장점은 2단계 문서 이해와 병렬 구문 분석의 효율성입니다.
ByteDance돌핀
핵심 매개변수 및 통계
[한 문장으로 간단히 설명]: "또 다른 OCR 모델"이 아니라 레이아웃 이해, 읽기 순서, 요소 자르기 및 콘텐츠 구문 분석을 실행의 두 단계로 나누는 문서 구조화 엔진입니다.
[공개 확인]: 공식 웨어하우스에서는 Dolphin-v2를 범용 문서 구문 분석 모델로 설명합니다. 이 진술은 디지털 문서와 사진 문서를 명확하게 구별하고 문서 경로에 따라 서로 다른 구문 분석 전략을 채택하기 때문에 과장이 아닙니다. 그러나 "보편적"은 "두뇌가 없고 모든 것을 포함하는" 것을 의미하지 않습니다. 복잡한 스캔 문서, 교차 페이지 논리 및 극단적인 테이블은 여전히 추가 확인이 필요합니다.
| 프로젝트 | 공공정보 |
|---|---|
| 현재 메인라인 | 돌고래-v2 |
| 매개변수 규모 | v1/v1.5는 0.3B, v2는 3B로 업그레이드 |
| 논문현황 | ACL 2025 수락 |
| 오픈소스 포털 | GitHub, 포옹 얼굴, arXiv |
| 지원 출력 | JSON, Markdown, 요소 수준 결과 |
| 주요 역량 | 레이아웃 분석, 읽기 순서 예측, 표/수식/코드 분석, 다중 페이지 PDF |
| 공연 | OmniDocBench의 Dolphin-v2 측정항목은 v1.5 및 v1보다 훨씬 우수합니다 |
| 커뮤니티 규모 | 9,000개의 별, 772개의 포크에 대한 GitHub |
전문가의 견해: 돌핀의 주목할 점은 '남과의 경쟁'이 아니라, '먼저 레이아웃을 이해한 뒤 내용을 분석하는' 엔지니어링 루트를 만들었다는 점이다. 이는 엔드투엔드 OCR만 수행하는 솔루션보다 복잡한 문서 시나리오에서 구조화된 다운스트림 소비 가능 결과를 얻는 것이 더 쉽다는 것을 직접적으로 결정합니다.
사용자 및 시장 인지도
GitHub에 있는 약 9,000개의 별과 772개의 포크는 Dolphin이 개발자의 상당한 관심을 받았음을 나타냅니다. 문서 구문 분석의 오픈 소스 모델의 경우 이 크기는 실험실 내의 임시 프로젝트가 아니라 실제 팀에서 시험하고 다시 통합할 도구 체인 구성 요소임을 보여주기에 충분합니다.
사용자 및 시장 인지도: 관계자는 ACL 논문 Hugging Face 모델 카드와 데모도 동시에 출시했는데, 이는 연구원과 엔지니어링 팀 모두를 대상으로 한다는 의미입니다. 특히 문서 디지털화, 지식 기반 정리, 청구서/보고서 처리를 수행하는 팀의 경우 JSON/Markdown을 구현할 수 있는 이러한 유형의 모델은 단순히 텍스트를 인식하는 것보다 더 실용적입니다.
공개 확인: "모든 상용 OCR 제품군을 대체한다"고 해석한다면 이는 분명히 너무 많은 것입니다. 하지만 오픈 소스 문서 분석 플랫폼의 핵심 엔진으로 자리매김한다면 공식적인 기능 경계는 신뢰할 수 있습니다.
숨겨진 이점: 전체 페이지의 일반 텍스트만 반환하는 OCR과 비교할 때 Dolphin의 구조화된 출력은 후처리 규칙 및 수동 정리 비용을 크게 줄일 수 있으며 이는 긴 문서, 표 및 수식 시나리오에서 특히 분명합니다.
비용 이점
무료에 대한 진실: Dolphin은 오픈 소스이며 무료이지만 무료라고 해서 임계값이 낮다는 의미는 아닙니다. v2가 3B로 업그레이드되면 효과는 더욱 강력해지지만 추론 리소스, 모델 다운로드 및 배포의 복잡성도 증가합니다. 가벼운 OCR만 수행하는 팀의 경우 실제 비교는 라이선스 가격이 아닌 "총 시스템 비용"입니다.
| 비용 계층 | 공개 | 실제로 의미하는 것 |
|---|---|---|
| C측/개인 | 독립적인 소비자 제품 없음 | 일반 사용자 앱보다 R&D 구성 요소에 더 가깝습니다 |
| 개발자/API | 오픈 소스이며 무료이며 직접 배포 가능 | 비용은 컴퓨팅 성능, 모델 다운로드, 추론 프레임워크 및 유지 관리에 있습니다 |
| 기업 | 공공 상업 패키지 없음 | 프로덕션에 들어가면 권한, 감사, 유연성 및 SLA를 직접 완료해야 합니다 |
숨겨진 비용: 첫 번째는 모델 및 추론 프레임워크 선택입니다. vLLM, TensorRT-LLM 및 Transformers 솔루션에는 각각 엔지니어링 상충관계가 있습니다. 두 번째는 문서 전처리 비용이다. 낮은 이미지 품질, 회전, 그림자 및 다국어 혼합으로 인해 오류가 증폭됩니다. 세 번째는 다운스트림 스키마 정렬입니다. 구조를 식별할 수 있다고 해서 이를 비즈니스 시스템에 직접 손실 없이 작성할 수 있다는 의미는 아닙니다.
숨겨진 이점: 회사가 여전히 "전체 텍스트의 OCR 인식 + 여러 규칙의 하드 철거"라는 기존 방법을 사용하고 있다면 Dolphin과 같은 구조화된 모델은 규칙 유지 관리 및 수동 재작업 비용을 가장 절약할 수 있습니다.
주요 기능
- 2단계 문서 구문 분석: 먼저 분류하고 레이아웃 분석을 수행한 다음 요소별 또는 전체 페이지별로 내용을 구문 분석합니다.
- 읽기 순서 예측: 요소를 식별할 뿐만 아니라 Markdown 출력에 특히 중요한 자연스러운 읽기 순서를 복원하려고 시도합니다.
- 다중 세분성 분석: 페이지 수준 및 요소 수준 처리 방법을 지원합니다.
- 복잡한 요소 추출: 텍스트, 표, 수식, 코드 및 기타 요소를 포괄합니다.
- 다중 페이지 PDF 지원: 공식 변경 로그에 다중 페이지 PDF 구문 분석 기능이 공개되었습니다.
- 추론 가속 적응: vLLM, TensorRT-LLM 등을 지원한다는 것은 순수한 종이 복제가 아닌 실제 배포를 지향한다는 것을 나타냅니다.
전문가의 관점: 여기서 가장 중요한 숨겨진 연결은 "레이아웃 -> 요소 클리핑 -> 특수 프롬프트 단어 분석"입니다. 이는 서로 다른 요소가 더 이상 동일한 구문 분석 톤 및 출력 템플릿을 공유하지 않음을 의미하며, 이는 복잡한 문서의 품질을 향상시키는 핵심 소스입니다.
모델 및 버전의 진화
초기 단계
Dolphin 1.0: 2025-05-20 사전 학습 모델 및 추론 코드가 공개되어 오픈 소스 진입이 확립되었습니다.
경량화 강화 단계
Dolphin-1.5: 2025-10-16 0.3B 아키텍처를 유지하면서 구문 분석 성능을 개선하여 팀이 먼저 "경량 사용성"을 다듬었음을 나타냅니다.
역량 확장 단계
Dolphin-v2: 2025년 12월 12일에 3B로 업그레이드되어 21개의 새로운 요소 감지, 속성 추출, 사진 문서 기능, 수식 및 코드 특수 분석이 추가되었습니다. 이는 '가벼움과 실용성'부터 '더 일반적이고 강한 구조'까지 핵심 버전이다.
현재 제한사항: 웨어하우스에는 GitHub 릴리스 메커니즘이 없으며 버전 발전은 README 변경 로그에 더 많이 의존합니다. 맹목적으로 마스터를 따르는 것보다 액세스하기 전에 커밋이나 분기를 고정하는 데 적합합니다.
기술적인 장점
ByteDance Dolphin은 [RAG/지식베이스/데이터센터]와 문서파싱 기본 구성요소의 크로스형입니다. 여기서는 주요 전달 형식인 "문서 구문 분석 인프라"를 기준으로 평가됩니다.
데이터 경계: 공식에서는 디지털 문서와 사진 문서를 모두 명확하게 고려하여 PDF 텍스트 레이어에만 초점을 맞추는 것이 아니라 보다 복잡한 실제 문서 이미지도 대상으로 한다는 것을 나타냅니다. 장점은 스캔한 문서와 사진을 찍은 문서를 처리할 수 있다는 것입니다. 한계는 극도의 흐림, 심각한 원근 왜곡 및 저해상도 스캔으로 인해 여전히 심각한 품질 손실이 발생한다는 것입니다.
고충점 상기하기: 문서 구문 분석의 실제 어려움은 문자 인식뿐만 아니라 다국어 혼합, 전문 용어, 표 분산, 중첩된 수식 및 레이아웃 나누기입니다. Dolphin은 이러한 섹션에서 기존 OCR보다 강력하지만 일단 RAG 또는 지식 기반 링크에 들어가면 하이브리드 검색, 메타데이터 필터링, 페이지 수준 및 요소 수준 혼합 청크를 사용하여 검색 편향을 줄이는 것이 좋습니다.
보안 규정 준수: 공식 공용 웨어하우스에서는 RBAC, 테넌트 격리, 데이터가 보조 교육에 사용되는지 여부 등의 기업 거버넌스 정보를 공개하지 않습니다. 오픈소스 자체 배포의 가장 큰 이점은 데이터를 제어할 수 있다는 점이지만, 이러한 거버넌스 기능을 직접 보완해야 한다는 점이 가장 큰 비용입니다.
사용방법
공식 저장소는 핵심 설치 및 추론 경로를 제공했습니다.
``배쉬 자식 클론 https://github.com/ByteDance/Dolphin.git CD돌고래 pip 설치 -r 요구사항.txt 자식 lfs 설치 자식 클론 https://huggingface.co/ByteDance/Dolphin-v2 ./hf_model 파이썬 데모_페이지.py --model_path ./hf_model --save_dir ./results --input_path ./demo/page_imgs/page_1.png
**입구 설명**:
| 사용 방법 | 누구에게 적합 | 지침 |
|---|---|---|
| `demo_page.py` | 전체 페이지 구문 분석을 수행하는 팀 | 페이지 수준 구조 결과 직접 출력 |
| `demo_element.py` | 정밀한 요소 추출을 수행하는 팀 | 표, 수식, 코드의 별도 처리에 적합 |
| `demo_layout.py` | 레이아웃 이해 및 사전 분석을 수행하는 팀 | 사전 레이아웃 진단에 적합 |
**인간-컴퓨터 협업의 경계**: 일괄 추출은 자동화될 수 있지만 온라인에 접속하기 전에 여전히 중요한 계약서, 의료 문서, 재무제표 및 복잡한 학술 PDF를 사람이 검토해야 하며 테이블 정렬, 누락된 수식 및 깨진 페이지 간 관계에 중점을 두어야 합니다.
## 제품 가격
기성품 SaaS가 아닌 오픈 소스 모델이기 때문에 공개 가격이 존재하지 않습니다.
**C면/개인** : 일반 사용자를 위한 구매입구가 없습니다.
**개발자/API**: 가장 중요한 비용은 모델 다운로드, 추론 배포, 그래픽 메모리 및 처리량 최적화입니다.
**기업**: 내부 분석 플랫폼을 구축하려면 추론 비용 외에 권한, 캐싱, 작업 대기열, 결과 확인, 로그 관리도 포함해야 합니다.
**자유로운 진실**: 오픈 소스는 시스템 비용이 아닌 라이선스 비용을 절약해 줍니다. 문서 구문 분석이 프로덕션에 도달하면 컴퓨팅 성능과 데이터 관리는 결코 우회되지 않습니다.
## 애플리케이션 시나리오
- **지식 기반 사전 처리**: 먼저 PDF, 보고서 및 논문을 구성한 다음 검색 및 Q&A 링크로 보냅니다.
- **학술 문서 및 공식 분석**: 공식, 표 및 텍스트가 혼합된 과학 연구 자료에 특히 적합합니다.
- **기업 문서 디지털화**: 계약서, 기술 문서, 비즈니스 보고서를 체계적으로 추출합니다.
- **다중 페이지 PDF 일괄 처리**: 대량의 기록 문서를 색인화할 수 있고 다운스트림에서 사용할 수 있는 구조화된 데이터로 변환합니다.
**차원성 감소 공격 시나리오**: 팀이 테이블, 수식 및 읽기 순서 문제로 인해 기존 OCR로 인해 심각한 어려움을 겪었을 때 이를 사용하면 구조적 품질이 매우 명백하게 향상됩니다.
**현재 제한 사항**: 비즈니스에 일반 티켓 OCR 또는 단일 열 문서 텍스트 추출만 필요한 경우 엔지니어링 복잡성이 더 높기 때문에 반드시 가장 비용 효율적인 옵션이 아닐 수도 있습니다.
## 해당자
- **지식베이스/RAG를 작업하는 플랫폼 팀**: 고품질 문서 전처리가 필요합니다.
- **Document AI 제품팀**: OCR을 일반 텍스트 인식에서 구조 이해로 업그레이드하고 싶습니다.
- **연구교육팀**: 논문, 교과서, 시험지, 공식이 포함된 자료를 다룰 때 더욱 가치가 높습니다.
**설득 시나리오**:
- **단지 낮은 장벽의 사용을 원하는 사람들**: 기성품 SaaS가 아닌 모델 구성 요소에 가깝습니다.
- **GPU 또는 모델 배포 경험이 없는 팀**: 배포 및 가속 구성은 많은 장벽을 가져올 것입니다.
- **"범용적이고 오류가 없는 OCR" 팀이라고 생각하세요**: 복잡한 문서 구문 분석에는 여전히 무작위 검사와 다운스트림 수정이 필요합니다.
## 요약 및 전망
ByteDance Dolphin의 경쟁력은 문서 이해를 "전체 페이지 활용 능력"에서 "구조 우선, 내용 나중에"로 발전시키는 능력에 있습니다. 이는 지식 기반, 기업 문서 및 연구 자료 처리에 매우 중요합니다. 왜냐하면 다운스트림 유용성을 실제로 결정하는 것은 문자 정확도가 아니라 표, 수식, 코드 블록 및 읽기 순서가 그대로 유지되는지 여부이기 때문입니다.
[조달/채택 위험성 평가]: 채택 전 평가해야 할 가장 중요한 것은 목록 점수만 보는 것이 아니라 문서 유형입니다. 많은 수의 문서가 복잡한 학술 PDF, 여러 페이지로 구성된 보고서, 혼합 표 및 수식인 경우 Dolphin은 가치가 있습니다. 단순한 텍스트 OCR인 경우 "용량 과잉 및 엔지니어링" 문제가 발생할 수 있습니다. 앞으로도 계속해서 관찰할 가치가 있는 것은 v2의 후속 추론 가속화 생태계, 촬영된 문서의 안정성, 스키마 표준화 및 기업 거버넌스를 둘러싼 커뮤니티의 보충 속도입니다.
버전 정보
- 돌고래-v2 :공식 창고 변경 로그에 공개된 최신 메인라인 버전은 3B 매개변수로 업그레이드되어 21가지 유형의 요소 감지, 속성 필드 추출, 특수 수식 및 코드 분석, 더욱 강력한 사진 문서 처리 기능이 추가되었습니다.
- 돌고래-1.5 :0.3B 경량 아키텍처를 유지하면서 파싱 효과를 획기적으로 향상시키는 것은 첫 번째 버전에서 실용화로 넘어가는 데 있어 중요한 노드이다.
- 돌고래 1.0 :관계자는 사전 훈련 모델과 추론 코드를 처음으로 공개해 문서 분석을 위한 완전한 오픈소스 입구를 구축했다.
사용자 후기