DeepSeek 오픈 소스 OCR-2: "시각적 인과 흐름"으로 긴 문서를 다시 이해

DeepSeek은 GitHub에서 차세대 오픈 소스 OCR 모델 DeepSeek-OCR-2를 출시했습니다. Apache-2.0 프로토콜에 따라 오픈 소스로 제공됩니다. 기술 솔루션은 "시각적 인과 흐름"을 채택하고 있으며 긴 문서 OCR 및 복잡한 레이아웃 인식에서 1세대보다 뛰어납니다. 1세대 프로젝트는 약 23,700개의 별을 받았습니다.

대형 모델 군비 경쟁의 번잡함에서 벗어나 DeepSeek은 로우키 오픈소스를 사용하여 생산에 가장 가까운 지상 전장인 "문서 지능"에 다시 관심을 끌었습니다. DeepSeek-OCR-2는 2월 3일 GitHub에서 출시되었으며 Apache-2.0 프로토콜에 따라 오픈 소스로 제공됩니다. 기술 키워드는 "시각적 인과 흐름(Visual Causal Flow)"입니다. 이는 시각적 정보의 보다 효율적인 인과 모델링 및 압축을 위한 새로운 솔루션입니다.

'광학적인 압축'에서 '인과적 흐름'으로

1세대 DeepSeek-OCR의 기술적 하이라이트는 오픈 소스 이후 약 23,700 별표와 2,187 포크를 받은 "컨텍스트 광학 압축"입니다. 현재 가장 인기 있는 OCR 오픈 소스 프로젝트 중 하나입니다. 2세대는 시각적 정보의 보다 효율적인 인과 모델링 및 압축을 강조하고 긴 문서 OCR 및 복잡한 레이아웃 인식과 같은 시나리오에서 더 나은 성능을 발휘하는 등 이를 기반으로 발전했습니다. 2026년 중반 현재 창고에는 약 3,200개의 별이 축적되었으며 계속해서 반복되고 있습니다.

오픈소스는 단편적인 행동이 아니라 기술 스택이다

지난 1년 동안 DeepSeek의 오픈 소스 활동을 살펴보면 OCR은 퍼즐의 한 조각에 불과합니다. 추론 인프라 측면에서 DeepEP(전문가 병렬 통신), DeepGEMM(GPU BLAS 커널), FlashMLA(다중 헤드 잠재적 주의 커널) 및 3FS(AI 교육/추론 분산 파일 시스템)가 전체 "알고리즘-커널-통신-저장" 링크를 포괄하여 연속적으로 오픈 소스화되었습니다. "중점을 부여할 뿐만 아니라 프로젝트도 제공"하는 이러한 전략은 오픈소스 커뮤니티에서 DeepSeek만의 고유한 신뢰 자산을 구축하고 있습니다.

업계 관점에서 볼 때 OCR은 "오래된 트랙"인 것처럼 보이지만 실제로는 RAG, 문서 인텔리전스 및 다중 모드 구현을 위한 초급 수준 기능입니다. DeepSeek은 느슨한 상용 라이센스가 아닌 Apache-2.0 프로토콜에 따라 오픈 소스로 제공되므로 생태학적 영향을 유지할 뿐만 아니라 상용 폐쇄 소스의 여지도 남습니다. DeepSeek-OCR-2는 문서 분석, 지식 기반, 청구서 인식을 수행하는 국내 팀에게 직접 상용화가 가능한 중국 시나리오 친화적인 기반을 제공합니다. 이는 긴 중국 문서에서 실패하는 많은 해외 ​​OCR 모델의 단점이 바로 그것입니다.

앞으로 추적할 가치가 있는 몇 가지 방향은 다음과 같습니다.

  1. 중국 장문 문서 벤치마크에서 DeepSeek-OCR-2의 성능: 공식은 전체 벤치마크를 공개하지 않았으며 커뮤니티 테스트가 품질을 판단하는 열쇠입니다.
  2. 다중 모드 모델(Qwen2.5-VL 등)과의 협업: OCR과 시각적 언어 모델 간의 경계가 모호해지고 있습니다. DeepSeek은 이러한 추세를 활용하여 VLM을 지원하는 제품을 출시할 것입니다.
  3. "시각적 인과 흐름"이 비디오 이해에까지 영향을 미칠 수 있습니까: 시간 차원에서 동일한 인과 모델링 아이디어 세트의 확장은 관찰할 가치가 있습니다.
  4. 오픈 소스 계약 및 상용화 균형: Apache-2.0이 향후 더욱 엄격한 조건을 도입할지 여부는 기업 채택 결정에 영향을 미칩니다.
저작권: 콘텐츠 출처 DeepSeek GitHub 공식 저장소 . 이 플랫폼은 정보 제공 및 학습 교류를 목적으로 콘텐츠를 편집 및 정리했습니다. 저작권 문제가 있으시면 연락해 주세요.

후기

  • 후기를 불러오는 중...