DeepSeek 이미지 인식 모드 공식 출시: 다중 모드 기능의 제품화를 향한 핵심 단계

DeepSeek의 이미지 인식 모드는 "빠른 모드" 및 "전문가 모드"와 함께 Thinking with Visual Primitives 프레임워크를 사용하여 웹과 앱에서 공식적으로 출시되어 연구 개발에서 제품화까지 다중 모드 기능의 전환을 나타냅니다.

DeepSeek 다중 모드 연구원 Xiaokang Chen은 DeepSeek의 이미지 인식 모드가 공식적으로 웹과 앱에 출시되었다고 발표했습니다. "이미지 읽기 모드"는 "빠른 모드"와 "전문가 모드"와 병치됩니다. 활성화하면 사용자는 DeepSeek에 이미지를 직접 업로드하여 시각적 콘텐츠를 이해할 수 있습니다. 그 기능은 단순 텍스트 추출(OCR)을 능가합니다.

DeepSeek 이미지 인식 모드

이 이미지 인식 모드 출시를 위한 기본 기술 프레임워크는 올해 4월 DeepSeek에서 출시한 "Thinking with Visual Primitives" 핵심 프레임워크입니다. 프레임워크의 핵심 아이디어는 단순히 이미지를 텍스트에 엔드투엔드로 매핑하는 것이 아니라 인간처럼 추론하기 위해 모델이 시각적 정보를 "원시적"으로 분해할 수 있도록 하는 것입니다. 이 기술 경로는 국내 다중 모드 모델 중에서 독특합니다.

시각적 기본 프레임워크

이미지 인식 모드의 출시는 DeepSeek이 "순수 텍스트 추론의 왕"에서 "다중 모드 만능 플레이어"로 이동하는 핵심 단계입니다. 이전에 DeepSeek의 핵심 경쟁력은 수학적 추론, 코드 생성 및 긴 텍스트 처리에 중점을 두었으며 시각적 기능은 Doubao와 같은 경쟁 제품과의 경쟁에서 항상 명백한 단점이었습니다.

출시 당일 극적인 에피소드도 있었습니다. The Paper에 따르면 DeepSeek의 이미지 인식 모드는 창립자 Liang Wenfeng의 사진을 정확하게 식별할 수 없었지만 대신 그를 Dong Yuhui, Zhang Xuefeng, 심지어 Lei Jun으로 식별했습니다. Lei Jun의 사진은 정확하게 식별되었습니다. 한 가지 설명은 Liang Wenfeng이 극도로 은밀하게 행동하고 인터넷에 공개된 사진과 정보가 거의 없어 모델이 안정적인 식별 기능을 형성하기 어렵다는 것입니다. 이 "상사를 알지 못함" 우롱차는 DeepSeek이 자신의 상사에 대해 특별한 인식 최적화를 수행하지 않았음을 증명할 뿐입니다. 모델의 얼굴 인식 능력은 내부 권한이 아닌 공개 훈련 데이터의 배포를 기반으로 합니다.

이 이미지 인식 모드의 공식 출시는 V4 시리즈 모델의 전반적인 업그레이드와 결합되어 DeepSeek의 다중 모드 퍼즐을 완성합니다. 앞으로 주목해야 할 점은 실제 장면에서의 시각적 이해 성능이 V4 시리즈의 추론 능력과 동일한 수준에 도달할 수 있을지, V4.1에서 계획 중인 멀티모달 버전과 중복될지 여부이다.

저작권: 콘텐츠 출처 IT 홈 . 이 플랫폼은 정보 제공 및 학습 교류를 목적으로 콘텐츠를 편집 및 정리했습니다. 저작권 문제가 있으시면 연락해 주세요.

후기

  • 후기를 불러오는 중...