DeepSeek 画像認識モードが正式に開始: マルチモーダル機能の製品化に向けた重要なステップ

DeepSeek の画像認識モードは、「クイック モード」および「エキスパート モード」と並んで、Thinking with Visual Primitives フレームワークを使用して、Web およびアプリで正式に開始され、研究開発から製品化へのマルチモーダル機能の移行を示しています。

DeepSeek マルチモーダル研究者の Xiaokang Chen 氏は、DeepSeek の画像認識モードがウェブとアプリで正式に開始されたと発表しました。 「画像読み取りモード」には「クイックモード」と「エキスパートモード」が併設されています。オンにすると、ユーザーは DeepSeek に画像を直接アップロードして、視覚的なコンテンツを理解できるようになります。その機能は単純なテキスト抽出 (OCR) を超えています。

!【DeepSeek画像認識モード】(https://res.aistarmap.com/uploads/images/news/temp/md_6a7066ff7a36e/images/vision-launch-1.png)

この画像認識モードを開始するための基盤となるテクノロジー フレームワークは、今年 4 月に DeepSeek によってリリースされた 「Thinking with Visual Primitives」 コア フレームワークです。このフレームワークの中心となるアイデアは、単に画像をテキストにエンドツーエンドでマッピングするのではなく、モデルが人間と同じように推論のために視覚情報を「プリミティブ」に分解できるようにすることです。このテクニカルなルートは国産マルチモーダルモデルの中でもユニークです。

ビジュアルプリミティブフレームワーク

画像認識モードの開始は、DeepSeek が「純粋なテキスト推論の王様」から「マルチモーダルなオールラウンド プレーヤー」に移行するための重要なステップです。以前、DeepSeek の中核的な競争力は数学的推論、コード生成、長いテキストの処理に重点が置かれており、そのビジュアル機能は Doubao などの競合製品との競争において常に明らかな欠点でした。

発売日には劇的なエピソードもあった。同紙によると、DeepSeekの画像認識モードは創業者の梁文峰氏の写真を正しく識別できなかったが、代わりに同氏を董裕輝氏、張学峰氏、さらには雷軍氏と識別したという。雷軍氏の写真は正確に識別されたという。一つの説明としては、梁文峰は非常に控えめに行動しており、インターネット上に公開されている写真や情報がほとんどないため、モデルが安定した識別特徴を形成することが困難であるということです。この「上司を知らない」ウーロンは、DeepSeek が自身の上司に対して特別な認識の最適化を行っていないことを証明しているだけです。モデルの顔認識能力は、内部権限ではなく、公開トレーニング データの配布に基づいています。

この画像認識モードの正式リリースは、V4 シリーズ モデルの全体的なアップグレードと組み合わされて、DeepSeek のマルチモーダル パズルを完成させます。今後の注目は、実際のシーンでの視覚理解性能がV4シリーズの推論能力と同等のレベルに達することができるのか、またV4.1で予定されているマルチモーダル版と重なるのかどうかである。

著作権:コンテンツソース IT ホーム 。このプラットフォームは、情報提供と学習交流の目的でコンテンツを編集・整理しています。著作権に関する問題がございましたら、お問い合わせください。

レビュー

  • レビューを読み込み中...