Der DeepSeek-Bilderkennungsmodus wird offiziell eingeführt: ein wichtiger Schritt zur Produktisierung multimodaler Funktionen
Der Bilderkennungsmodus von DeepSeek wird offiziell im Web und in der App eingeführt und nutzt das Thinking with Visual Primitives-Framework sowie den „Quick Mode“ und den „Expert Mode“ und markiert damit den Übergang multimodaler Fähigkeiten von Forschung und Entwicklung zur Produktisierung.
Der multimodale DeepSeek-Forscher Xiaokang Chen gab bekannt, dass der Bilderkennungsmodus von DeepSeek offiziell im Web und in der App eingeführt wurde. Dem „Bildlesemodus“ stehen der „Schnellmodus“ und der „Expertenmodus“ gegenüber. Wenn diese Option aktiviert ist, können Benutzer Bilder direkt für DeepSeek hochladen, um visuelle Inhalte zu verstehen. Seine Fähigkeiten gehen über die einfache Textextraktion (OCR) hinaus.