Перейти к содержанию

DeepSeek выпускает экспериментальную модель с поддержкой зрения для API

8.0/10

DeepSeek представила экспериментальную модель DeepSeek-V4-Flash-Vision-Exp, которая добавляет нативную поддержку зрения в API, закрывая давний пробел для разработчиков. Модель автоматически изменяет размер изображений перед инференсом: изображения с общим числом пикселей ниже примерно 384×384 масштабируются вверх, а более крупные — вниз до примерно 800×800, сохраняя пропорции. Токены, генерируемые из изображений, тарифицируются вместе с текстовыми токенами. Это обновление позволяет обрабатывать скриншоты и выполнять OCR, что ранее было невозможно для моделей DeepSeek. Анонс сопровождается бенчмарками, опубликованными в новостном разделе документации API.

Контекст

Ранее модели DeepSeek, включая версию V4 Flash 0731, не имели реальных возможностей зрения, но часто ошибочно предполагали, что могут видеть изображения, и пытались использовать вымышленные инструменты для анализа, что приводило к сбоям в сессиях. Это было существенным ограничением для разработчиков, работающих с Playwright-скриншотами и другими визуальными данными. Новая экспериментальная модель решает эту проблему, добавляя настоящую мультимодальную функциональность.

Влияние

Разработчики, использующие DeepSeek API для автоматизации с визуальным контролем, теперь могут обрабатывать скриншоты и изображения без необходимости во внешних OCR-инструментах, что упрощает рабочие процессы и снижает затраты на интеграцию. Однако разрешение около 800×800 может быть недостаточным для точного OCR на полных страницах формата A4 или Letter, что требует дополнительного масштабирования или предварительной обработки.

Обсуждение в сообществе

Пользователи в целом позитивно оценили обновление, отметив, что это решает давнюю проблему с чтением скриншотов Playwright, но выразили обеспокоенность по поводу ограниченного разрешения для OCR. Некоторые также заметили значительное улучшение бенчмарков DeepSWE на 4 пункта по сравнению с предыдущей версией, что вызвало удивление и интерес.

Покрытие источниками

Проверяются выбранные ключевые утверждения, а не истинность всей статьи целиком.

  1. Недостаточное покрытие источниками

    DeepSeek выпускает экспериментальную модель с поддержкой зрения для API

  2. Значение зафиксировано прямым источником

    Модель автоматически изменяет размер изображений перед инференсом: изображения с общим числом пикселей ниже примерно 384×384 масштабируются вверх, а более крупные — вниз до примерно 800×800, сохраняя пропорции.

  3. Предварительно: новость слишком свежая

    Новая экспериментальная модель решает эту проблему, добавляя настоящую мультимодальную функциональность.

    • api-docs.deepseek.com · подтверждает · первоисточник
    • forbes.ru · контекст · независимая публикация
    • scbioethics.ru · контекст · независимая публикация
    • forbes.ru · контекст · независимая публикация
    • systems-analysis.ru · контекст · независимая публикация