DeepSeek выпускает экспериментальную модель с поддержкой зрения для API¶
8.0/10
DeepSeek представила экспериментальную модель DeepSeek-V4-Flash-Vision-Exp, которая добавляет нативную поддержку зрения в API, закрывая давний пробел для разработчиков. Модель автоматически изменяет размер изображений перед инференсом: изображения с общим числом пикселей ниже примерно 384×384 масштабируются вверх, а более крупные — вниз до примерно 800×800, сохраняя пропорции. Токены, генерируемые из изображений, тарифицируются вместе с текстовыми токенами. Это обновление позволяет обрабатывать скриншоты и выполнять OCR, что ранее было невозможно для моделей DeepSeek. Анонс сопровождается бенчмарками, опубликованными в новостном разделе документации API.
Контекст¶
Ранее модели DeepSeek, включая версию V4 Flash 0731, не имели реальных возможностей зрения, но часто ошибочно предполагали, что могут видеть изображения, и пытались использовать вымышленные инструменты для анализа, что приводило к сбоям в сессиях. Это было существенным ограничением для разработчиков, работающих с Playwright-скриншотами и другими визуальными данными. Новая экспериментальная модель решает эту проблему, добавляя настоящую мультимодальную функциональность.
Влияние¶
Разработчики, использующие DeepSeek API для автоматизации с визуальным контролем, теперь могут обрабатывать скриншоты и изображения без необходимости во внешних OCR-инструментах, что упрощает рабочие процессы и снижает затраты на интеграцию. Однако разрешение около 800×800 может быть недостаточным для точного OCR на полных страницах формата A4 или Letter, что требует дополнительного масштабирования или предварительной обработки.
Обсуждение в сообществе¶
Пользователи в целом позитивно оценили обновление, отметив, что это решает давнюю проблему с чтением скриншотов Playwright, но выразили обеспокоенность по поводу ограниченного разрешения для OCR. Некоторые также заметили значительное улучшение бенчмарков DeepSWE на 4 пункта по сравнению с предыдущей версией, что вызвало удивление и интерес.
Покрытие источниками¶
Проверяются выбранные ключевые утверждения, а не истинность всей статьи целиком.
-
Недостаточное покрытие источниками
DeepSeek выпускает экспериментальную модель с поддержкой зрения для API
- api-docs.deepseek.com · подтверждает · первоисточник
-
Значение зафиксировано прямым источником
Модель автоматически изменяет размер изображений перед инференсом: изображения с общим числом пикселей ниже примерно 384×384 масштабируются вверх, а более крупные — вниз до примерно 800×800, сохраняя пропорции.
- api-docs.deepseek.com · подтверждает · первоисточник
-
Предварительно: новость слишком свежая
Новая экспериментальная модель решает эту проблему, добавляя настоящую мультимодальную функциональность.
- api-docs.deepseek.com · подтверждает · первоисточник
- forbes.ru · контекст · независимая публикация
- scbioethics.ru · контекст · независимая публикация
- forbes.ru · контекст · независимая публикация
- systems-analysis.ru · контекст · независимая публикация