Перейти к содержанию

DeepSeek V4 Flash 0731: быстрый и дешёвый LLM для кода и документов

7.0/10

На странице результатов ARC Prize появился DeepSeek V4 Flash 0731 — обновлённая версия быстрой модели DeepSeek V4 Flash, отличающаяся от более раннего «превью» примерно на два месяца. Пользователи описывают её как достаточно качественную для широкого круга задач, включая программирование, отладку и анализ загруженных документов и данных. Главный акцент делается на высокой скорости вывода и низкой стоимости использования. При этом часть пользователей сообщает о проблемах: бесконечных циклах, самообщении модели без выполнения tool-calls и неожиданных тематических переходах.

Контекст

DeepSeek V4 Flash 0731 — официальный релиз модели DeepSeek-V4-Flash, пришедший на смену более ранней preview-версии и получивший заметно улучшенные агентные возможности. Модель представлена на ARC Prize, где оценивается способность LLM решать новые абстрактные задачи, а не только воспроизводить заученные паттерны. Согласно верифицированным результатам ARC Prize, DeepSeek V4 Flash 0731 набрал 89,0% на ARC-AGI-1 Semi-Private при стоимости $0,02 за задачу и 61,4% на ARC-AGI-2 Semi-Private при $0,04 за задачу.

Влияние

Для разработчиков и агентов, чувствительных к затратам, DeepSeek V4 Flash 0731 предлагает очень низкую цену API — от $0,09 за миллион входных токенов и $0,18 за миллион выходных — при контексте 1 048 576 токенов, что делает его экономически привлекательной альтернативой более дорогим моделям для отладки, анализа документов и длительных агентских сессий. Однако пользовательские сообщения об обрывах выполнения, зацикливании и некорректных вызовах инструментов означают, что для production-пайплайнов пока нужны дополнительные проверки и контроль качества.

Обсуждение

В комментариях модель хвалят за скорость, низкую цену и полезность для отладки и анализа документов; один пользователь сообщает примерно 8 тыс. ток/с на prefill и 250 ток/с на одном потоке при локальном запуске на двух RTX Pro 6000 Blackwell. Другие отмечают нестабильность в агентских сценариях: бесконечные циклы, отсутствие tool-calls и нерелевантные ответы.

Проверка фактов

Утверждение о существовании именно выпуска DeepSeek V4 Flash 0731, отличного от более раннего preview, подтверждается страницей модели на Hugging Face и обзором byteiota. Заявление о резком улучшении агентных результатов частично подтверждается byteiota: DeepSWE вырос с 7,3 до 54,4, Terminal Bench 2.1 — с 61,8 до 82,7, а заявленная скорость вывода составляет 122,7 токена в секунду; Artificial Analysis также фиксирует высокую скорость около 102 токенов в секунду для варианта Reasoning/Max Effort. Личные показатели из комментариев, такие как ~8k токенов/с prefill и ~250 токенов/с на 2x RTX Pro 6000 Blackwell, независимыми источниками не подтверждены.

Детали

Комментаторы подчёркивают, что речь идёт именно о выпуске от 31 июля, а не о более ранней preview-версии DeepSeek V4 Flash. Один из пользователей сообщает, что обновлённая версия ощущается как заметный качественный скачок по сравнению с preview. В качестве практического примера приводится работа в Oh My Pi с двумя экземплярами модели и 5–6 активными сессиями, где расходы составляют около 5 долларов в день. Упоминается также временное удвоение лимитов в OpenCode Go, что делает использование ещё дешевле. Среди проблем выделяются сбои в агентской работе: модель может зацикливаться, «говорить сама с собой» вместо вызова инструментов и внезапно переходить к нерелевантным темам.

Источники