Разработчик добавил базовое зрение DeepSeek V4 Flash через 40M коннектор¶
7.0/10
Разработчик показал эксперимент по добавлению базовых возможностей зрения к текстовой MoE-модели DeepSeek V4 Flash без переобучения самого языкового модели. Для этого были заморожены DeepSeek V4 Flash с 284B общих и 13B активных параметров и 417M-параметровый энкодер изображений MoonViT-3d из Kimi K2.6, а между ними обучен новый коннектор на 40,1M параметров. Обучение проводилось на 100 000 пар «изображение — текст», после чего итоговая модель в формате NVFP4 запускалась на четырёх GPU B200 в модифицированном стеке SGLang и отвечала на реальные запросы по изображениям. Автор подчёркивает, что это пилотный проект, а не готовый к продакшену VLM. Веса и связанные варианты модели опубликованы на Hugging Face.
Контекст¶
DeepSeek V4 Flash — это открытая MoE-модель DeepSeek с 284 млрд общих параметров и 13 млрд активных параметров, входящая в preview-семейство V4. В мультимодальных системах замороженные LLM и энкодер изображений можно соединять небольшим обучаемым коннектором, чтобы добавить базовое восприятие изображений без полного переобучения языковой модели.
Значение¶
Эксперимент демонстрирует, что базовую мультимодальность можно добавить к крупной текстовой MoE-модели относительно дешёвым обучением небольшого коннектора при замороженных LLM и энкодере. Однако результат остаётся исследовательским прототипом, а не полноценной заменой нативной мультимодальной модели.
Обсуждение сообщества¶
Комментаторы высоко оценили проделанную работу и интерес к технической реализации, но отметили, что подобные усилия могут быть избыточны, если DeepSeek сама выпустит модель с нативной поддержкой изображений. Также прозвучало мнение, что без полноценного пост-тренинга такой адаптер вряд ли сравняется по качеству с изначально мультимодальной системой.
Проверка фактов¶
Утверждение о том, что DeepSeek V4 Flash имеет архитектуру 284B общих параметров при 13B активных параметрах MoE, подтверждается независимыми источниками DataLearner и MorphLLM. Также подтверждается существование варианта DeepSeek V4 Flash 0731 с сохранением той же архитектуры 284B/13B, согласно AI Tools Recap. Заявленные автором параметры MoonViT-3d (417M), размер коннектора (40.1M), объём обучающей выборки (100K) и использование четырёх B200 в предоставленных результатах независимо не проверены.