Релиз модели DeepSeek-V4.1-Flash с архитектурой на 552 млрд параметров¶
8.0/10
Компания DeepSeek выпустила языковую модель с открытыми весами DeepSeek-V4.1-Flash вместе с подробным техническим отчетом. Новая версия была значительно масштабирована до 552 миллиардов параметров по сравнению с 284 миллиардами у исходной V4 Flash, что обеспечило прирост результатов в бенчмарках и улучшение системы кэширования контекста. Разработчики сделали акцент на высокой архитектурной эффективности и низких ценах на API, где стоимость обращения к кэшированному контексту снизилась до 0,003 доллара за миллион токенов. Публикация полноценной документации с описанием архитектурных решений выделяется на фоне менее прозрачных системных карт конкурентов.
Контекст¶
DeepSeek — китайская исследовательская компания в области искусственного интеллекта, известная разработкой моделей с открытыми весами и публичной технической документацией. Линейка моделей Flash создается с акцентом на высокую скорость инференса, оптимизацию кэширования контекста и снижение стоимости вычислений при сохранении производительности.
Влияние на разработку¶
Увеличение объема модели до 552 миллиардов параметров значительно повышает требования к оборудованию для локального запуска, однако ультранизкая стоимость кэшированного контекста в API кардинально снижает затраты на работу с длинными кодовыми базами.
Обсуждение в сообществе¶
Пользователи высоко оценили инженерную открытость технического отчета и выгоду от ценообразования кэша, хотя некоторые отметили, что модель на 552 миллиарда параметров трудно относить к легким решениям линейки Flash.
Покрытие источниками¶
Проверяются выбранные ключевые утверждения, а не истинность всей статьи целиком.
-
Только данные автора или производителя
Релиз модели DeepSeek-V4.1-Flash с архитектурой на 552 млрд параметров
-
Только данные автора или производителя
стоимость обращения к кэшированному контексту снизилась до 0,003 доллара за миллион токенов.