Nvidia анонсирует Nemotron 3.5 Lightning и NeMo Switchyard¶
7.0/10
Nvidia представила семейство моделей Nemotron 3.5 Lightning и открытую библиотеку маршрутизации NeMo Switchyard. Lightning-модели ориентированы на высокую скорость инференса, а Switchyard должен автоматически направлять запросы к наиболее подходящей модели. В анонсе подчёркивается работа на системах RTX и DGX, однако технические детали ограничены. Сообщество отмечает, что MoE-модели, включая Nemotron 3.5 Lightning, показывают плохие результаты в сложных задачах, несмотря на высокую скорость. Дата выхода и точные характеристики моделей в доступном материале не указаны.
Контекст¶
NVIDIA представила открытую модель Nemotron 3.5 Lightning — это mixture-of-experts (MoE) модель с 30 млрд параметров, из которых активны только 3 млрд на каждый токен. Такая архитектура позволяет получить скорость генерации до 4 раз выше по сравнению с моделями аналогичного размера, сохраняя при этом качество, близкое к более крупным моделям. Одновременно компания анонсировала NeMo Switchyard — открытую библиотеку для маршрутизации запросов между моделями, которая поддерживает форматы OpenAI Chat Completions, OpenAI Responses и Anthropic Messages. Switchyard предназначен для автоматического выбора наиболее подходящей модели для каждого шага работы агента или запроса API-клиента.
Влияние¶
Для разработчиков, использующих небольшие локальные модели, Nemotron 3.5 Lightning может оказаться привлекательным из-за скорости, но низкое качество на сложных задачах ограничит его применение. NeMo Switchyard потенциально упрощает управление несколькими моделями, но вопросы с кэшированием промптов остаются нерешёнными.
Обсуждение в сообществе¶
Пользователи сообщают, что MoE-модели, включая Nemotron 3.5 Lightning, плохо справляются с задачами вроде создания коллаборативной доски, хотя работают быстро. Также поднимается вопрос о том, как маршрутизатор обрабатывает кэширование промптов при повторных запросах, и критикуется отсутствие моделей Qwen в сравнительных графиках Nvidia.