Muse Glimmer 30B разогнали до 1 млн токенов контекста через YaRN на кластере DGX Spark¶
7.0/10
Пользователь Reddit под ником StartupTim сообщил, что запустил новую модель Meta Muse Glimmer 30B на следующий день после релиза и расширил её контекст с обученных 131 072 токенов до 1 млн с помощью YaRN. Тесты проводились на кластере из двух NVIDIA DGX Spark с чипами GB10 и 128 ГБ унифицированной памяти каждый, соединённых напрямую через ConnectX-7, с использованием llama.cpp master, собранной из исходников с поддержкой CUDA sm_121 и GGML_RPC. Для работы применялся официальный GGUF-квант K-Quant-Dynamic размером около 18,3 ГиБ, официальный mmproj для vision-компонентов и официальный DFlash-драфтер для спекулятивного декодирования. Расширение контекста выполнялось флагами --rope-scaling yarn, --rope-scale и --yarn-orig-ctx 131072, а также переопределением muse_glimmer.context_length, поскольку llama.cpp иначе ограничивает длину обученным значением. Автор утверждает, что проверка retrieval на разных глубинах документа прошла успешно, а намёк «131,072+» в карточке модели оказался реальным.
Контекст¶
Muse Glimmer 30B — плотная мультимодельная модель Meta с заявленным контекстом около 128K и оптимизацией под локальные агентские сценарии, а YaRN — метод масштабирования RoPE, позволяющий запускать модель с контекстом длиннее обученного. NVIDIA DGX Spark на чипе GB10 предлагает 128 ГБ унифицированной памяти, но относительно скромную пропускную способность около 273 ГБ/с, что делает её пригодной для размещения больших моделей, но ограничивает скорость генерации токенов.
Значение¶
Результат показывает, что при правильной конфигурации YaRN и достаточной памяти 30B-модель может сохранять работоспособный 1M-контекст на относительно компактном локальном кластере. Однако вывод основан на самостоятельном отчёте пользователя без независимых бенчмарков, поэтому его следует считать предварительным.
Обсуждение сообщества¶
Комментаторы отметили впечатляющий характер результата и попросили сравнить его с Qwen 3.6 27B, а также уточнить, зачем понадобились два узла по 128 ГБ вместо одного. Один из участников подчеркнул, что YaRN за пределами обученного контекста часто деградирует по retrieval, поэтому точная конфигурация представляет практическую ценность.
Проверка фактов¶
Утверждение о том, что YaRN и аналогичные методы расширяют контекстное окно за счёт изменения позиционных эмбеддингов, подтверждается независимыми источниками, описывающими YaRN, ALiBi и интерполяцию позиций как стандартные подходы к удлинению контекста. Описание needle-in-a-haystack как теста на поиск отдельных фактов в «сене» также согласуется с материалами Arize AI и другими источниками. Однако ключевые пользовательские утверждения — что Muse Glimmer 30B прошёл retrieval-тесты на 1M токенов на 2× DGX Spark и что это доказывает надёжность расширения с 131K до 1M — остаются непроверенными, так как предоставленные результаты не содержат независимых бенчмарков или воспроизводимых данных.
Технические детали¶
В настройках использовались --rope-scale со значениями 2, 4 и 8 вместе с --yarn-orig-ctx 131072 и --override-kv muse_glimmer.context_length=int:<N>, что позволяет обойти ограничение llama.cpp на длину контекста. Спекулятивное декодирование включалось через --spec-type draft-dflash и --spec-draft-n-max 15 с блочным диффузионным драфтером DFlash. Автор указывает, что модельный файл Muse-Glimmer-30B-GGUF в динамическом K-Quant занимает примерно 18,3 ГиБ, а для vision-функций подключается официальный mmproj. В качестве повседневной конфигурации на том же железе он использует DeepSeek-V4-Flash-0731 в официальном vLLM с тензорным параллелизмом TP=2 по RDMA и полным 1M-контекстом, что задаёт точку сравнения. Для распределения между двумя DGX Spark применялся GGML_RPC, а не только необходимость в памяти.
Источники
- meta - models / Muse - Glimmer - 30 B | vLLM Recipes
- Personal AI Supercomputer Powered by Blackwell | NVIDIA DGX Spark
- NVIDIA DGX Spark & RTX Spark : does the desktop AI... | Morgann Riu
- The False Promise of Massive Context Windows | by Yusef... | Medium
- Breaking the Context Window: How Recursive Language Models...
- The Needle In a Haystack Test: Evaluating the Performance... - Arize AI