Форк FreeToken: бенчмарки MoE-оффлоадинга и MTP на 2x RTX 3090¶
5.0/10
Разработчик представил форк edge-движка FreeToken для оффлоадинга MoE на хост-память, добавив поддержку DeepSeek-V4.1, vision-входов и спекулятивного декодирования (MTP draft head). Тестирование на 2x RTX 3090 (TP=2) и AMD EPYC 7203P с моделью nvidia/Qwen3.8-Flash-Next-NVFP4 (512 экспертов, FTW) показало скорость генерации 48.0 tok/s avg (52.4 tok/s median) в greedy-режиме без спекуляции. Включение MTP привело к падению производительности до 21.5 tok/s avg при коэффициенте принятия токенов ~56%, поскольку базовый путь без спекуляции использует CUDA-графы, а изолированный verify-граф ускорял MTP-путь лишь с 16 до 28 tok/s.
Механизм оптимизации¶
Форк движка FreeToken реализует спекулятивное декодирование через голову черновика MTP (встроенную или внешнюю) с семплированием с отклонением, фиксацией подтвержденного префикса без повторного расширения контекста и опциональным объединением раундов в цепочку. Формат весов FTW упаковывает вспомогательные таблицы (PLE/Engram) и голову MTP с поддержкой разбиения по тензорному параллелизму и опционального all-reduce в FP8. Для оптимизации шага верификации задействованы специализированные CUDA-графы под конкретные размеры батча, снижающие накладные расходы при совместном исполнении вычислений на CPU и GPU.
Показатели эффективности¶
В режиме без CUDA-графов спекулятивное декодирование обеспечило ускорение ~1.5x (17.2 против 11.4 tok/s), однако на текущем этапе конвейер с MTP уступает стандартному выполнению с графами (21.5 против 48.0 tok/s).