Перейти к содержанию

Вынос draft-модели спекулятивного декодирования из DGX Spark по TCP/RDMA для экономии VRAM

4.0/10

Разработчик представил модификацию для vLLM (совместимую с eugr-vllm), позволяющую вынести черновую (draft) модель спекулятивного декодирования с узлов DGX Spark на отдельный внешний GPU емкостью 10–24 ГБ по протоколам TCP или RDMA. Решение направлено на высвобождение дефицитной видеопамяти на основном ускорителе DGX Spark для расширения контекстного окна или использования более точных форматов квантования. Эмпирические замеры пропускной способности (tok/s) и задержек в исходном отчете не приводятся.

Механизм распределенного спекулятивного декодирования

Технический механизм заключается в выносе (offloading) драфт-модели спекулятивного декодирования с основной системы DGX Spark на отдельный внешний GPU с 10–24 ГБ памяти через сетевой транспорт TCP или RDMA. Модификация для движка vLLM разделяет конвейер генерации, организуя удаленное создание драфт-токенов с последующей их верификацией целевой моделью на первичном ускорителе. За счет разгрузки локальной памяти освободившийся объем VRAM перенаправляется на увеличение контекстного окна либо на использование более точных форматов квантования.

Влияние на эффективность

Перенос draft-модели утилизирует внешний потребительский GPU на 10–24 ГБ, освобождая сопоставимый объем VRAM на основном кластере DGX Spark под увеличение KV-кэша или повышение разрядности весов.

Источники