Запуск Qwen 3.8 27B с контекстом 100K на 16 ГБ AMD RX 7800 XT¶
6.0/10
Энтузиаст продемонстрировал конфигурацию llama.cpp с бэкендом Vulkan, позволяющую запускать модель Qwen 3.8 27B в квантовании IQ4_XS с окном контекста 100K токенов на видеокарте AMD RX 7800 XT с 16 ГБ VRAM. За счет асимметричного квантования KV-кэша (q8_0 для ключей и q5_1 для значений) в связке с FlashAttention скорость генерации достигает ~30 токенов/с на этапе декодирования без использования спекулятивного декодирования (MTP). Результат опровергает устоявшееся мнение о невозможности эффективной работы 27B-моделей с длинным контекстом на потребительских 16-гигабайтных графических ускорителях.
Метод оптимизации¶
Оптимизация реализована с помощью компиляции llama.cpp с поддержкой Vulkan (-DGGML_VULKAN=ON) и включения FlashAttention вместе со сжатым KV-кэшем (--cache-type-k q8_0 и --cache-type-v q5_1). Для предотвращения переполнения видеопамяти при достижении лимита в 100 096 токенов применены чекпоинты контекста (--ctx-checkpoints 4, --checkpoint-min-step 8192), системная кэш-память RAM на 4096 МБ и запрет выгрузки мультимодального проектора в VRAM (--no-mmproj-offload).
Прирост эффективности¶
Предложенный пайплайн позволяет полностью уместить рабочие веса 27B-модели и 100K-контекст в рамки 16 ГБ VRAM, поддерживая темп генерации на уровне ~30 токенов/с без необходимости масштабирования кластера до нескольких GPU.