Поддержка GLM-5.3-Flash и оптимизация K-pool в релизе llama.cpp b11279¶
4.0/10
В релизе llama.cpp b11279 добавлена архитектурная поддержка модели GLM-5.3-Flash (GLM5-Next), интегрированная с гибридной системой памяти llama-memory-hybrid-idx. Обновление включает механизм кэширования K-pool с сохранением разметки между микробатчами, разреженное внимание Sparse FlashAttention для фазы префилла DSA и общее сокращение размера выделяемых вычислительных буферов. Точные замеры пропускной способности и задержек в описании релиза отсутствуют, однако изменения устраняют деградацию скорости при декодировании длинного контекста и снимают лимит CUDA gridDim.y при n_kv более 262 144 токенов.
Механизмы оптимизации¶
Разметка K-pool теперь фиксируется в памяти и дополняется инкрементально в рамках микробатчей вместо полного сканирования ячеек, а ось пулинга сворачивается в строки перед вычислением softmax во избежание аппаратных ограничений сетки CUDA на сверхдлинных контекстах. Для фазы префилла внедрена разреженная схема FlashAttention, а вычисление шага стримов в multi-stream префилле переведено на размерность токенов, устранив некорректную адресацию голов внимания для моделей без конкатенации RoPE. Также добавлено корректное сохранение и откат рекуррентных состояний сверточных слоев и delta-net через граф build_recurrent_attn.
Эффект для производительности¶
Несмотря на отсутствие опубликованных числовых бенчмарков в MiB и tok/s, устранение принудительного полного пересчета пулов при удалении последовательностей и оптимизация буферов снижают накладные расходы движка при пакетной генерации.