Перейти к содержанию

Поддержка спекулятивного декодирования DFlash для HunyuanOCR в llama.cpp b11103

5.0/10

В релизе llama.cpp b11103 добавлена поддержка спекулятивного декодирования DFlash для моделей HunyuanOCR и HunyuanVL. Для этого в вычислительный граф архитектуры hunyuan-dense были интегрированы точки перехвата входных тензоров слоев остаточного потока (res->t_layer_inp[il]), необходимые черновой модели для сборки кросс-контекста. Разработчики также исправили скрипт конвертации GGUF, устранив сбои при обработке словаря и параметров pad_token_id для HunyuanOCR v1.0 и 1.5. На контрольных тестах tencent/HunyuanOCR 1.5 с черновым спекулятивным графом коэффициент принятия токенов составил ~0.5 при сохранении побайтово идентичного результата.

Механизм спекулятивного декодирования DFlash

Для интеграции спекулятивного декодирования DFlash в вычислительный граф HunyuanVL/HunyuanOCR были добавлены точки съема тензоров остаточного потока (residual stream) на входе в каждый слой (`t_layer_inp[il]`), формирующие кросс-контекст для диффузионной драфт-модели. Драфт считывает эти скрытые активации строго в соответствии со списком слоев из метаданных `target_layers`, сохраняя вычислительный граф неизменным в штатном режиме инференса и гарантируя побайтовую идентичность результатов генерации целевой модели. Дополнительно в скриптах конвертации GGUF было изолировано наследование словаря и параметров конфигурации (`hparams`), что устранило конфликты идентификаторов специальных токенов между архитектурой Hunyuan и драфт-моделью.

Показатели эффективности

Достигнутый коэффициент принятия предсказаний на уровне ~0.5 существенно сокращает число полных прямых проходов тяжелой целевой модели при инференсе задач OCR без потери точности.

Источники