OpenJev: сверхбыстрая классификация через DiffusionGemma и vLLM с шагом денойзинга 73 мс¶
6.0/10
Проект OpenJev воспроизводит API сервиса TypeSafe Jev для быстрой оценки структурированных ответов (multiple-choice) с помощью модели DiffusionGemma и немерженого PR #57250 в движке vLLM. Метод опирается на один шаг денойзинга для одновременного расчета вероятностей вариантов выбора, что кардинально быстрее авторегрессионной генерации флагманских LLM (3–329 с). На потребительской рабочей станции с NVIDIA RTX PRO 6000 решение демонстрирует задержку на GPU порядка ~73 мс и медианную сквозную задержку p50 около 170 мс (по сравнению с 70–500 мс у проприетарного Jev). По замерам автора PR на 8 бенчмарках точность DiffusionGemma составила 198/201 против 191/201 у Jev, подтверждая эффективность одношаговых диффузионных языковых моделей для задач классификации.
Механизм оптимизации¶
Технический механизм основан на отказе от авторегрессионного декодирования в пользу дискретной диффузионной языковой модели DiffusionGemma в среде vLLM. Вместо многошаговой генерации токенов классификация выполняется всего за один шаг денойзинга, при котором модель параллельно рассчитывает распределение вероятностей по фиксированным вариантам ответа для типизированных запросов. Такой подход полностью устраняет вычислительные задержки формирования KV-кэша для выходных токенов, сводя вывод к однопроходной оценке целевых альтернатив.
Прирост эффективности¶
Сокращение аппаратной задержки до ~73 мс на GPU (RTX PRO 6000) и сквозного p50 до ~170 мс позволяет заменить многосекундные цепочки классификации на базе стандартных LLM на легковесный одношаговый инференс без потери точности.