Разгон пропускной способности памяти CMP 170HX до 1,89 ТБ/с ускорил инференс LLM¶
5.0/10
Пользовательский бенчмарк продемонстрировал результаты разгона ускорителя CMP 170HX 40GB, в ходе которого пропускная способность памяти была увеличена с 1386,2 ГБ/с до 1890,1 ГБ/с (+36,4%). При неизменной конфигурации запуск модели Qwen 3.8 27B показал рост скорости генерации токенов со 110 токенов/с до 202 токенов/с. Автор отчета подчеркивает, что заводской потенциал видеокарты значительно занижен, при этом после модификации энергопотребление GPU составило 300 Вт при даже немного более низких температурах.
Метод аппаратной оптимизации¶
Метод заключается в прямом разгоне подсистемы памяти специализированного ускорителя Nvidia CMP 170HX 40GB, что позволило повысить эффективную пропускную способность с 1386,2 ГБ/с до 1890,1 ГБ/с (+36,4%). Поскольку авторегрессионная фаза генерации токенов строго ограничена скоростью считывания весов из памяти (memory bandwidth-bound), ликвидация заводского занижения частот напрямую устраняет аппаратное узкое место. Настройка производилась без изменения конфигурации программного стека при энергопотреблении GPU на уровне 300 Вт со стабильным температурным профилем.
Прирост производительности¶
Увеличение пропускной способности памяти обеспечило рост пропускной способности генерации токенов на 83,6% (со 110 до 202 токенов/с) при энергопотреблении 300 Вт.