Хостинг Kimi K3 (2.8T) на 8 B300: 92 ток/с и $190 за миллион токенов¶
7.0/10
Пользователь Reddit OtherRaisin3426 сообщил о самостоятельном хостинге модели Kimi K3 с 2,8 трлн параметров на 8 графических процессорах B300 через Modal (аренда $56,79 в час) с использованием vLLM, тензорного параллелизма 8 и нативного MXFP4. В ходе теста получены стабильные 92 ток/с при декодировании (среднее 83 ток/с на 4 промптах), TTFT от 0,92 до 1,02 с, а стоимость составила около $190 за миллион выходных токенов; один чистый прогон обходится примерно в $36, а при постоянном прогреве — $1363 в день. Дополнительно автор сравнил 1-битный GGUF (UD-IQ1_S, 594 ГБ) от Unsloth на 8 A100-80GB через llama.cpp: скорость около 9 ток/с, TTFT от 7 до 60 с, стоимость $620 за миллион токенов, что в 3,3 раза дороже за токен, хотя качество при 1-битном квантовании оставалось приемлемым (корректная арифметика и связный текст). Полный отчёт с флагами, файлом развёртывания Modal и сырыми JSON-бенчмарками доступен по ссылке books.vizuara.ai/book/kimi-k3-hosting.
Контекст¶
Kimi K3 — это открытая модель с 2,8 трлн параметров, требующая значительных вычислительных ресурсов для инференса; B300 — современные ускорители NVIDIA, поддерживающие MXFP4-формат для эффективного хранения и вычислений. vLLM — популярный фреймворк для высокопроизводительного сервинга LLM, а GGUF-квантование (включая 1-битные варианты) позволяет запускать большие модели на менее мощном оборудовании за счёт снижения точности.
Влияние¶
Для разработчиков и организаций, планирующих развёртывание Kimi K3, эти цифры показывают, что самостоятельный хостинг на 8 B300 экономически оправдан только при высокой параллельной нагрузке, а не для одиночных запросов; 1-битный GGUF на A100 значительно дешевле в аренде, но в 3,3 раза дороже за токен и медленнее, что делает его пригодным лишь для ограниченных сценариев.
Обсуждение сообщества¶
Комментаторы отметили, что заявленная стоимость за миллион токенов вводит в заблуждение, поскольку эффективность достигается только при обслуживании множества пользователей параллельно, а одиночный поток не даёт выгоды. Также подчёркивалось, что 1-битное квантование уничтожает знания и возможности модели, поэтому сравнение с полной точностью некорректно; один пользователь предложил использовать DeepSeek V4 Flash или nvfp4 с sglang и параллельным сервингом, а другой напомнил, что официальный API Kimi K3 стоит $3 за миллион входных и $15 за миллион выходных токенов.