Перейти к содержанию

Cerebras запустила инференс модели Qwen 27B со скоростью 1500 токенов в секунду

7.0/10

На облачной платформе Cerebras стала доступна открытая модель Qwen 27B, обеспечивающая сверхвысокую скорость генерации до 1500 токенов в секунду. Запуск открытых языковых моделей такого масштаба на специализированном оборудовании Cerebras существенно повышает производительность инференса по сравнению с традиционными GPU-сервисами. При этом доступ к модели регулируется правилами API-платформы компании, включая ограничения на число токенов в минуту и специфику обработки контекста.

Контекст

Cerebras Systems разрабатывает специализированные процессоры Wafer-Scale Engine (WSE), предназначенные для сверхбыстрых вычислений и ускорения работы искусственного интеллекта. Модели семейства Qwen создаются подразделением Alibaba Cloud и представляют собой популярные открытые языковые модели разного объема параметров. Развертывание этих моделей на платформе Cerebras позволяет получать экстремальные скорости генерации текста, существенно превосходящие возможности традиционных GPU [tool-1-1, tool-1-2].

Влияние на разработчиков

Сверхвысокая скорость генерации в 1500 токенов в секунду обеспечивает разработчикам практически мгновенный отклик, однако жесткие ограничения API на количество токенов в минуту быстро исчерпываются при выполнении задач с большим объемом контекста.

Обсуждение в сообществе

Разработчики отмечают, что из-за жестких лимитов публичного API (от 150 до 450 тысяч токенов в минуту) и учета кэшированного контекста ограничения исчерпываются за считанные минуты работы с кодом. В качестве альтернативы пользователи приводят примеры локального запуска с помощью инструмента ninfer на видеокарте RTX 5090, достигающего 200–400 токенов/с без суточных и минутных лимитов.

Источники

Покрытие источниками

Проверяются выбранные ключевые утверждения, а не истинность всей статьи целиком.

  1. Недостаточное покрытие источниками

    Cerebras запустила инференс модели Qwen 27B со скоростью 1500 токенов в секунду

  2. Только данные автора или производителя

    обеспечивающая сверхвысокую скорость генерации до 1500 токенов в секунду

  3. Поддерживается прямым источником

    Модели семейства Qwen создаются подразделением Alibaba Cloud

    • en.wikipedia.org · подтверждает · компетентная запись
    • ru.mysummit.school · подтверждает · независимая публикация
    • huggingface.co · подтверждает · заинтересованная сторона