Перейти к содержанию

Google представила Gemini 3.8 Live с поддержкой двунаправленного WebSocket API

5.0/10

Google представила новые модели формата speech-to-speech Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, предназначенные для прямого голосового взаимодействия в реальном времени. Разработчик Саймон Уиллисон продемонстрировал клиентскую реализацию интерфейса без сторонних библиотек, взаимодействующую с эндпоинтом wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent. Решение использует стандартный браузерный AudioContext из Web Audio API для захвата и воспроизведения аудиопотока с возможностью перебивания ответа модели. Официальные тарифные ставки за миллион токенов и лимиты запросов в предоставленных материалах не раскрыты.

Цены и квоты

На момент релиза моделей Gemini 3.8 Live и 3.8 Live Extended Thinking компания Google не опубликовала базовые расценки за миллион входных и выходных токенов, скидки на кэширование контекста или условия пакетной обработки через Batch API. Точные квоты пропускной способности (RPM, TPM) и стоимость доступа по платным подпискам также не раскрыты, а мультимодальный двунаправленный API сохраняет статус экспериментального интерфейса со строго ограниченными лимитами на сессии.

Влияние на инфраструктуру

Переход на двунаправленный протокол BidiGenerateContent через WebSockets требует от операторов AI-шлюзов обеспечения долговременных сессий с поддержкой session affinity и низколатентного полнодуплексного проксирования аудиопотоков.

Источники