Выпуск моделей Gemini 3.8 Flash TTS и Flash-Lite TTS с генерацией диалогов¶
6.0/10
Google представила модели синтеза речи gemini-3.8-flash-tts и gemini-3.8-flash-lite-tts, включающие библиотеку из более чем 2 000 голосов и функцию создания пользовательского голоса по 30-секундному образцу. Разработчик Саймон Уиллисон запустил тестовый веб-интерфейс Gemini 3.8 TTS Playground, использующий открытую политику CORS для прямых запросов к API со стороны браузера по схеме BYOK. Новые API позволяют описывать диалоги нескольких персонажей с индивидуальными инструкциями по стилю речи для каждого говорящего. В практическом тесте модели gemini-3.8-flash-tts генерация 1 минуты 18 секунд аудио заняла около 20 секунд при стоимости 2,74 цента, тогда как gemini-3.8-flash-lite-tts позиционируется как более бюджетный вариант.
Цены и квоты¶
По данным практического тестирования, синтез 1 минуты 18 секунд аудио на флагманской модели gemini-3.8-flash-tts обошелся в 2,74 цента при времени генерации около 20 секунд. Для облегченной версии gemini-3.8-flash-lite-tts платформы доступа указывают базовую стоимость на уровне $1 за 1 миллион входных и $1 за 1 миллион выходных токенов. Вызовы расходуют персональную квоту учетной записи Gemini API разработчика, тогда как точные лимиты запросов (RPM/TPM) и скидки на пакетную обработку регламентируются общим тарифным планом аккаунта Google.
Влияние на инфраструктуру¶
Наличие открытых CORS-заголовков в API позволяет запускать интерфейсы генерации аудио напрямую на стороне клиента без выделенного egress-прокси и промежуточных шлюзов. Возможность передачи комплексных многопользовательских сценариев в рамках одного запроса исключает необходимость кастомной конкатенации и порепликовой оркестрации аудиопотоков в сторонних конвейерах.