Google представила Gemini-3.5-Transcribe — новую модель распознавания речи¶
7.0/10
Google анонсировала Gemini-3.5-Transcribe — новую модель преобразования речи в текст. Согласно документации для разработчиков, упомянутой в обсуждении, модель поддерживает function calling и может делегировать сложные задачи, такие как генерация изображений и анализ файлов, другим моделям Gemini; эта возможность сейчас доступна в macOS-приложении Gemini. Ранние отзывы пользователей неоднозначны: один тестировавший на Pixel 11 Pro отмечает, что модель может упрощать точные формулировки и искажать смысл, а другие сравнивают её с Voxtral Mini 3b, Whisper и ElevenLabs в многоязычных сценариях. Анонс важен, поскольку расширяет конкуренцию в области speech-to-text, где у пользователей уже есть предпочтения по локальным и API-моделям.
Контекст¶
Gemini 3.5 Transcribe — это новая модель преобразования речи в текст от Google, представленная как «наиболее точная модель распознавания речи» компании и уже используемая в ряде собственных продуктов, включая Rambler. Такие модели, как Whisper или предыдущие версии Gemini, обычно переводят аудио в текст для субтитров, заметок и голосовых команд; новая модель также интегрируется с функциями Live, такими как Daily Brief и управление почтой Gmail. Анонс продолжает развитие семейства моделей Gemini, где Google добавляет специализированные модели под конкретные задачи, а не только универсальные мультимодальные системы.
Влияние¶
Для пользователей, которым нужна дословная транскрипция, ранний отзыв указывает на риск упрощения точных формулировок, что может искажать смысл; это стоит учитывать при выборе модели для стенограмм встреч и субтитров.
Обсуждение¶
В обсуждении нет единого мнения: один участник сравнивает Gemini-3.5-Transcribe с Voxtral Mini 3b и ElevenLabs в корпоративных многоязычных тестах, другой использует связку Whisper и Qwen3.8 27b для субтитров и считает Voxtral лучше Whisper, а третий жалуется на упрощение смысла при точных формулировках. Также обсуждается документация по function calling, которая, по мнению комментатора, может вводить в заблуждение.
Источники
Покрытие источниками¶
Проверяются выбранные ключевые утверждения, а не истинность всей статьи целиком.
-
Недостаточное покрытие источниками
Google представила Gemini-3.5-Transcribe — новую модель распознавания речи
- blog.google · подтверждает · первоисточник
-
Предварительно: новость слишком свежая
Согласно документации для разработчиков, упомянутой в обсуждении, модель поддерживает function calling и может делегировать сложные задачи, такие как генерация изображений и анализ файлов, другим моделям Gemini; эта возможность сейчас доступна в macOS-приложении Gemini.
- blog.google · подтверждает · первоисточник
- deepmind.google · контекст · первоисточник
-
Не подходит для фактологической проверки
Ранние отзывы пользователей неоднозначны: один тестировавший на Pixel 11 Pro отмечает, что модель может упрощать точные формулировки и искажать смысл, а другие сравнивают её с Voxtral Mini 3b, Whisper и ElevenLabs в многоязычных сценариях.