Перейти к содержанию

Google представила Gemini-3.5-Transcribe — новую модель распознавания речи

7.0/10

Google анонсировала Gemini-3.5-Transcribe — новую модель преобразования речи в текст. Согласно документации для разработчиков, упомянутой в обсуждении, модель поддерживает function calling и может делегировать сложные задачи, такие как генерация изображений и анализ файлов, другим моделям Gemini; эта возможность сейчас доступна в macOS-приложении Gemini. Ранние отзывы пользователей неоднозначны: один тестировавший на Pixel 11 Pro отмечает, что модель может упрощать точные формулировки и искажать смысл, а другие сравнивают её с Voxtral Mini 3b, Whisper и ElevenLabs в многоязычных сценариях. Анонс важен, поскольку расширяет конкуренцию в области speech-to-text, где у пользователей уже есть предпочтения по локальным и API-моделям.

Контекст

Gemini 3.5 Transcribe — это новая модель преобразования речи в текст от Google, представленная как «наиболее точная модель распознавания речи» компании и уже используемая в ряде собственных продуктов, включая Rambler. Такие модели, как Whisper или предыдущие версии Gemini, обычно переводят аудио в текст для субтитров, заметок и голосовых команд; новая модель также интегрируется с функциями Live, такими как Daily Brief и управление почтой Gmail. Анонс продолжает развитие семейства моделей Gemini, где Google добавляет специализированные модели под конкретные задачи, а не только универсальные мультимодальные системы.

Влияние

Для пользователей, которым нужна дословная транскрипция, ранний отзыв указывает на риск упрощения точных формулировок, что может искажать смысл; это стоит учитывать при выборе модели для стенограмм встреч и субтитров.

Обсуждение

В обсуждении нет единого мнения: один участник сравнивает Gemini-3.5-Transcribe с Voxtral Mini 3b и ElevenLabs в корпоративных многоязычных тестах, другой использует связку Whisper и Qwen3.8 27b для субтитров и считает Voxtral лучше Whisper, а третий жалуется на упрощение смысла при точных формулировках. Также обсуждается документация по function calling, которая, по мнению комментатора, может вводить в заблуждение.

Источники

Покрытие источниками

Проверяются выбранные ключевые утверждения, а не истинность всей статьи целиком.

  1. Недостаточное покрытие источниками

    Google представила Gemini-3.5-Transcribe — новую модель распознавания речи

    • blog.google · подтверждает · первоисточник
  2. Предварительно: новость слишком свежая

    Согласно документации для разработчиков, упомянутой в обсуждении, модель поддерживает function calling и может делегировать сложные задачи, такие как генерация изображений и анализ файлов, другим моделям Gemini; эта возможность сейчас доступна в macOS-приложении Gemini.

    • blog.google · подтверждает · первоисточник
    • deepmind.google · контекст · первоисточник
  3. Не подходит для фактологической проверки

    Ранние отзывы пользователей неоднозначны: один тестировавший на Pixel 11 Pro отмечает, что модель может упрощать точные формулировки и искажать смысл, а другие сравнивают её с Voxtral Mini 3b, Whisper и ElevenLabs в многоязычных сценариях.