Перейти к содержанию

Gemini Omni 1.1 Flash: обновление мультимодальной модели Google

6.0/10

Google анонсировала Gemini Omni 1.1 Flash — обновлённую мультимодальную модель, предназначенную для разработчиков и отличающуюся улучшенной точностью генерации видео. Обновление позиционируется как инкрементальное: в предоставленном материале отсутствуют подробные технические характеристики, версии, даты доступности или бенчмарки. Тем не менее, заявленное улучшение касается качества и согласованности деталей в генерируемых видеороликах, что важно для приложений, использующих синтетический видеоконтент. Точные условия доступа, ограничения и совместимость с предыдущими версиями Gemini в доступном материале не раскрываются.

Контекст

Gemini Omni Flash — это мультимодальная модель Google DeepMind для генерации и редактирования видео, обученная на тензорных процессорах (TPU) Google. Она позволяет создавать видео по текстовому описанию, редактировать клипы, управлять движением камеры и выдавать результат вплоть до 4K. Обновление Gemini Omni 1.1 Flash добавляет расширение сцен до 40 секунд, контроль первого и последнего кадра, черновой режим 360p примерно за треть стоимости и вывод в 1080p/4K при цене $0,10 за секунду.

Влияние

Для разработчиков, использующих API Gemini, обновление означает потенциально более точную генерацию видео, однако без опубликованных характеристик и бенчмарков практический эффект пока остаётся неясным.

Обсуждение сообщества

В комментариях хвалят точность деталей в сгенерированных видео, но часть участников признаётся в усталости от частых обновлений ИИ. Также поднимаются вопросы о влиянии генеративного ИИ на актёров озвучивания и экрана, а один комментарий иронично советует Google проверять работу в Firefox.

Источники