MiniMax-Music3: открытая модель генерации музыки для локального запуска¶
8.0/10
Компания MiniMax выпустила открытую модель генерации музыки MiniMax-Music3, размещённую на Hugging Face. Модель интегрирована в audio.cpp версии 0.6 в виде конвейера text-to-audio, который хорошо справляется с многоспикерными диалогами и работает достаточно быстро. Благодаря потоковой загрузке языкового слоя модель помещается даже в видеокарты с 8 ГБ памяти, однако требуется CUDA, а длительность аудио ограничена пятью минутами. Релиз делает локальную генерацию музыки доступной на потребительских GPU и продолжает серию MiniMax-H3.
Контекст¶
MiniMax Music 3 — это открытая модель генерации музыки, способная создавать полные песни длительностью до пяти минут, сохраняя музыкальные темы, ритм и идентичность вокала. Она интегрирована в аудиопайплайн audio.cpp версии 0.6, который обеспечивает генерацию речи от текста и хорошо справляется с многоговорящими диалогами, при этом для работы требуется CUDA, хотя потоковая передача слоёв модели позволяет запускать её даже на видеокартах с 8 ГБ памяти. Эта модель продолжает развитие открытых весовых генераторов музыки, приближая их качество к коммерческим решениям.
Влияние¶
Для пользователей это означает возможность локально генерировать музыку и многоспикерные аудиофрагменты на обычных видеокартах без облачных API, хотя ограничение в пять минут и требование CUDA сужают круг сценариев.
Обсуждение сообщества¶
В комментариях пользователи позитивно оценивают релиз, отмечают полезную демо-страницу и то, насколько хорошо работает открытая генерация музыки. Одновременно подчёркивают требование CUDA, предел аудио в пять минут и просят портировать модель для MLX на устройствах Apple Silicon.