Релиз MiniMax-Music3: открытая генерация музыки с 8 ГБ VRAM¶
7.0/10
MiniMax выпустила открытую модель генерации музыки MiniMax-Music3. Она требует CUDA, а благодаря послойной потоковой загрузке языковой модели помещается даже в 8 ГБ видеопамяти; максимальная длина генерируемого аудио — 5 минут. Модель интегрирована в audio.cpp (релиз 0.6) через конвейер MiniMax-H3 text-to-audio, который хорошо справляется с многоголосыми диалогами и работает довольно быстро. Это заметно снижает порог входа для локальной генерации музыки и речи.
Контекст¶
MiniMax Music 3 — это открытая модель генерации музыки, которая по описанию и тексту песни создаёт полноценные композиции длиной до пяти минут в стерео 32 кГц. В отличие от многих закрытых аналогов, модель имеет открытые веса, интегрирована в audio.cpp и может работать даже на видеокартах с 8 ГБ памяти благодаря потоковой загрузке слоёв языковой модели. На странице проекта также доступен демонстрационный пример, подтверждающий возможности модели.
Влияние¶
Разработчики и энтузиасты с GPU от 8 ГБ VRAM могут локально запускать современную открытую генерацию музыки, а интеграция с audio.cpp добавляет быстрый конвейер для создания многоголосых аудиодиалогов.
Обсуждение в сообществе¶
В комментариях отмечают, что качество открытой генерации музыки уже очень высокое, и хвалят прогресс MiniMax. Отдельные пользователи обращают внимание на требование CUDA и просят портировать модель для MLX.