Přejít k hlavnímu obsahu

MiniMax Music 3 skládá pětiminutové písně lokálně. Co nabízí českým tvůrcům

Ilustrační obrázek
MiniMax zveřejnil otevřené váhy modelu MiniMax Music 3, který dokáže z textu, lyrics a podrobného hudebního zadání vytvořit kompletní skladbu dlouhou až pět minut. Výsledkem je 32kHz, 16bitové stereo audio ve formátu WAV. Model lze provozovat lokálně, ale rozhodně nejde o aplikaci pro běžný kancelářský notebook.

Hudební generátory se dlouho chovaly spíše jako digitální automat na krátké nápady. Zadáte žánr, náladu a několik slov, stisknete tlačítko a doufáte, že z toho nevyleze podivně zacyklená smyčka s vokálem připomínajícím hlas navigace po třetí kávě.

MiniMax Music 3 míří dál. Podle oficiálního oznámení MiniMaxu model zvládá vygenerovat celou píseň v jediné generaci. Umí pracovat s úvodem, slokami, předrefrénem, refrénem, bridge, instrumentální částí i závěrem. Neznamená to, že vždy přesně dodrží každou instrukci, ale výrobce se pokouší řešit jeden z nejotravnějších problémů generované hudby: dlouhou skladbu, která se nerozpadne po prvním refrénu.

Dva vstupy místo jednoho neurčitého promptu

Model používá dva samostatné vstupy. Prvním jsou lyrics, tedy text písně. Do něj lze vložit značky jako [Verse], [Chorus], [Bridge], [Instrumental] nebo [Outro]. Značky modelu napovídají, jak má být skladba rozdělená.

Druhým vstupem je popis hudby. Ten může obsahovat žánr, tempo, tóninu, náladu, typ hlasu, nástroje, způsob aranžování i produkční charakter. MiniMax doporučuje strukturovaný formát se třemi částmi:

  • Global Metadata – žánr, BPM, tónina, nálada a produkční profil,
  • Vocal Details – pohlaví hlasu, barva, způsob zpěvu, harmonie a efekty,
  • Arrangement – nástroje, rytmus, basová linka, perkuse a vývoj aranže v čase.

Pro méně zkušené uživatele je k dispozici také nástroj music-caption-rewriter. Ten z krátkého popisu vytvoří podrobnější zadání. Funguje offline a nevyžaduje externí API. Prakticky jde o hudební obdobu asistenta, který z věty „chci smutný synthpop“ udělá zadání, se kterým má model šanci pracovat bez hádání.

Jak model funguje uvnitř

MiniMax Music 3 kombinuje několik různých částí. Základem je hierarchický jazykový model, který rozděluje práci na dlouhodobou strukturu a drobné zvukové detaily.

Globální model má 8 miliard parametrů a stará se především o vývoj skladby v čase. Hlídá například to, že po sloce má přijít refrén a že hudební motiv nezmizí po několika sekundách. Menší lokální model s 0,6 miliardy parametrů dopočítává akustické detaily v jednotlivých okamžicích.

Technicky model pracuje s osmi vrstvami takzvané reziduální vektorové kvantizace neboli RVQ. První vrstva nese významovou strukturu hudby, dalších sedm popisuje jemnější akustické detaily. Je to podobné jako při ukládání fotografie: nejdříve potřebujete obrys a hlavní tvary, teprve potom řešíte texturu, odlesky a drobné nedokonalosti.

Zajímavá je také výstupní část. MiniMax nepřevádí všechny diskrétní hudební tokeny přímo do zvuku. Místo toho spojuje skryté reprezentace obou jazykových modelů a předává je do modulu založeného na flow matching. Ten následně pracuje s latentním prostorem, ze kterého zvuk rekonstruuje Flow-VAE dekodér.

Výsledkem je stereo audio s parametry 32 kHz a 16 bitů. To je použitelné pro běžná videa, podcastové znělky, herní prototypy nebo reklamní podklady. Nejde ale automaticky o hotový studiový master. Vyšší vzorkovací frekvence sama o sobě nezaručuje lepší skladbu a ani z modelu nedělá náhradu zvukaře, producenta nebo mixážního technika.

Otevřené váhy znamenají kontrolu, nikoli pohodlí

Model je dostupný prostřednictvím Hugging Face a zdrojový kód je na GitHubu. MiniMax uvádí tři hlavní způsoby provozu: SGLang-Omni, Diffusers a ComfyUI.

Referenční provoz přes SGLang-Omni počítá se dvěma CUDA GPU. Jedna karta obsluhuje jazykovou a tokenizační část, druhá flow matching a dekódování výsledného zvuku. Pro Diffusers výrobce uvádí přibližně 24 GB grafické paměti při plné přesnosti. S automatickým přesunem části výpočtů do operační paměti se lze dostat zhruba na 22 GB a při skupinovém offloadingu až na 8 GB VRAM.

Číslo „8 GB“ má ale malou hvězdičku velikosti billboardu. Provoz s tak nízkou pamětí bude pomalejší, protože část modelu se bude mezi GPU a systémovou pamětí přesouvat. Na herní grafice s 8 GB tedy model spustit lze, ale nečekejte okamžitou výrobu pětiminutových hitů na počkání.

Model je zdarma ke stažení. Skutečná cena lokálního provozu je proto hlavně v hardwaru, elektřině a čase potřebném na instalaci. Hugging Face aktuálně uvádí, že model není nasazený u žádného oficiálního inference providera, takže z něj nelze jednoduše udělat cloudové API jedním kliknutím.

Licence dovoluje komerční použití, ale ne bez podmínek

MiniMax používá vlastní MiniMax-Music3 Community License. Ta povoluje bezplatné používání, úpravy i komerční nasazení. Firma nebo služba, která model použije ve svém produktu, však musí v uživatelském rozhraní výrazně uvést „MiniMax-Music3“.

Pokud souhrnný roční příjem produktů a služeb využívajících model přesáhne 20 milionů dolarů, je nutné získat předchozí písemné povolení od MiniMaxu. Pro běžného českého vývojáře nebo malý tým je důležitější jiná část licence: při poskytování generování třetím stranám musí provozovatel zavést přiměřené ochrany proti zneužití a porušování práv k hudbě.

Licence zároveň nepřenáší odpovědnost za výstup na MiniMax. Pokud model vytvoří melodii nebo vokál, který se nepříjemně podobá existující skladbě, problém nebude řešit samotná nálepka „vygenerováno umělou inteligencí“. Před komerčním vydáním je proto stále nutná kontrola práv, obsahu i původu vstupních lyrics.

Čeština, dostupnost v ČR a srovnání s konkurencí

MiniMax Music 3 nemá podle dostupné oficiální dokumentace české uživatelské rozhraní ani deklarovanou podporu češtiny. Model přijímá textové lyrics a příklady v dokumentaci ukazují angličtinu i čínštinu, ale výrobce negarantuje, že bude českou výslovnost, přízvuk a rytmus zvládat stejně spolehlivě. Pro české texty je proto vhodné počítat s testováním více generací a ruční kontrolou výslovnosti.

Pro český trh je model dostupný ke stažení stejně jako pro uživatele v dalších zemích, protože jde o lokální open-weights model. Omezením nejsou české platební metody, ale spíše kompatibilní CUDA hardware a licence.

Přímé srovnání s GPT, Gemini nebo Claude nedává velký technický smysl. Tyto modely jsou obecní jazykoví asistenti, nikoli specializované systémy pro generování hotových písní. Mohou pomoci napsat lyrics, strukturovat prompt nebo navrhnout aranž, ale samotný zvukový výstup je jiná disciplína.

Ve spotřebitelské kategorii je vhodnější porovnání se službami jako Suno. Suno nabízí bezplatný tarif a placené plány od 8 dolarů měsíčně, přičemž vyšší tarify přidávají komerční práva, více kreditů a pokročilé úpravy. Suno je tedy pohodlnější pro běžného tvůrce, který nechce instalovat model. MiniMax naopak nabízí větší kontrolu nad provozem a možnost zapojení do vlastního nástroje.

Ve veřejně dostupných materiálech MiniMaxu jsem nenašel nezávislý číselný benchmark, který by Music 3 férově porovnával se Suno, Udio nebo jiným hudebním modelem. Výrobce popisuje lepší strukturu, vokály a věrnost zvuku, ale jde o tvrzení výrobce, nikoli o kontrolovaný test. Proto není poctivé tvrdit, že MiniMax Music 3 „poráží“ konkurenci.

Pro koho dává MiniMax Music 3 smysl

Největší smysl má pro vývojáře, herní studia, tvůrce videí a firmy, které chtějí generovat hudbu dávkově nebo přímo ve vlastním workflow. Lokální provoz může být zajímavý tam, kde je důležitá kontrola nad daty, opakovatelnost a absence poplatku za každý jednotlivý výstup.

Pro běžného uživatele, který chce jednou za čas vytvořit písničku k narozeninám, bude praktičtější webová služba. U MiniMaxu je potřeba řešit instalaci, GPU, aktualizace knihoven i licenční podmínky. To není překážka pro technické publikum, ale pro ostatní může být první „skladbou“ spíše dlouhé čekání na správnou verzi ovladače.

MiniMax Music 3 je důležitý hlavně tím, že přibližuje kompletní tvorbu hudby k lokálnímu provozu. Není to hotové studio v jednom souboru a jeho výstupy budou vyžadovat výběr i úpravy. Otevřené váhy však dávají vývojářům možnost model skutečně zapojit do vlastních nástrojů, místo aby byli odkázáni pouze na jednu webovou aplikaci a její aktuální pravidla.

FAQ

Dokáže MiniMax Music 3 generovat písně v češtině?

Češtinu lze vyzkoušet jako vstupní jazyk lyrics, ale MiniMax její výslovnost ani kvalitu zpěvu oficiálně negarantuje. Dokumentace neuvádí českou lokalizaci ani samostatný režim pro české texty.

Potřebuji ke spuštění dvě grafické karty?

Referenční provoz přes SGLang-Omni počítá se dvěma CUDA GPU. Alternativa přes Diffusers může fungovat na jedné kartě, přibližně od 24 GB VRAM, případně s offloadingem i na kartách s menší pamětí, ale za cenu nižší rychlosti.

Je možné hudbu vytvořenou modelem komerčně použít?

Licence modelu komerční použití povoluje, vyžaduje však viditelné uvedení „MiniMax-Music3“ a při příjmech nad 20 milionů dolarů ročně předchozí písemné povolení. U konkrétní skladby je navíc nutné samostatně řešit práva k lyrics a případné podobnosti s existující hudbou.

Aktualizováno 18. srpna 2026.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.