Přejít k hlavnímu obsahu

Konec iluzí o domácím AI videu: Zkusili jsme nativní Full HD v MiniMax H3 a grafika řekla dost

Ilustrační obrázek pro jarvis-ai.cz
Generování videa pomocí otevřených AI modelů přímo na osobním počítači naráží na nekompromisní paměťovou bariéru. Otestovali jsme pokročilý generativní model MiniMax H3 na grafické kartě Nvidia GeForce RTX 5060 Ti se 16 GB VRAM při náročné tvorbě automobilové animace. Zatímco rozlišení 1344 × 768 px zvládá karta i s pokročilými obrazovými referencemi, nativní Full HD odhaluje natvrdo limity spotřebitelského hardwaru. Přinášíme detailní rozbor paměťové náročnosti, srovnání s konkurencí a přehled možností pro české tvůrce.

Paměťová bariéra lokálních video modelů AI

Provozování AI modelů pro generování videa na lokálním hardwaru klade na grafické karty dramaticky vyšší nároky než generování textu nebo statických obrázků. Zatímco v předchozím rozboru MiniMax H3 jsme si ověřili základní funkčnost generování videa se synchronním zvukem na kartě RTX 5060 Ti se 16 GB VRAM v rozlišení 1344 × 768 bodů, náš druhý hloubkový test se zaměřil na hledání reálného paměťového stropu při pokročilé práci s fotografickými předlohami a nativním Full HD rozlišením.

Srovnání paměťové náročnosti ukazuje, že zatímco obrazové generátory jako SDXL nebo FLUX.1 pracují efektivně i s 8 až 12 GB VRAM, difuzní video modely s časovou dimenzí vyžadují masivní alokaci paměti pro uchování kontextu více snímků najednou. U modelu MiniMax H3 se tato bariéra projevuje velmi výrazně při přechodu z HD rozlišení na standardní 1080p.

Praktický test s modelem auta: Od referenčních snímků po technické detaily

Pro prověření schopností modelu jsme zvolili komplexní zadání: vytvořit technickou vizualizaci elektromobilu Ford Mustang Mach-E na základě tří vlastních fotografií. Snímky zachycovaly přední tříčtvrteční pohled, boční profil a zadní část vozu. Cílem nebylo pouze jednoduché rozpohybování statického snímku, ale komplexní přechod mezi pohledy doplněný o průhledné řezy karoserií.

Prompt požadoval zobrazení průhledné karoserie s viditelnou 88kWh baterií typu NMC, následně průhlednou přední kapotu s elektromotorem o výkonu 203 kW a na závěr průhlednou zadní část s otáčejícími se koly a textovým údajem o dojezdu 615 km. Do nástroje ComfyUI jsme vložili první a poslední fotografii jako počáteční a koncový snímek, zatímco prostřední boční fotografii jsme použili jako vizuální referenci pro zachování proporcí vozu.

Výsledek v rozlišení 1344 × 768 px na kartě Nvidia GeForce RTX 5060 Ti dopadl úspěšně. Desetisekundový render stvořil video o délce 10,125 sekundy při 24 snímcích za sekundu ve formátu H.264 MP4. Model H3 prokázal, že dokáže zpracovat obrazové reference, plynule navázat mezi dvěma úhly pohledu a interpretovat složitější technické instrukce bez kolapsu geometrie objektu.

Nativní Full HD v ComfyUI: Proč 16 GB VRAM nestačí

Při pokusu o vygenerování stejné scény v nativním Full HD rozlišení (1920 × 1080 px) však systém okamžitě narazil na fyzické limity hardware. Postupně jsme testovali nastavení délky videa na 15, 12, 10 a 9 sekund. Všechny pokusy selhaly s chybovým hlášením out of memory v klíčovém uzlu ComfyUI SamplerCustomAdvanced.

Nešlo přitom o nedostatek operační paměti RAM ani o kolizi s jinými aplikacemi na pozadí. Pro testy byly ukončeny všechny vedlejší procesy včetně transkripčních služeb a Ace-Step. Nefungovalo ani spuštění ComfyUI s parametrem --reserve-vram 0, který uvolňuje systémovou rezervu pro grafiku. Při devítisekundovém pokusu udávalo prostředí ComfyUI přibližně 13,5 GiB již alokované paměti a požadavek na dalších více než 1 GiB, přičemž rozhraní CUDA hlásilo pouze několik volných megabajtů.

Paměťová špička vzniká přímo během difuzního vzorkování v paměti GPU. Zkrácení délky klipu sice mírně snižuje objem dat, u nativního rozlišení 1080p ale nedostačuje k tomu, aby se výpočet vešel do 16GB limitu VRAM.

Dvě GPU, CPU offloading a zrychlení přes Turbo LoRA

V rámci testovací sestavy jsme vyzkoušeli i alternativní hardwarové a softwarové konfigurace. Počítač disponoval druhou kartou Nvidia GeForce RTX 3050 se 6 GB VRAM. Standardní prostředí ComfyUI však nedokáže automaticky sloučit paměť dvou rozdílných karet (16 GB + 6 GB) pro výpočet jednoho vzorkovače. Jeden workflow tak vždy běží na jediném zařízení CUDA.

Modelově paralelní režim by vyžadoval ruční úpravy architektury transformeru MiniMax, kvantizačních operací a předávání tensorů přes sběrnici PCIe, což aktuální uzly ComfyUI neumožňují a menší 6GB karta by pro tento účel představovala úzké hrdlo. Nepomohl ani offloading na procesor (CPU), protože ačkoli ComfyUI dokáže některé komponenty odložit do systémové RAM, paměťovou špičku sampleru na GPU to neodstraní a kompletní výpočet na CPU by byl pro video nepoužitelně pomalý.

Zkoušeli jsme také optimalizovaný projekt ComfyUI-MiniMax-H3-Turbo, který využívá Turbo LoRA a adaptivní sampler redukující počet kroků ze 20 na 4 až 8. Workflow obsahuje také přepínač low_vram. Ani zapnutý režim nízké paměti se čtyři kroky vzorkování však u devítisekundového Full HD videa na RTX 5060 Ti neprošel. Turbo workflow sice zrychluje výpočet na nižších rozlišeních, ale nedokáže fyzicky nahradit chybějící kapacitu VRAM.

Srovnání s konkurencí, cena a dostupnost v České republice

V kontextu současného trhu generativní umělé inteligence je MiniMax H3 unikátní tím, že jde o pokročilý model s otevřenými váhami (open-weights), který je k dispozici zcela zdarma pod svobodnou licencí na GitHubu a Hugging Face. Pro srovnání uvádíme přehled s konkurenčními nástroji:

  • CogVideoX-5B (THUDM): Otevřený model vyžadující pro rozlišení 720p přibližně 18 až 22 GB VRAM bez agresivní kvantizace. MiniMax H3 nabízí lepší časovou konzistenci a integrovanou tvorbu zvuku.
  • HunyuanVideo (Tencent): Špičkový open-source video model, který však pro plynulý běh v rozlišení 720p/1080p vyžaduje grafickou kartu s minimálně 24 GB VRAM (např. RTX 3090 / 4090).
  • Kling AI 1.5 / Runway Gen-3 Alpha / Luma Dream Machine: Komerční cloudové služby. Nevyžadují žádný lokální hardware, avšak podléhají měsíčním poplatkům. Základní předplatné se pohybuje mezi 12 až 28 USD měsíčně (přibližně 280 až 650 Kč/měsíc).

Z hlediska dostupnosti v České republice je lokální provoz MiniMax H3 neomezený — nevyžaduje žádné obcházení geoblokace ani platby za API tokens. Uživatelské rozhraní ComfyUI je plně dostupné v ČR. Ačkoli textový tokenizer modelu zvládá základní zadání v češtině, pro přesné dodržení technických instrukcí a pohybu kamery doporučujeme zadávat prompty v angličtině.

Praktické možnosti pro uživatele se 16 GB VRAM

Na základě našich měření lze definovat jasná doporučení pro tvůorce s grafickými kartami o kapacitě 16 GB VRAM:

1. Generování v nativním rozlišení 1344 × 768 px a následný upscaling: Toto je nejspolehlivější cesta. Lokální výpočet proběhne bez chyb OOM a výstupní MP4 soubor lze následně zvětšit do Full HD či 4K pomocí dedikovaných AI upscalerů (např. Topaz Video AI nebo uzly v ComfyUI).

2. Optimalizace parametrů: Držet kratší stopáž (do 5 až 10 sekund), omezit počet vložených referenčních snímků a využívat Turbo LoRA pro zkrácení doby renderování z desítek minut na jednotky minut.

3. Přechod na vyšší hardwarovou třídu pro nativní 1080p: Pro přímé generování ve Full HD bez upscalingu je nezbytná karta s 24 GB VRAM (např. Nvidia RTX 3090, RTX 4090) nebo workstation karty. Alternativou s vysokou kapacitou paměti jsou karty AMD jako Radeon AI PRO R9700 s 32 GB VRAM využívající framework AMD ROCm, u nichž je však nutné počítat se složitější konfigurací prostředí.

Verdikt: Pro koho má lokální MiniMax H3 smysl

MiniMax H3 dokazuje, že pokročilé generování videa z textu a obrázků s integrovaným zvukem je na spotřebitelském hardwaru se 16 GB VRAM reálně možné, pokud se tvůrce drží rozlišení 1344 × 768 px. Nároky na paměť při nativním 1080p renderingu jsou však nekompromisní a nepomohou je překonat ani softwarové triky, druhá GPU či Turbo samplery. Pro české tvůrce, kteří hledají plnou kontrolu nad daty bez měsíčních poplatků, zůstává kombinace nižšího nativního rozlišení a následného upscalingu nejefektivnější cestou.

Zdroje a další informace

Oficiální repozitář MiniMax H3, Turbo node pro ComfyUI, diskuse o paměti MiniMax H3 v ComfyUI, kompatibilita AMD ROCm a AMD: podpora MiniMax H3 na ROCm. Technické údaje o měření VRAM a renderech pocházejí z vlastního testování redakce jarvis-ai.cz.

Jaké je maximální funkcní rozlišení pro MiniMax H3 na 16GB grafické kartě?

Naše testy potvrdily jako stabilní rozlišení 1344 × 768 bodů při 24 FPS. V tomto režimu model zvládá generovat video z textu i z více fotografických předloh bez chyby nedostatku paměti.

Kolik stojí provoz modelu MiniMax H3 v porovnání s cloudovou konkurencí?

Samotný model MiniMax H3 je k dispozici zdarma jako open-source. Lokální provoz generuje pouze náklady na elektrickou energii. Komerční cloudové služby jako Kling AI nebo Runway vyžadují předplatné v rozmezí 12 až 28 USD měsíčně (cca 280–650 Kč).

Funguje MiniMax H3 s prompty v českém jazyce?

Ano, model dokáže zpracovat základní české prompty, ale pro dodržení složitých technických zadání a přesných pohybů kamery dosáhnete výrazně lepších výsledků s anglickými instrukcemi.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.