O modelu
Lokální multimodální video-audio model provozovaný v ComfyUI. Nejde o textový LLM benchmark; model generuje video a synchronní stereo audio.
Poznámka admina
Testováno v izolovaném ComfyUI na jarvisbotu. Hlasová reference nebyla ověřena.
Schopnosti
🖼 Obrázek 🎤 Audio 🎬 Video
Technické specifikace
| Architecture | multimodal video-audio diffusion |
|---|---|
| Output duration | 4-15 s |
| Fps | 24 |
| Audio | 32 kHz stereo |
Hardware pro testy
| CPU | AMD Ryzen |
|---|---|
| GPU | NVIDIA RTX 5060 Ti 16GB |
| RAM | 32 GB DDR5 |
| OS | Ubuntu 24.04 LTS |
Výsledky testů
| Test | Run | Tokens/s | TTFT (ms) | Délka (s) | Tokeny | GPU VRAM | Processor | Teplota | Kvalita | Datum | Výstup |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Video generování | #1 | - | - | 2,040.0 | - | 14100 MB | ComfyUI / MiniMax H3 local | - | 7/10 | 10.08.2026 |
Vygenerované výstupy
Video generování
Vlastní test: 1344x768, 24 FPS, 5.17 s, stereo audio, italský dialog. Obraz není vůbec špatný, identita a obličej jsou stabilní, bez hrubých deformací. Zvuk je slabší. Klonování referenčního hlasu nebylo testováno. Render přibližně 34 minut, bez OOM.