Přejít k hlavnímu obsahu

DGX Spark vs. AMD Strix Halo vs. Mac Mini: Velký srovnávací test AI hardwaru odhalil překvapivou pravdu

Ilustrační obrázek pro jarvis-ai.cz
Když postavíte vedle sebe základní stolní počítač Mac Mini za 600 dolarů a specializovanou výpočetní stanici NVIDIA DGX Spark za 4 700 dolarů, očekávali byste drtivé vítězství nejdražšího stroje. Nezávislé benchmarky testující lokální běh AI modelů však odhalily překvapivou věc: při samotném psaní odpovídajícího textu jsou oba stroje téměř stejně rychlé. Skutečný rozdíl, který obhajuje sedminásobnou cenu profesionálního hardwaru, se skrývá v metrice, kterou běžné testy přehlížejí — v rychlosti čtení neboli prefillu.

Mýtus o nejdražším AI stroji: Proč levný Mac stíhá monstrum od NVIDIA?

Většina uživatelů i technologických recenzentů testuje hardwarový výkon pro lokální umělou inteligenci stále stejným povrchním způsobem: zadají krátký dotaz, spustí generování textu a sledováním toho, jak rychle vyskakují jednotlivá slova na obrazovce, vyhlásí vítěze. Podle podrobné analýzy, kterou na síti X zveřejnil výzkumník pod přezdívkou KyzoroX, však tento přístup vytváří zásadní iluzi.

Při samotném psaní odpovědi (fáze dekódování neboli token generation) totiž počítače narážejí na fyzikální strop v podobě propustnosti operační paměti. Jak kompaktní Apple Mac Mini s procesorem M4 Pro, tak enterprise stanice NVIDIA DGX Spark využívají paměťovou architekturu LPDDR5x s identickou teoretickou propustností okolo 273 GB/s. Výsledkem je, že u středně velkého open-weights kódovacího modelu Qwen3-Coder 30B píše Mac Mini rychlostí 56 tokenů za sekundu, zatímco DGX Spark dosahuje 84 tokenů za sekundu.

V běžné konverzaci je tento rozdíl 28 tokenů za sekundu pro lidské oko téměř nepostřehnutelný — obě zařízení tvoří text výrazně rychleji, než dokáže jakýkoliv člověk číst. Kde se tedy skrývá opodstatnění pro investici do mnohonásobně dražšího zařízení?

Dvě čísla, která rozhodují: Prefill vs. Generování

Pro pochopení reálného výkonu lokálního AI hardwaru je klíčové rozlišovat dvě odlišné fáze, které výpočetní jednotka zpracovává:

  • Prefill (zpracování promptu): Rychlost, jakou model načte a analyzuje zadaný kontext — rozsáhlé dokumenty, historii chatu nebo znalostní bázi (RAG). Projevuje se jako pauza před tím, než model vytiskne první slovo (měřená jako Time-To-First-Token / TTFT). Tento proces je extrémně náročný na ryzí výpočetní výkon procesoru a akcelerátoru v operacích FP4 nebo FP16.
  • Generování (dekódování): Rychlost, jakou model následně tvoří odpověď token po tokenu. Tato fáze je limitována téměř výhradně šířkou paměťového pásma (memory bandwidth).

Při dodržení striktní metodiky (spuštěný model Qwen3-Coder 30B v kvantování Q4_K_M na prostředí llama.cpp / Ollama) odhalují naměřené hodnoty zásadní kontrast:

Naměřené výsledky srovnávacího benchmarku:

  • Zpracování kontextu / Prefill (čtení):
    • Apple Mac Mini M4 Pro: 564 tokenů/s
    • AMD Strix Halo (Ryzen AI Max+ 395): 342 tokenů/s
    • NVIDIA DGX Spark: 2 107 tokenů/s
  • Generování odpovídajícího textu / Decode (psaní):
    • Apple Mac Mini M4 Pro: 56 tokenů/s
    • AMD Strix Halo: 73 tokenů/s
    • NVIDIA DGX Spark: 84 tokenů/s

Zatímco při samotném psaní jsou si všechny tři platformy velmi blízko, při zpracování dlouhého textu v prefillu systém DGX Spark drtí konkurenci. Je téměř 4x rychlejší než Mac Mini a více než 6x rychlejší než nová pracovní stanice s čipem AMD Strix Halo.

Co ve skutečnosti kupujete za 4 700 dolarů?

Cenový příplatek za NVIDIA DGX Spark nekupuje "rychlejšího chatbota", ale schopnost okamžitě zpracovat gigantické objemy dat. V dnešní době, kdy se prosazují autonomní agentní systémy komunikující přes standardizovaný Model Context Protocol (MCP) a uvažující modely s integrovanými myšlenkovými procesy (přičemž uživatel nastavuje výpočetní rozpočet neboli thinking budget), se do paměti běžně vkládají desítky stran dokumentace nebo rozsáhlé codebase.

Pokud do modelu nahrajete padesátistránkový dokument nebo tisíce řádků kódu, Mac Mini nebo AMD Strix Halo spotřebují několik sekund jen na to, aby si text přečetly a začaly odpovídat. DGX Spark díky vysoké výpočetní hustotě vyřídí stejný úkol za zlomky sekundy.

Tento výkonnostní odstup je ještě výraznější u masivních modelů. Měření na pokročilém modelu GPT-OSS 120B (v rozvržení MXFP4) ukázala, že zatímco AMD Strix Halo dosahuje v prefillu rychlosti cca 339,87 tokenů/s, DGX Spark zvládá 1 723 až 1 821 tokenů/s. U kompaktnějšího modelu GPT-OSS 20B dokáže stanice DGX Spark v nástroji llama-bench vyhnat prefill až na 3 685 tokenů za sekundu.

Anatomie tří rivalů: Apple, AMD a NVIDIA

Každá ze tří testovaných architektur cílí na jinou skupinu uživatelů a přináší specifické výhody i kompromisy:

1. Apple Mac Mini (M4 Pro) – Král efektivity a ticha

Základní verze Macu Mini s cenou od 600 USD (v ČR od cca 17 500 Kč) představuje nejúspornější vstup do světa lokální AI. Při příkonu okolo 20 W nabízí zcela tichý chod a bezproblémové propojení unifikované paměti. Limitem základních modelů je však nižší kapacita RAM (16–24 GB), což znemožňuje spouštění větších modelů. Verze Mac Mini M4 Pro s 64 GB unifikované paměti vyjde na cca 1 200 USD (cca 32 000 Kč s DPH), což je však stále zlomek ceny enterprise konkurence.

2. AMD Strix Halo (Ryzen AI Max+ 395) – Skvělý poměr cena/paměť s softwarovým háčkem

Oficiální vývojářské systémy AMD s procesorem Ryzen AI Max+ 395 a 128 GB unifikované LPDDR5x paměti v ceně 3 999 USD nabízejí vynikající kapacitu paměti na vložený dolar. Umožňují bez problémů načíst do VRAM rozsáhlé modely s 70B až 120B parametry. AMD však naráží na softwarové překážky: podpora ekosystému ROCm v lokálním AI steku je stále proměnlivá. Pokud nová knihovna disponuje optimalizací pouze pro CUDA, výhoda 128 GB VRAM často narazí na komplikace při kompilaci.

3. NVIDIA DGX Spark – Neochvějný standard pro náročné nasazení

V cenovém rozpětí 3 999 až 4 699 USD dostává kupující plně odladěný ekosystém CUDA, 128 GB VRAM a optimalizované softwarové nástroje (například zrychlené načítání modelů pomocí fastsafetensors či vyladěné vLLM). Vedle špičkového prefillu disponuje DGX Spark integrovaným síťovým rozhraním ConnectX-7, které umožňuje snadné propojování více jednotek (clustering) do jednoho sdíleného paměťového poolu — což je cesta, kterou Apple ani AMD u svých kompaktních řešení neumožňují.

Dopad na české firmy a lokální vývojáře

Pro české vývojáře, startupy a firemní IT oddělení hraje lokální provoz AI modelů stále důležitější roli. Přísné požadavky na ochranu osobních údajů (GDPR) i evropská legislativní pravidla EU AI Act často neumožňují posílat citlivá firemní data či zdrojové kódy do cloudových API v zahraničí.

Provozování pokročilých modelů přímo na vlastní infrastruktuře tak představuje bezpečné a dlouhodobě nákladově efektivní řešení. Současné špičkové volně dostupné modely (např. řada Qwen3, GPT-OSS nebo DeepSeek-V4-Flash) navíc disponují kvalitní podporou češtiny a zvládnou lokalizované úkoly bez jakýchkoliv problémů.

Při výběru hardwaru pro české prostředí by rozhodnutí mělo vycházet z primárního charakteru práce:

  • Chat, běžné skriptování a kratší prompty: Pokud AI využíváte jako interaktivního asistenta pro psaní kódu či konverzaci, postačí vám Mac Mini nebo stanice na bázi AMD. Pocitová rychlost generování odpovědi bude srovnatelná s DGX Spark za zlomkovou cenu.
  • Rozsáhlé RAG systémy, velké soubory a autonomní agenti: Pokud budujete interní vyhledávač nad tisíci firemními dokumenty, zpracováváte stostránkové PDF smlouvy nebo provozujete autonomní agenty s dlouhou konverzační historií, investice do NVIDIA DGX Spark se okamžitě vrátí v podpodobě obrovské úspory času při načítání kontextu.

Co je to prefill a proč je při práci s AI tak důležitý?

Prefill je fáze, během které AI model načítá a zpracovává zadaný text (prompt, dokumenty, historii chatu) ještě předtím, než začne generovat samotnou odpověď. Čím vyšší je rychlost prefillu (měřená v tokenech za sekundu), tím kratší je prodleva před zobrazením prvního slova (TTFT), což je kritické zejména při práci s dlouhými kontexty a RAG databázemi.

Mám si pro lokální AI koupit raději stolní Mac Mini, nebo investovat do řešení od NVIDIA či AMD?

Pokud hledáte úsporný a tichý počítač na běžné konverzace, kódování a kratší prompty, Mac Mini M4 Pro (ideálně ve verzi s 64 GB RAM za cca 1 200 USD) nabízí skvělý výkon. Pokud však plánujete provozovat masivní modely (nad 70B parametrů), využívat plnou kompatibilitu s nástroji jako vLLM nebo propojovat více počítačů do sítě, jsou vhodnější stanice se 128 GB VRAM typu NVIDIA DGX Spark nebo AMD Strix Halo.

Jsou lokálně spouštěné open-weights modely plně použitelné v češtině?

Ano, moderní otevřené modely (jako je Qwen3, GPT-OSS či DeepSeek-V4-Flash) mají v trénovacích datech rozsáhlou multilingvální složku. V češtině zvládají plynule generovat text, analyzovat kód i zpracovávat odbornou dokumentaci přímo na vašem místním počítači bez nutnosti odesílat data do cloudu.

X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.