Přejít k hlavnímu obsahu

Dva Strix Halo propojené kabelem: AMD ukazuje cestu k lokální DeepSeek

Ilustrační obrázek pro jarvis-ai.cz
Dlouho platilo, že AMD Strix Halo je slepá ulička pro větší lokální modely: jeden procesor utáhne zhruba modely do sta gigabajtů, ale propojit dva kusy oficiálně neumí. Komunitní projekt nyní ukazuje opak: dva Ryzen AI MAX+ 395 spojené obyčejným Thunderbolt 5 kabelem rozjely DeepSeek V4 Flash ve 4bitové kvalitě s rychlostí zhruba 19–20 tokenů za sekundu. Ukazujeme, jak to funguje, co naměřil a kde jsou limity.

Proč se dva Strix Halo nedaly propojit

Strix Halo je vlajková loď AMD v kategorii APU: procesor Ryzen AI MAX+ 395 s integrovanou grafikou Radeon 8060S a až 128 GB jednotné paměti LPDDR5X. Právě kombinace velké paměti a propustnosti kolem 256 GB/s z něj dělá zajímavý základ pro lokální provoz jazykových modelů: model se vejde do paměti celý a neběží přes pomalé PCIe offloady.

Narozdíl od serverových GPU ale AMD u Strix Halo nenabízí žádný oficiální propojovací standard typu NVLink, CXL ani Infinity Fabric mezi dvěma kusy. Datacentrové akcelerátory Instinct se propojují přes Infinity Fabric, APU pro notebooky a mini PC takovou možnost nemá. Jedinou vysokorychlostní cestou ven zůstávají porty Thunderbolt 5 / USB4, které mají propustnost až 80 Gb/s. Otázka byla, jestli ji lze proměnit v něco užitečného pro AI inference.

OdinLink: Thunderbolt 5 jako plnohodnotné RDMA

Odpověď přišla z komunity. Projekt OdinLink proměňuje Thunderbolt 5 kabel v plnohodnotné RDMA propojení: obsahuje kernelový ovladač, knihovnu s implementací standardního rozhraní libibverbs a plugin pro komunikační knihovny RCCL/NCCL. Díky tomu aplikace, které umí mluvit přes verbs API (NCCL, MPI, PyTorch DDP), fungují po propojení dvou strojů kabelem bez úprav kódu.

Deklarované parametry jsou 80 Gb/s, latence pod mikrosekundu a přenos paměti GPU bez kopírování přes CPU (zero-copy). Projekt není jen technické cvičení, jeho součástí je i funkční vLLM/RCCL stack, takže OdinLink už reálně slouží i mimo tento konkrétní experiment.

DwarfStar: tensor parallelism se konečně dostal i na AMD

Samotný kabel ale nestačí. Inference modelu na dvou strojích najednou vyžaduje tensor parallelism, tedy rozdělení vah mezi oba počítače a průběžnou synchronizaci. Zde vstupuje do hry DwarfStar, specializovaný inferenční engine od Salvatore Sanfilippa (autora Redisu), zaměřený právě na DeepSeek V4 Flash. Zajímavost: jeho oficiální verze podporuje tensor parallelism jen na backendu Metal pro Mac; fork ds4-strix-halo-tp-odinlink tuto funkci portoval na ROCm a přidal podporu RDMA propojení.

V praxi to vypadá takto: model DeepSeek V4 Flash 0731 ve 4bitové kvantizaci Q4_K má váhy o velikosti 153,32 GiB, což se na jeden Strix Halo (s reálně dostupnými zhruba 96 GiB pro GPU) nevejde. Klíčové je, že 94,7 % vah tvoří routed experti směsice odborníků, ze kterých se při každém tokenu aktivuje jen část. DwarfStar proto rozdělí experty 50:50 mezi oba stroje, každý nese shard 80,76 GiB a při generování se přes RDMA posílají jen aktivace, ne váhy.

Nutný je i paměťový zásah do systému: Strix Halo defaultně zpřístupní GPU jen zhruba 62 GB z 128 GB. Kernel parametry amd_iommu=off a amdgpu.gttsize=126976 zvětší viditelnou paměť na potřebnou úroveň. Projekt dokumentuje, že bez tohoto kroku model ani nenačte.

Výsledky: devatenáct tokenů za sekundu

Autor forku publikoval měření na dvou Ryzen AI MAX+ 395 (2048 tokenů promptu a 300 generovaných, medián ze tří běhů):

  • OdinLink (Thunderbolt 5): prefill 231–233 tokenů/s, generování 19,1–19,2 tokenů/s
  • RoCE v2 (Mellanox ConnectX-4 Lx): prefill 248–275 tokenů/s, generování 18,2–20,4 tokenů/s

Pro srovnání: jeden NVIDIA DGX Spark (128 GB) dosáhne ve 2bitové kvantizaci zhruba 13,7 tokenů/s, MacBook s M5 Max kolem 34 tokenů/s. Devatenáct tokenů za sekundu tedy není rekord, ale je to plně použitelná rychlost pro interaktivní práci: odpověď na běžný dotaz přichází v řádu sekund až desítek sekund podle délky.

Důležité upozornění: čísla pocházejí z dokumentace projektu a nelze je nezávisle ověřit; autor je označuje jako reprodukovatelné (medián tří běhů, deterministický fingerprint), ale podklady jsou uložené v lokálním archivu, ne v repozitáři. Berte je jako solidní indikaci, ne jako nezávislý redakční test.

Co to znamená pro lokální AI

Praktický dopad je hlavně pro nadšence a malé firmy, které chtějí provozovat DeepSeek V4 Flash lokálně, kvůli soukromí dat, předvídatelným nákladům nebo práci s citlivými materiály. Dva propojené Strix Halo dají dohromady 256 GB paměti, což stačí nejen na model, ale i na velký kontext. DeepSeek V4 Flash podporuje až 1M tokenů a díky komprimované attention má KV cache výrazně menší než klasické modely.

Cenově to vychází zajímavě: Minisforum prodává Ryzen AI MAX+ 395 se 128 GB za 2 599 dolarů (model N5 MAX) až 2 920 dolarů (MS-S1 MAX), tedy dva kusy zhruba za 5 200–5 840 dolarů (kolem 120–140 tisíc korun). Pro srovnání: dva NVIDIA DGX Spark stojí v Česku 2 × 139 990 Kč a Mac Studio s M4 Max a 192 GB vychází na zhruba 137 tisíc korun. Strix Halo sestava je tak nejlevnější cestou k plné Q4_K verzi DeepSeek V4 Flash, byť s podstatně více nastavováním.

Na co si dát pozor

Projekt je mladý a experimentální: fork vznikl 6. srpna 2026, má jednotky hvězd a jednoho aktivního autora. DwarfStar sám sebe označuje za beta software, který se rychle mění. K tomu přistupují specifická rizika propojení:

  • Vlastní kernelový ovladač OdinLink: nezávislý modul, který si budete kompilovat sami
  • Vypnutý IOMMU (amd_iommu=off) kvůli paměťovému hacku, bezpečnostní kompromis, který se nehodí na stroj s důvěrnými daty
  • Lockstep synchronizace: při výpadku RDMA komunikace se obě GPU zastaví a proces je třeba ukončit opatrně, jinak zůstanou ve stavu čekání
  • Benchmarky jsou self-reported: reprodukovatelnost je zdokumentovaná, ale nezávislé měření chybí

A co jiné modely?

Propojení dává smysl jen u modelů, které se na jeden stroj nevejdou. Qwen 3.8 (27B) má ve 4bitové kvantizaci váhy jen kolem 17 GB, vejde se s obrovskou rezervou na jediný Strix Halo a propojení by nepřidalo nic kromě režie. Obří Qwen 3.8-Max (2,4 bilionu parametrů) se naopak nevejde ani na dva propojené stroje: ve 4bitové podobě potřebuje 1,3–1,4 TB. 

Jediným modelem, pro který tato sestava dává smysl, tak zůstává DeepSeek V4 Flash (případně GLM-5.2, který je ale ve 4bitové podobě ještě větší, 455 GB). A právě pro něj projekt funguje: kabel Thunderbolt 5 dokázal to, co AMD oficiálně neumí nabídnout.

Kolik stojí sestava dvou propojených Strix Halo?

Dva minipočítače s Ryzen AI MAX+ 395 a 128 GB paměti vyjdou na zhruba 120–140 tisíc korun (např. Minisforum MS-S1 MAX za 2 920 dolarů za kus), plus Thunderbolt 5 kabel. Pro srovnání: dva DGX Spark stojí v Česku 2 × 139 990 Kč, Mac Studio M4 Max 192 GB zhruba 137 tisíc Kč.

Potřebuji k propojení drahý switch nebo síťovou kartu?

Ne. OdinLink používá přímý Thunderbolt 5 kabel mezi oběma stroji, žádný switch. Alternativně projekt podporuje klasické RDMA přes síťovou kartu Mellanox s RoCE v2, která je v měřeních o něco rychlejší (prefill 248–275 vs. 231–233 tokenů/s), ale znamená další hardware.

Je to bezpečné pro provoz s citlivými daty?

S opatrností. Kvůli zvětšení viditelné paměti se vypíná IOMMU (amd_iommu=off), což snižuje izolaci zařízení; kombinace s vlastním kernelovým ovladačem OdinLink není vhodná pro stroje s důvěrnými daty nebo v prostředí, kde záleží na bezpečnostní certifikaci.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.