Proč se dva Strix Halo nedaly propojit
Strix Halo je vlajková loď AMD v kategorii APU: procesor Ryzen AI MAX+ 395 s integrovanou grafikou Radeon 8060S a až 128 GB jednotné paměti LPDDR5X. Právě kombinace velké paměti a propustnosti kolem 256 GB/s z něj dělá zajímavý základ pro lokální provoz jazykových modelů: model se vejde do paměti celý a neběží přes pomalé PCIe offloady.
Narozdíl od serverových GPU ale AMD u Strix Halo nenabízí žádný oficiální propojovací standard typu NVLink, CXL ani Infinity Fabric mezi dvěma kusy. Datacentrové akcelerátory Instinct se propojují přes Infinity Fabric, APU pro notebooky a mini PC takovou možnost nemá. Jedinou vysokorychlostní cestou ven zůstávají porty Thunderbolt 5 / USB4, které mají propustnost až 80 Gb/s. Otázka byla, jestli ji lze proměnit v něco užitečného pro AI inference.
OdinLink: Thunderbolt 5 jako plnohodnotné RDMA
Odpověď přišla z komunity. Projekt OdinLink proměňuje Thunderbolt 5 kabel v plnohodnotné RDMA propojení: obsahuje kernelový ovladač, knihovnu s implementací standardního rozhraní libibverbs a plugin pro komunikační knihovny RCCL/NCCL. Díky tomu aplikace, které umí mluvit přes verbs API (NCCL, MPI, PyTorch DDP), fungují po propojení dvou strojů kabelem bez úprav kódu.
Deklarované parametry jsou 80 Gb/s, latence pod mikrosekundu a přenos paměti GPU bez kopírování přes CPU (zero-copy). Projekt není jen technické cvičení, jeho součástí je i funkční vLLM/RCCL stack, takže OdinLink už reálně slouží i mimo tento konkrétní experiment.
DwarfStar: tensor parallelism se konečně dostal i na AMD
Samotný kabel ale nestačí. Inference modelu na dvou strojích najednou vyžaduje tensor parallelism, tedy rozdělení vah mezi oba počítače a průběžnou synchronizaci. Zde vstupuje do hry DwarfStar, specializovaný inferenční engine od Salvatore Sanfilippa (autora Redisu), zaměřený právě na DeepSeek V4 Flash. Zajímavost: jeho oficiální verze podporuje tensor parallelism jen na backendu Metal pro Mac; fork ds4-strix-halo-tp-odinlink tuto funkci portoval na ROCm a přidal podporu RDMA propojení.
V praxi to vypadá takto: model DeepSeek V4 Flash 0731 ve 4bitové kvantizaci Q4_K má váhy o velikosti 153,32 GiB, což se na jeden Strix Halo (s reálně dostupnými zhruba 96 GiB pro GPU) nevejde. Klíčové je, že 94,7 % vah tvoří routed experti směsice odborníků, ze kterých se při každém tokenu aktivuje jen část. DwarfStar proto rozdělí experty 50:50 mezi oba stroje, každý nese shard 80,76 GiB a při generování se přes RDMA posílají jen aktivace, ne váhy.
Nutný je i paměťový zásah do systému: Strix Halo defaultně zpřístupní GPU jen zhruba 62 GB z 128 GB. Kernel parametry amd_iommu=off a amdgpu.gttsize=126976 zvětší viditelnou paměť na potřebnou úroveň. Projekt dokumentuje, že bez tohoto kroku model ani nenačte.
Výsledky: devatenáct tokenů za sekundu
Autor forku publikoval měření na dvou Ryzen AI MAX+ 395 (2048 tokenů promptu a 300 generovaných, medián ze tří běhů):
- OdinLink (Thunderbolt 5): prefill 231–233 tokenů/s, generování 19,1–19,2 tokenů/s
- RoCE v2 (Mellanox ConnectX-4 Lx): prefill 248–275 tokenů/s, generování 18,2–20,4 tokenů/s
Pro srovnání: jeden NVIDIA DGX Spark (128 GB) dosáhne ve 2bitové kvantizaci zhruba 13,7 tokenů/s, MacBook s M5 Max kolem 34 tokenů/s. Devatenáct tokenů za sekundu tedy není rekord, ale je to plně použitelná rychlost pro interaktivní práci: odpověď na běžný dotaz přichází v řádu sekund až desítek sekund podle délky.
Důležité upozornění: čísla pocházejí z dokumentace projektu a nelze je nezávisle ověřit; autor je označuje jako reprodukovatelné (medián tří běhů, deterministický fingerprint), ale podklady jsou uložené v lokálním archivu, ne v repozitáři. Berte je jako solidní indikaci, ne jako nezávislý redakční test.
Co to znamená pro lokální AI
Praktický dopad je hlavně pro nadšence a malé firmy, které chtějí provozovat DeepSeek V4 Flash lokálně, kvůli soukromí dat, předvídatelným nákladům nebo práci s citlivými materiály. Dva propojené Strix Halo dají dohromady 256 GB paměti, což stačí nejen na model, ale i na velký kontext. DeepSeek V4 Flash podporuje až 1M tokenů a díky komprimované attention má KV cache výrazně menší než klasické modely.
Cenově to vychází zajímavě: Minisforum prodává Ryzen AI MAX+ 395 se 128 GB za 2 599 dolarů (model N5 MAX) až 2 920 dolarů (MS-S1 MAX), tedy dva kusy zhruba za 5 200–5 840 dolarů (kolem 120–140 tisíc korun). Pro srovnání: dva NVIDIA DGX Spark stojí v Česku 2 × 139 990 Kč a Mac Studio s M4 Max a 192 GB vychází na zhruba 137 tisíc korun. Strix Halo sestava je tak nejlevnější cestou k plné Q4_K verzi DeepSeek V4 Flash, byť s podstatně více nastavováním.
Na co si dát pozor
Projekt je mladý a experimentální: fork vznikl 6. srpna 2026, má jednotky hvězd a jednoho aktivního autora. DwarfStar sám sebe označuje za beta software, který se rychle mění. K tomu přistupují specifická rizika propojení:
- Vlastní kernelový ovladač OdinLink: nezávislý modul, který si budete kompilovat sami
- Vypnutý IOMMU (amd_iommu=off) kvůli paměťovému hacku, bezpečnostní kompromis, který se nehodí na stroj s důvěrnými daty
- Lockstep synchronizace: při výpadku RDMA komunikace se obě GPU zastaví a proces je třeba ukončit opatrně, jinak zůstanou ve stavu čekání
- Benchmarky jsou self-reported: reprodukovatelnost je zdokumentovaná, ale nezávislé měření chybí
A co jiné modely?
Propojení dává smysl jen u modelů, které se na jeden stroj nevejdou. Qwen 3.8 (27B) má ve 4bitové kvantizaci váhy jen kolem 17 GB, vejde se s obrovskou rezervou na jediný Strix Halo a propojení by nepřidalo nic kromě režie. Obří Qwen 3.8-Max (2,4 bilionu parametrů) se naopak nevejde ani na dva propojené stroje: ve 4bitové podobě potřebuje 1,3–1,4 TB.
Jediným modelem, pro který tato sestava dává smysl, tak zůstává DeepSeek V4 Flash (případně GLM-5.2, který je ale ve 4bitové podobě ještě větší, 455 GB). A právě pro něj projekt funguje: kabel Thunderbolt 5 dokázal to, co AMD oficiálně neumí nabídnout.
Kolik stojí sestava dvou propojených Strix Halo?
Dva minipočítače s Ryzen AI MAX+ 395 a 128 GB paměti vyjdou na zhruba 120–140 tisíc korun (např. Minisforum MS-S1 MAX za 2 920 dolarů za kus), plus Thunderbolt 5 kabel. Pro srovnání: dva DGX Spark stojí v Česku 2 × 139 990 Kč, Mac Studio M4 Max 192 GB zhruba 137 tisíc Kč.
Potřebuji k propojení drahý switch nebo síťovou kartu?
Ne. OdinLink používá přímý Thunderbolt 5 kabel mezi oběma stroji, žádný switch. Alternativně projekt podporuje klasické RDMA přes síťovou kartu Mellanox s RoCE v2, která je v měřeních o něco rychlejší (prefill 248–275 vs. 231–233 tokenů/s), ale znamená další hardware.
Je to bezpečné pro provoz s citlivými daty?
S opatrností. Kvůli zvětšení viditelné paměti se vypíná IOMMU (amd_iommu=off), což snižuje izolaci zařízení; kombinace s vlastním kernelovým ovladačem OdinLink není vhodná pro stroje s důvěrnými daty nebo v prostředí, kde záleží na bezpečnostní certifikaci.