Přejít k hlavnímu obsahu

Běhat velké AI modely jde i bez NVIDIE. AMD ukazuje, jak na to

Ilustrační obrázek
Startup Zyphra spustil cloudovou platformu Zyphra Cloud, která běží výhradně na akcelerátorech AMD Instinct MI355X v datovém centru společnosti TensorWave. Cílí na velké otevřené jazykové modely s dlouhým kontextem a na agentní automatizaci. Zjednodušeně: na trhu AI infrastruktury se objevuje vážná alternativa k NVIDII, a to zrovna v momentě, kdy ceny uzavřených špičkových modelů zůstávají vysoko.

Co Zyphra spustila a pro koho to je

Zyphra se dlouhodobě profiluje na výzkum a provoz efektivních modelů. Nová platforma Zyphra Cloud nabízí bezserverovou službu Zyphra Inference, na které běží otevřené modely jako Kimi K2.5 a K2.6, DeepSeek V3.2 nebo GLM 5.1. Důraz je na úlohách, kde rozhoduje délka kontextu a schopnost agentního řízení — tedy zpracování dlouhých dokumentů, rozsáhlých kódových bází nebo vícestupňových úkolů, které model řeší sám. Věc, kterou je dobré si uvědomit: OpenAI, Anthropic nebo Google prodávají své modely skrze vlastní cloud a kód vám neukážou. Zyphra sází na opačný přístup — otevřené modely třetích stran na hardware, který si vybrala sama. Pro firmu, která si chce model auditovat nebo držet data pod vlastní kontrolou, je to zásadní rozdíl.

Proč zrovna AMD: u dlouhého kontextu rozhoduje paměť

U úloh s dlouhým kontextem není hlavní překážkou hrubý výpočetní výkon, ale paměť. Model si musí v rychlé paměti držet nejen své váhy, ale i celou historii konverzace, načtené soubory a mezivýsledky. A tady karta AMD Instinct MI355X boduje: má 288 GB paměti HBM3E s propustností až 8 TB/s a v inferenci má být až 35× výkonnější než předchozí řada MI300. Tady je můj vlastní výpočet, který čísla Zyphry ověřuje. Osm karet MI355X dá dohromady 2 304 GB paměti. Když na nich běží 545GB model (Kimi K2.6 v kvantizaci INT4), teoreticky by zbylo 1 759 GB — Zyphra uvádí 1 679 GB pro obslužnou cache, tedy zhruba 80 GB si vezme systém. U uzlu s osmi kartami NVIDIA B200 vychází podle stejného srovnání jen 911 GB. Rozdíl činí přibližně 768 GB ve prospěch AMD. Co to znamená v praxi? Do cache se vejde podstatně víc tokenů historie, aniž by se data musela přesouvat do pomalejšího úložiště. U agentních úloh, kde model čte a zapisuje mnoho mezivýsledků najednou, to přímo snižuje latenci i náklady.

Kimi K2.5 a agentní „roj" úkolů

Hlavním tahákem platformy je Kimi K2.5 od Moonshot AI. Model kombinuje nativní multimodální architekturu (text, obraz i video) s rozhraním Agent Swarm, které umí složitý úkol rozložit na paralelní dílčí úkoly a řešit je najednou. Podle výrobce to snižuje latenci až 4,5×. V benchmarku MMMU Pro dosahuje 75 % a v GDPval-AA skóre Elo 1309; trénovaný byl na zhruba 15 bilionech smíšených tokenů. Klíčové číslo je ale ekonomické. Operativní náklad Kimi K2.5 podle Artificial Analysis Intelligence Indexu činí 371 USD — to je více než 4× méně než u Claude Opus 4.5 a GPT-5.2. Pro srovnání: dnešní uzavřené špičkové modely jako GPT-6 Astra nebo Claude Fable 5.1 stojí 10 USD za milion vstupních tokenů a 50 USD za milion výstupních, zatímco levné otevřené modely jako DeepSeek V4.1 Flash se pohybují kolem 0,30 USD za milion vstupních tokenů (mimo špičku za polovinu). Rozpětí je obrovské a otevřené modely na vlastním hardware ho dokážou využít. Podstatná poznámka: Moonshot mezitím posunul architekturu dál a v červenci 2026 představil navazující Kimi K3 s benchmarkem PerceptionBench. Modely na Zyphra Cloudu tedy nejsou úplně nejnovější generací — zůstávají ale pro řadu firemních scénářů výkonné a hlavně levné.

AMD versus NVIDIA: co se skutečně mění

Závislost trhu na NVIDII byla dosud téměř absolutní. Teď se ale objevuje druhá použitelná cesta. Zyphra provozuje platformu na 15 MW infrastruktury TensorWave a podle případové studie ze srpna 2026 škálovala trénink uvažovacích modelů na clusterech AMD až na 20 bilionů tokenů. Přes léto se do produkce dostala architektura CDNA4, na které MI355X stojí. Pro evropské a české firmy z toho plyne jednoduchý závěr: otevřený model na nezávislém hardware znamená nižší riziko závislosti na jednom americkém dodavateli a snazší audit, což sedí i k požadavkům EU AI Act na transparentnost. Zyphra Cloud je dostupný jako standardní cloudová služba, takže k němu přistoupí i tým z Česka — a otevřené modely zvládají i češtinu, byť ne na úrovni angličtiny.

Kde jsou limity

Nadšení je na místě, ale s rezervou. Softwarový ekosystém AMD (ROCm) historicky zaostával za CUDA od NVIDIE a ne každý model či nástroj na něm běží hned. Čísla o výkonu navíc pocházejí z velké části z měření samotné Zyphry nebo jejích partnerů, nikoli z nezávislých testů. A operativní náklad 371 USD je index z jednoho konkrétního srovnání, ne univerzální ceník — skutečná cena závisí na konkrétním workloadu. Zkratka MI355X a model Kimi K2.5 jsou přesvědčivé, ale pro běžného uživatele se dnes nemění nic. Změna se odehrává o patro níž: tam, kde se rozhoduje, na čem a za kolik poběží AI aplikace, které používáme.

Běží Zyphra Cloud i na NVIDII, nebo jen na AMD?

Platforma Zyphra Cloud je postavená na akcelerátorech AMD Instinct MI355X v infrastruktuře TensorWave. Jde o čistě AMD řešení — právě to je její hlavní odlišnost od běžných cloudů, které staví na kartách NVIDIA.

Můžu si na Zyphra Cloudu spustit vlastní model, nebo jen ty nabízené?

Nabízený záběr tvoří otevřené modely jako Kimi K2.5, Kimi K2.6, DeepSeek V3.2 a GLM 5.1. Bezserverová služba je stavěná primárně pro tyto modely; pro běh zcela vlastního modelu je potřeba si podporu ověřit přímo u Zyphry.

Je Kimi K2.5 dostupný v češtině?

Kimi K2.5 patří mezi otevřené modely, které češtinu zvládají, ale její kvalita v češtině nedosahuje úrovně angličtiny. Pro běžnou práci v českém prostředí je použitelný, u náročných nebo kreativních textů se vyplatí výsledek ověřit.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.