Přejít k hlavnímu obsahu

NVIDIA chce zrychlit vlastní AI čipy. NVHBM přidává paměť a šetří energii

Ilustrační obrázek
NVIDIA rozšiřuje svou platformu NVLink Fusion o vlastní návrh vysokorychlostní paměti NVHBM. Nejde o paměť pro grafickou kartu v domácím počítači, ale o technologii pro cloudové společnosti a výrobce vlastních AI akcelerátorů. Podle oficiálních materiálů NVIDIA k platformě NVLink Fusion a NVHBM může NVHBM nabídnout až o 30 % vyšší propustnost paměti, až o 15 % nižší spotřebu paměťového subsystému a více prostoru pro výpočetní část čipu. Jedním z prvních oznámených partnerů má být Amazon prostřednictvím své divize Annapurna Labs.

NVIDIA nechce dodávat jen GPU. Chce řídit celý AI server

Vývoj umělé inteligence se stále více přesouvá od jednotlivých grafických procesorů k celým rackům, ve kterých spolupracují desítky akcelerátorů. V takovém systému už nestačí mít rychlý čip. Výkon může brzdit komunikace mezi akcelerátory, paměť, napájení, chlazení nebo software pro řízení celého clusteru.

Právě na tento problém míří NVIDIA NVLink Fusion. Platforma umožňuje hyperscalerům a dalším velkým zákazníkům zapojit do infrastruktury NVIDIA vlastní procesory a AI akcelerátory, označované jako XPU. Ty pak mohou využívat technologii NVLink, rackovou architekturu MGX, síťové prvky a další části infrastruktury NVIDIA.

Jednoduše řečeno: cloudová firma si může navrhnout vlastní čip pro konkrétní úlohy, ale nemusí kvůli tomu stavět celý datový systém od základů. NVIDIA jí chce dodat „silnice“ mezi čipy, podobu serverových racků a část softwarového zázemí. Nyní do této nabídky přidává také vlastní technologii pro paměť HBM.

Co je NVHBM a proč na paměti tolik záleží

HBM neboli High Bandwidth Memory je typ paměti umístěný velmi blízko výpočetního čipu. Paměťové vrstvy jsou v ní poskládané na sebe a propojené pomocí vertikálních spojů. Výsledkem je mnohem vyšší datová propustnost než u běžné systémové paměti, kterou najdeme například v notebooku nebo desktopu.

AI akcelerátor přitom neustále načítá parametry modelu, mezivýsledky a takzvaný KV cache. Ten se používá při generování odpovědí jazykových modelů. Pokud výpočetní jednotky čekají, až jim paměť dodá další data, drahý akcelerátor se chová trochu jako kuchař, který má perfektní recept, ale suroviny mu někdo nosí po jedné.

NVHBM je vlastní návrh základní vrstvy HBM, tedy takzvaného base die. NVIDIA uvádí, že do něj zapojila vlastní paměťový řadič a fyzické rozhraní PHY. Tento návrh má být validován s předními výrobci pamětí, takže zákazník nemusí celý paměťový systém kvalifikovat od nuly.

To je důležitý detail. U vlastního AI čipu totiž nestačí navrhnout výpočetní jádra. Výrobce musí ještě ověřit, že spolu správně funguje samotný čip, pouzdro, interposer, paměťové vrstvy, napájení a chlazení. Právě tato fáze může vývoj výrazně prodloužit a prodražit.

Až o 30 % vyšší propustnost, ale nejde o univerzální zrychlení

Podle technického popisu NVIDIA poskytuje NVHBM až o 30 % vyšší propustnost na jeden paměťový stack ve srovnání se standardní HBM4e. Jde o tvrzení NVIDIA, nikoli o nezávislé měření. Tato propustnost může pomoci především úlohám, které jsou omezené rychlostí paměti. Typickým příkladem je inference velkých jazykových modelů, práce s dlouhým kontextem nebo některé fáze trénování.

Formulace „až“ je zde podstatná. Neznamená, že každý model poběží automaticky o 30 % rychleji. Pokud je aplikace limitována výpočetní kapacitou, komunikací v síti nebo jinou částí systému, vyšší rychlost HBM se do výsledku promítne méně. NVIDIA ve svých oficiálních materiálech uvádí také až 30% celkové zvýšení výkonu XPU při kombinaci NVHBM a NVLink Fusion, jde však o údaj výrobce pro konkrétní architektonické srovnání, nikoli o nezávislý benchmark proti veřejně dostupným akcelerátorům.

Ve veřejném oznámení nejsou uvedeny konkrétní výsledky testů s modely GPT, Gemini nebo Claude. Dává to smysl: NVHBM není samostatný AI model ani produkt, který by si uživatel mohl otevřít v prohlížeči. Je to stavební prvek pro datacentra a jeho přínos závisí na návrhu celého XPU, použitém modelu a způsobu nasazení.

Ušetřené místo může být cennější než samotná rychlost

Druhou výhodou NVHBM má být úspora místa na výpočetním čipu. NVIDIA ve svém technickém materiálu uvádí, že její návrh může oproti rozhraní podle standardu JEDEC HBM4e zmenšit plochu PHY a podpůrných obvodů až o 67 %. Jde o porovnání plochy fyzického rozhraní PHY a souvisejících podpůrných obvodů, nikoli celého čipu. Užší rozhraní zároveň zjednodušuje vedení spojů v interposeru, tedy vrstvě, která propojuje výpočetní čip s pamětí.

Uvolněnou plochu lze využít pro další výpočetní jednotky, větší cache, specializované obvody nebo rychlejší komunikaci s ostatními akcelerátory. NVIDIA ve stejném materiálu uvádí až 25 % více prostoru pro výpočetní část XPU ve srovnání s řešením založeným na standardní HBM4e. Samostatně NVIDIA uvádí také až 30 % větší plochu hlavního die; toto číslo se týká porovnání plochy hlavního die, nikoli pouze jeho výpočetní části nebo plochy PHY. Nejde tedy o stejnou metriku: 25 % popisuje prostor pro výpočetní část XPU, zatímco 30 % se vztahuje k celkové ploše hlavního die.

Pro návrháře vlastního akcelerátoru to znamená větší volnost. Místo dalšího zvětšování celého pouzdra může výrobce získat prostor pro obvody optimalizované například na doporučovací systémy, multimodální modely nebo inference s dlouhým kontextem.

Spotřeba: malé procento, velké datacentrum

NVIDIA dále ve svém technickém materiálu uvádí až 15% snížení spotřeby HBM oproti standardní HBM4e. Jde o tvrzení NVIDIA, nikoli o nezávislé měření. Samotná paměť samozřejmě není jedinou položkou energetické bilance AI akcelerátoru. U moderních systémů se musí počítat také výpočetní část čipu, síť, napájecí měniče a chlazení.

V racku s tisíci akcelerátorů se však i relativně malé procento násobí. Nižší spotřeba paměti může uvolnit část rozpočtu pro výpočet, snížit nároky na chlazení nebo umožnit umístit do stejného energetického limitu více akcelerátorů. Modelový příklad NVIDIA s datacentrem o příkonu 1 GW a XPU s příkonem 2 000 W proto obecně ilustruje, že úspora energie v paměťovém subsystému může v daném energetickém limitu vytvořit prostor pro další akcelerátory. Konkrétní počet dalších XPU z veřejných podkladů jednoznačně nevyplývá, protože by závisel na podílu spotřeby HBM na celkové spotřebě XPU a na dalších předpokladech konfigurace. Nejde tedy o slíbenou konfiguraci konkrétního datacentra.

NVLink 6 propojí vlastní čipy s infrastrukturou NVIDIA

NVHBM řeší datový tok uvnitř jednotlivého akcelerátoru. NVLink Fusion řeší komunikaci mezi akcelerátory a zbytkem systému. Podle aktuálních oficiálních materiálů NVIDIA k NVLink Fusion dokáže šestá generace NVLink propojit 72 XPU v režimu all-to-all s rychlostí až 3,6 TB/s na XPU. Celý 72akcelerátorový NVLink doménový systém má podle materiálů NVIDIA poskytovat až 260 TB/s propustnosti. Jde o údaje NVIDIA, nikoli o nezávislé měření.

To je důležité například pro expert parallelism, kdy různé části modelu běží na různých akcelerátorech. Akcelerátory si musí rychle předávat aktivace, skryté stavy a informace z cache. Pokud je komunikace pomalá, přínos rychlejší lokální paměti se začne ztrácet.

Novinka tedy není jen o „rychlejší RAM pro AI“. NVIDIA se snaží propojit tři vrstvy: vlastní nebo partnerský výpočetní čip, paměťový subsystém NVHBM a rackovou síť NVLink Fusion. V ideálním případě pak provozovatel dostane heterogenní systém, ve kterém mohou vedle sebe pracovat GPU NVIDIA a vlastní XPU.

Jedním z prvních oznámených partnerů je Amazon, běžný zákazník se k NVHBM nedostane

Jedním z prvních oznámených spolupracovníků je Annapurna Labs, vývojová divize Amazon Web Services. Amazon chce technologii NVHBM zkoumat zejména v kombinaci se svými čipy Trainium4 a platformou NVLink Fusion. NVIDIA a AWS uvádějí, že cílem je spojit vlastní silikon Amazonu s paměťovou technologií NVIDIA a společnou rackovou architekturou.

Pro český a evropský trh to zatím neznamená nový hardware dostupný v běžném e-shopu ani službu v češtině. NVHBM je technologie určená pro návrh a provoz cloudové infrastruktury. Česká dostupnost se proto může projevit až nepřímo — například v nabídce cloudových AI služeb, jejich ceně nebo rychlosti nasazení modelů. NVIDIA sice provozuje evropskou i českou lokalizaci svých webových stránek, samotná NVHBM ale není produkt určený koncovým uživatelům a NVIDIA nezveřejnila spotřebitelskou cenu.

Co z toho plyne

NVHBM je zajímavá hlavně proto, že ukazuje další fázi vývoje AI infrastruktury. Výrobci už neřeší pouze to, kolik výpočetních jader přidají do jednoho čipu. Stejně důležité je, jak rychle se k nim dostanou data, kolik místa zabere paměťové rozhraní a kolik energie spotřebuje celý systém.

Pro NVIDIA jde zároveň o chytrý způsob, jak si udržet vliv i v době, kdy si největší cloudové firmy navrhují vlastní akcelerátory. Nemusí prodávat každý výpočetní čip. Stačí, když vlastní konektivita, paměť a racková infrastruktura zůstanou součástí výsledného systému.

Limitem je, že oznámení zatím popisuje technologii a partnerskou spolupráci, nikoli konkrétní sériově dostupný produkt s cenou, kapacitou paměti a nezávislými testy. NVHBM proto zatím beru jako důležitý stavební kámen pro budoucí cloudové čipy, ne jako něco, co by zítra změnilo výkon notebooku na stole.

FAQ

Je NVHBM nová paměť pro grafické karty GeForce?

Ne. NVHBM je technologie určená pro vlastní AI akcelerátory a datacentra. NVIDIA ji představuje v rámci platformy NVLink Fusion, nikoli jako paměťový modul pro běžné grafické karty nebo domácí počítače.

Lze NVHBM koupit samostatně nebo objednat pro vlastní počítač?

Ne. NVIDIA ji nabízí jako součást návrhového a infrastrukturního ekosystému pro hyperscalery, výrobce čipů a další velké partnery. Veřejná cena ani maloobchodní dostupnost nebyly oznámeny.

Znamená tvrzení NVIDIA o až o 30 % vyšší propustnosti automaticky o 30 % rychlejší AI model?

Ne. Vyšší propustnost pomůže především úlohám omezeným rychlostí paměti. Výsledné zrychlení závisí také na výpočetní části XPU, síti NVLink, velikosti modelu, práci s KV cache a konkrétní aplikaci. Údaj o až 30% celkovém přínosu uvádí NVIDIA ve svém oficiálním materiálu pro kombinaci NVHBM a NVLink Fusion.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.