Přejít k hlavnímu obsahu

Kalkulačka VRAM pro lokální AI: Výpočet paměti pro LLM

Lokální AI ve firmě

Stačí váš hardware na každodenní práci s AI?

Posouzení musí zahrnout nejen model, ale také pracovní úlohy, délku konverzací a souběžnou práci lidí i agentů. Výpočet je pouze aritmetika veřejných dat modelů — neběží žádná inference ani měření výkonu.

Orientační přepočet, nikoli měření.

Kapacita paměti se porovnává se známou spodní mezí (velikost vah a teoretická KV cache). Runtime buffery a stav nejsou ověřené, proto výsledek nikdy nevyhlašujeme jako garantované vejití do paměti.

Model a scénář

Výběr modelu přepne nabídku kvantizací a maximální kontext.

Formát je matematický profil GGUF/llama.cpp; podpora konkrétním backendem není ověřená. Menší kvantizace je vždy kompromis kvality.

Typický použije obvyklý vstup, špička a zátěžový dlouhý vstup. Zátěžový navíc počítá se všemi lidmi aktivními.

Hardware

Jde jen o velikost paměti karty, ne o konkrétní model GPU.

Popisek se nevyužívá k odhadu výkonu.

Povinné jen pro režim offload.

Teoretický profil pro plné attention vrstvy; podpora backendem není ověřená.

Vlastní limit pod nativním maximem modelu, ne automaticky celé maximum.

Pracovní skupiny

Skupina lidí se počítá z počtu, aktivity a agentů na osobu. Batch skupina se počítá ze souběžných úloh. Maximálně 20 skupin.

Výsledek

Zatím nic nespočítáno. Upravte formulář nebo stiskněte „Spočítat“.

K čemu kalkulačka slouží

Kalkulačka paměťových nároků pro lokální AI slouží systémovým architektům a IT specialistům k rychlému ověření hardwarové proveditelnosti nasazení otevřených jazykových modelů ve firemní infrastruktuře. Nástroj provádí deterministickou aritmetiku veřejně dostupných technických parametrů, nikoli empirické měření chování na konkrétním stroji. Výpočet kombinuje velikost vah modelu ve formátu GGUF s teoretickou velikostí KV cache pro zvolené kontextové okno, například pro Qwen3.8-27B nebo DeepSeek V4 Flash. Výsledkem je exaktní spodní mez paměti nutná k zavedení a elementárnímu běhu modelu bez systémové režie. Tento údaj nepředstavuje záruku kompatibility běhového prostředí ani odhad rychlosti generování. Slouží výhradně jako rozhodovací síto pro posouzení, zda má smysl danou hardwarovou sestavu začít reálně testovat, nebo zda je fyzická kapacita VRAM a RAM striktně nedostatečná.

Rychlé odpovědi

Kolik VRAM potřebuje model Qwen3.8-27B Q4_K_M?
Model Qwen3.8-27B ve variantě Q4_K_M vyžaduje pro samotné váhy minimálně 15,33 GiB VRAM, ke kterým je nutné přičíst paměť pro KV cache. Při standardní f16 přesnosti spotřebovává KV cache přesně 64 KiB na jeden token díky 16 full-attention vrstvám. Pro kontextové okno 64K (65 536 tokenů, tedy zhruba 13 stran A4 textu) naroste KV cache o dalších 4,00 GiB. Celková známá spodní mez paměti pro tuto konfiguraci je 19,33 GiB bez započtení systémové režie.
Stačí GPU s 48 GB VRAM na provoz DeepSeek V4 Flash?
Samotná jedna GPU s 48 GB VRAM na plný lokální provoz modelu DeepSeek V4 Flash nestačí. Váhy tohoto modelu v kvantizaci UD-Q4_K_XL zabírají samy o sobě 144,44 GiB, což výrazně přesahuje kapacitu jakékoli běžné 48GB grafické karty. Tento model vyžaduje buď distribuci mezi více akcelerátorů s celkovou VRAM přesahující tuto hodnotu plus KV cache, nebo agregované zapojení systémové operační paměti RAM pro uložení zbývajících vah.
Co je offload do RAM a je reálně použitelný v praxi?
Offload do RAM je technika, kdy se část vah modelu přesune z grafické paměti VRAM do systémové operační paměti počítače. Tento postup sice umožní načíst rozsáhlý model i na hardwaru s menší GPU, ale představuje pouze agregátní nutnou podmínku pro spuštění. Z důvodu propustnosti sběrnice PCIe dochází k masivnímu propadu rychlosti zpracování, což z něj pro interaktivní firemní produkční nasazení často činí nepoužitelné řešení.
Jaký je rozdíl mezi nativním kontextem 262K a uživatelským limitem kontextu?
Nativní kontext udává maximální teoretickou délku okna podporovanou architekturou modelu, zatímco uživatelský limit je záměrně nastavený strop v inferenčním serveru. Nativní kontext 262K tokenů umožňuje zpracovat masivní objemy dat, ale alokuje enormní množství VRAM pro KV cache. Omezením kontextu v konfiguraci například na 64K tokenů (65 536 tokenů) dramaticky snížíte paměťové nároky KV cache, čímž uvolníte VRAM pro samotný běh modelu.
Proč kalkulačka neuvádí rychlost generování v tokenech za sekundu?
Kalkulačka neuvádí rychlost generování, protože počet tokenů za sekundu závisí na mnoha dynamických faktorech, které z čisté velikosti paměti nelze vypočítat. Skutečná rychlost je určena paměťovou propustností konkrétního hardwaru, verzí inferenčního enginu, instrukční sadou CPU či vytížením sběrnice PCIe při offloadu. Kalkulačka se striktně omezuje na ověřitelnou aritmetiku alokace paměti, nikoli na nepodložené odhady výkonu.
Co přesně znamená pojem 'známá spodní mez paměti'?
Známá spodní mez paměti označuje striktně minimální součet velikosti souboru s váhami modelu a alokace pro KV cache při daném kontextu. Tento údaj nezahrnuje další nutné paměťové přirážky, jako jsou režie operačního systému, kontext běhového prostředí CUDA/ROCm, aktivační paměť vrstev či fragmentace paměti. V reálném nasazení je skutečná spotřeba vždy vyšší než tato teoretická spodní mez.

Metodika a zdroje

Metodika kalkulačky vychází z čistě deterministických a veřejně ověřitelných dat o architekturách velkých jazykových modelů. Primárním zdrojem technických parametrů jsou oficiální model cards vývojářů na platformě Hugging Face a přesné fyzické velikosti distribuovaných GGUF souborů, které slouží jako spolehlivá proxy pro velikost alokovaných vah v paměti. Matematický model KV cache počítá s exaktními rozměry skrytých stavů a počtem vrstev konkrétní architektury; například model Qwen3.8-27B spotřebovává při formátu f16 přesně 64 KiB na token napříč 16 full-attention vrstvami.

Kalkulačka má jasně vymezené technické hranice a limity:

  • Neověřený výkon: Nástroj neuvádí ani neodhaduje rychlost generování (tok/s). Výkon je přímo závislý na fyzické propustnosti paměťové sběrnice GPU či propustnosti PCIe při offloadu, nikoli na statické kapacitě paměti.
  • Kompatibilita a stabilita: Aritmetická proveditelnost nezaručuje softwarovou kompatibilitu běhových prostředí llama.cpp, vLLM, ovladačů CUDA či ROCm.
  • Spodní mez bez systémové režie: Výsledek představuje teoretické minimum paměti. Nezahrnuje systémovou režii operačního systému, aktivace modelu ani kontextové buffery knihoven.
Co znamená kontext 64K?

Kontext je pracovní paměť jednoho rozhovoru nebo agenta. Rozpočet se skládá ze vstupu (zadání a vložené dokumenty), historie konverzace, výsledků nástrojů (tools) a prostoru pro vznikající odpověď (reply).

V této kalkulačce znamená 64K celkem 65 536 tokenů. Token je část textu, ne nutně celé slovo. Maximální velikost okna není totéž co právě využitý kontext a převody na počet stránek zde neuvádíme jako fakt.

X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.