Kalkulačka VRAM pro lokální AI: Výpočet paměti pro LLM
Lokální AI ve firmě
Stačí váš hardware na každodenní práci s AI?
Posouzení musí zahrnout nejen model, ale také pracovní úlohy, délku konverzací a souběžnou práci lidí i agentů. Výpočet je pouze aritmetika veřejných dat modelů — neběží žádná inference ani měření výkonu.
Kapacita paměti se porovnává se známou spodní mezí (velikost vah a teoretická KV cache). Runtime buffery a stav nejsou ověřené, proto výsledek nikdy nevyhlašujeme jako garantované vejití do paměti.
Výsledek
Zatím nic nespočítáno. Upravte formulář nebo stiskněte „Spočítat“.
K čemu kalkulačka slouží
Kalkulačka paměťových nároků pro lokální AI slouží systémovým architektům a IT specialistům k rychlému ověření hardwarové proveditelnosti nasazení otevřených jazykových modelů ve firemní infrastruktuře. Nástroj provádí deterministickou aritmetiku veřejně dostupných technických parametrů, nikoli empirické měření chování na konkrétním stroji. Výpočet kombinuje velikost vah modelu ve formátu GGUF s teoretickou velikostí KV cache pro zvolené kontextové okno, například pro Qwen3.8-27B nebo DeepSeek V4 Flash. Výsledkem je exaktní spodní mez paměti nutná k zavedení a elementárnímu běhu modelu bez systémové režie. Tento údaj nepředstavuje záruku kompatibility běhového prostředí ani odhad rychlosti generování. Slouží výhradně jako rozhodovací síto pro posouzení, zda má smysl danou hardwarovou sestavu začít reálně testovat, nebo zda je fyzická kapacita VRAM a RAM striktně nedostatečná.
Rychlé odpovědi
Kolik VRAM potřebuje model Qwen3.8-27B Q4_K_M?
Stačí GPU s 48 GB VRAM na provoz DeepSeek V4 Flash?
Co je offload do RAM a je reálně použitelný v praxi?
Jaký je rozdíl mezi nativním kontextem 262K a uživatelským limitem kontextu?
Proč kalkulačka neuvádí rychlost generování v tokenech za sekundu?
Co přesně znamená pojem 'známá spodní mez paměti'?
Metodika a zdroje
Metodika kalkulačky vychází z čistě deterministických a veřejně ověřitelných dat o architekturách velkých jazykových modelů. Primárním zdrojem technických parametrů jsou oficiální model cards vývojářů na platformě Hugging Face a přesné fyzické velikosti distribuovaných GGUF souborů, které slouží jako spolehlivá proxy pro velikost alokovaných vah v paměti. Matematický model KV cache počítá s exaktními rozměry skrytých stavů a počtem vrstev konkrétní architektury; například model Qwen3.8-27B spotřebovává při formátu f16 přesně 64 KiB na token napříč 16 full-attention vrstvami.
Kalkulačka má jasně vymezené technické hranice a limity:
- Neověřený výkon: Nástroj neuvádí ani neodhaduje rychlost generování (tok/s). Výkon je přímo závislý na fyzické propustnosti paměťové sběrnice GPU či propustnosti PCIe při offloadu, nikoli na statické kapacitě paměti.
- Kompatibilita a stabilita: Aritmetická proveditelnost nezaručuje softwarovou kompatibilitu běhových prostředí llama.cpp, vLLM, ovladačů CUDA či ROCm.
- Spodní mez bez systémové režie: Výsledek představuje teoretické minimum paměti. Nezahrnuje systémovou režii operačního systému, aktivace modelu ani kontextové buffery knihoven.
Co znamená kontext 64K?
Kontext je pracovní paměť jednoho rozhovoru nebo agenta. Rozpočet se skládá ze vstupu (zadání a vložené dokumenty), historie konverzace, výsledků nástrojů (tools) a prostoru pro vznikající odpověď (reply).
V této kalkulačce znamená 64K celkem 65 536 tokenů. Token je část textu, ne nutně celé slovo. Maximální velikost okna není totéž co právě využitý kontext a převody na počet stránek zde neuvádíme jako fakt.