Obrázek
Model se vejde do VRAM. Proč s ním ale AI agent nemusí zvládnout projekt
Model se může vejít do VRAM a přesto být pro každodenní programování prakticky nepoužitelný. U lokálního LLM nestačí porovnat velikost GGUF souboru s kapacitou grafické karty. Do stejného rozpočtu se musí vejít také runtime, aktivace modelu, KV cache a pracovní kontext AI agenta. Právě poslední dvě položky vysvětlují, proč může krátký chat fungovat, zatímco otevření většího projektu v OpenCode nebo podobném nástroji skončí nedostatkem paměti.