Co je DeepSeek V4 Flash 0731 a proč je tak zajímavý
DeepSeek V4 Flash je Mixture-of-Experts model se 284 miliardami parametrů, z nichž se na každý token aktivuje jen 13 miliard. Právě díky řídké architektuře dosahuje výkonu srovnatelného s mnohem většími modely při zlomku výpočetního výkonu. Verze 0731 z 31. července 2026 je post-training update — nejde o novou architekturu, ale o vyladění, které z modelu vytáhlo dramaticky lepší výsledky.
Oficiální benchmarky zveřejněné na stránkách Unsloth, které kvantizace připravují, ukazují skok zejména v agentickém kódování: na testu DeepSWE skočil z 7,3 % u preview na 54,4 %, na Terminal Bench 2.1 dosahuje 82,7 (V4 Pro preview jen 61,8) a na DSBench-Hard 59,6. Podle tvůrců model poráží GLM 5.2 téměř ve všech testech a blíží se výsledkům Claude Opus 4.8 — přestože je jen zlomkem jeho velikosti. Kontextové okno má 1 milion tokenů, licence je MIT.
Jedno upozornění k benchmarkům: část výsledků vznikla pod vlastním DeepSeek harnessem, který je pro model optimalizovaný. Jak ukázala i studie OpenAI u Arc-AGI (skóre 13 % → 40 % jen výměnou harnessu), volba testovacího prostředí výsledky výrazně ovlivňuje. Reálné zkušenosti tak mohou být o něco střízlivější než oficiální tabulky.
Co reálně potřebujete pro lokální provoz
Nároky závisí čistě na zvolené kvantizaci. Čím nižší přesnost, tím menší model v paměti — ale i znatelnější ztráta kvality. Ověřená čísla z Unsloth dokumentace a reality checků:
- 3bit (UD-IQ3_XXS) — soubor 103 GB, doporučených alespoň 110 GB paměti. Doporučená volba pro 128GB stroje.
- 4bit (UD-Q4_K_XL) — soubor 155 GB, minimum 162 GB. Kvalita ~96 % shody s plným modelem — pozor, není lossless, i když se to v mnoha článcích tvrdí.
- 8bit (UD-Q8_K_XL) — soubor 162 GB, minimum 169 GB. Jediná skutečně bezztrátová varianta, bit-identická s oficiálními váhami.
Důležité upřesnění: počítá se celková dostupná paměť (RAM + VRAM), ne jen VRAM grafické karty. Běžná herní GPU s 24–32 GB nestačí — model s offloadem expertů do systémové RAM spadne na jednotky tokenů za sekundu, což je nepoužitelné. Rozumného výkonu dosáhnete na strojích s velkou unified memory: 128 GB zvládne zhruba 6 tokenů/s, 192 GB a více už okolo 25 tokenů/s.
DwarfStar: DeepSeek i na strojích s 96–128 GB paměti
Pro menší stroje existuje specializovaná cesta: open-source engine DwarfStar (repo antirez/ds4) od Salvatore Sanfilippa, tvůrce databáze Redis. Jde o úzce zaměřený inference engine psaný v C, který není obecným runnerem jako llama.cpp — je stavěný primárně pro DeepSeek V4 Flash (podporuje i GLM 5.2 a na velkých strojích V4 PRO), takže model loading, tool calls, KV cache, HTTP server i coding agent jsou testované jako jeden celek.
Jeho hlavní trik je asymetrická 2-bit kvantizace: kvantizují se pouze routed MoE experti (gate/up na IQ2_XXS, down na Q2_K), zatímco shared experti, projekce a routing zůstávají v plné přesnosti. Proto jsou jeho 2-bit kvanty překvapivě použitelné — model se vejde na 96/128 GB stroje (4bit verze pak vyžaduje 256 GB+). Druhým trikem je SSD streaming: non-routed váhy zůstávají v paměti, routed experti se načítají z disku na cache miss, takže běží i model větší než RAM. Třetí výbavou je DSpark — pomocný draft model přímo od DeepSeeku, který navrhuje až pět budoucích tokenů a hlavní model je jen verifikuje, což zrychluje generování hlavně u kódu.
Naměřené rychlosti z dokumentace projektu: na DGX Spark (q2) generace 13,75 tokenů/s, na MacBooku M5 Max se 128 GB (q2) až 34 tokenů/s, Mac Studio M3 Ultra 512 GB (q4) kolem 35 tokenů/s. Server s osmi kartami L40S zvládne agregovaných 120 tokenů/s generace a 2 000 tokenů/s prefill — engine tak umí proměnit starší CUDA karty, které už vLLM nepodporuje, ve firemní multi-user LLM server. DwarfStar běží na Metalu (Mac), CUDA (včetně DGX Spark) i ROCm (Strix Halo).
NVIDIA DGX Spark: superpočítač na stole
Nejpřímější cestou k lokálnímu provozu je NVIDIA DGX Spark — kompaktní desktopová stanice s čipem GB10 Grace Blackwell, 128 GB sjednocené paměti LPDDR5x, výkonem až 1 petaFLOP ve FP4 a příkonem jen 240 W. Na jednom Sparksu spustíte modely až do 200 miliard parametrů, propojením dvou přes ConnectX-7 (200 Gb/s) až 405 miliard — což je přesně případ DeepSeek V4 Flash.
Právě na dvou propojených DGX Sparks testoval model youtuber Prompt Engineering (245 tisíc odběratelů): ve 4bit přesnosti dosahoval 20–30 tokenů za sekundu, u agentických úkolů (tvorba encyklopedie Pokémonů, tracker ISS) neviděl chyby a oceňoval čistý chain-of-thought bez verbose výlevů starších DeepSeek modelů. Na jednom Sparksu běží model v 3bit přesnosti na hraně paměti.
Cena: 139 990 Kč na Alze (jeden kus). To je pořádná investice — a proto je férové se ptát, jestli se vyplatí.
Cloud versus lokál: kdy se nákup vyplatí
Cloudové API DeepSeek je extrémně levné. Ověřeno v oficiálním ceníku (1. srpna 2026): $0,14 za milion vstupních tokenů (při cache hit jen $0,0028) a $0,28 za milion výstupních tokenů — v přepočtu zhruba 3,2 Kč / 6,4 Kč za milion tokenů. Pozor na čísla z některých videí (uvádějí $0,02/$0,30) — oficiální ceník je jiný.
Pro běžné použití, testování i středně velké projekty nemá lokální provoz ekonomicky smysl. Počítejte sami: i kdybyste každý den zpracovali 10 milionů výstupních tokenů (to je obrovské množství), měsíčně zaplatíte zhruba 1 900 Kč. Na 139 990 Kč za Spark byste se dostávali až za zhruba šest let provozu.
Lokální provoz dává smysl ve dvou případech:
- Data musí zůstat doma — zdravotnictví, finance, právní kanceláře, výroba. Posílání citlivých dat do cloudového API (navíc provozovaného mimo EU) je pro řadu firem nepřípustné. Tady je lokální model jediná cesta.
- Velký a dlouhodobý projekt — tisíce agentů, nonstop běžící workloady, miliony tokenů denně. Tady se ekonomika začíná obracet, zvlášť když započítáte, že jeden Spark běží nonstop za ~55 W v zátěži a neúčtuje za token navíc.
Návratnost tedy nemusí být hned — u menších projektů nemusí přijít nikdy. Je to nástroj pro firmy s reálným objemem nebo striktními datovými požadavky, ne hračka pro nadšence.
Na co si dát pozor
DeepSeek V4 Flash je text-only model — žádná podpora obrázků ani videa na vstupu. Kdo potřebuje multimodální vstupy, musí sáhnout jinde (v testech youtubera se osvědčil např. Inkling Small, který zvládá i nativní audio). Dále počítejte s tím, že pro plnohodnotné využití 1M kontextu potřebujete výrazně víc paměti, než jsou čísla u souborů vah — KV cache pro dlouhé kontexty přidává desítky GB. A konečně: vzhledem k RAM krizi roku 2026 se ceny pamětí drží vysoko, takže stavba vlastní 192GB sestavy vyjde na 130–160 tisíc Kč — DGX Spark je v tomto srovnání překvapivě konkurenceschopný.
Závěr
DeepSeek V4 Flash 0731 je momentálně nejlepší poměr výkonu a ceny na trhu — a to v obou světech. Přes cloud API je tak levný, že se vyplatí i pro drobné experimenty. Lokálně na DGX Spark běží na použitelné rychlosti 20–30 tokenů/s a dává smysl tam, kde data nesmí opustit firmu nebo kde je objem provozu natolik velký, že se nákup hardwaru za 140 tisíc Kč zaplatí. Pro všechny ostatní zůstává rozumnou volbou cloud — a to bez výčitek.
Stačí mi na DeepSeek V4 Flash běžný počítač s výkonnou grafikou?
Ne. Model potřebuje 110–169 GB celkové paměti podle zvolené kvantizace (3bit/4bit/8bit). Herní GPU s 24–32 GB VRAM nestačí ani s offloadem — rychlost spadne na jednotky tokenů za sekundu. Potřebujete stroj s velkou unified memory (DGX Spark, Mac Studio s 192 GB) nebo specializovaný setup s offloadem na SSD (Dwarf Star).
Je 4bit kvantizace bezztrátová?
Ne. 4bit (UD-Q4_K_XL) dosahuje zhruba 96% shody s plným modelem. Jediná skutečně lossless varianta je 8bit (UD-Q8_K_XL, 162 GB soubor, 169 GB paměti), která je bit-identická s oficiálními váhami DeepSeek. U běžných úkolů rozdíl nepoznáte, u citlivých výstupů se vyplatí 8bit.
Jaký je rozdíl mezi DGX Spark a běžným PC s velkou RAM?
DGX Spark má 128 GB sjednocené paměti LPDDR5x s propustností 273 GB/s a výkon 1 petaFLOP ve FP4, takže model běží plynule přímo z paměti. Běžné PC s DDR5 RAM zvládne model načíst, ale inference je výrazně pomalejší (jednotky tokenů/s), protože CPU a paměťová propustnost nestačí. Dva propojené Sparksy zvládnou modely až do 405 miliard parametrů.