Co je DSpark a proč zrychluje bez ztráty kvality
DSpark je technika prediktivního (speculative) dekódování, kterou DeepSeek představila na arxivu 6. července 2026. Myšlenka je jednoduchá: k velkému modelu se připojí malý „draft" model, který rychle navrhne další tokeny textu. Velký model je pak nevygeneruje od nuly, ale jen najednou zkontroluje — pokud návrhy sedí, uloží práci za celý blok najednou. Klasická varianta této techniky (MTP) ztrácela účinnost u delších sekvencí; DSpark ji vylepšuje poloautoregresivní architekturou a chytrou správou délky kontroly podle konfidence. V ostrém provozu DeepSeek tímto způsobem zrychlila generování pro uživatele o 60 až 85 procent oproti dosavadnímu základu MTP-1.
Klíčové pro běžné uživatele: protože každý návrh prochází plnou verifikací velkým modelem, výstup je matematicky identický s tím, co by model napsal bez DSpark. „Bez ztráty přesnosti" tedy není marketing — zrychlení se projeví jen v rychlosti, ne v obsahu.
Jak to Unsloth dostal na lokální počítače
Unsloth oznámil 6. srpna, že DSpark zapnul u svých GGUF kvantizací modelu DeepSeek-V4-Flash-0731 — nejnovější aktualizace Flash varianty z 31. července. Měření ukazují zrychlení 1,4× až 2×, u doporučeného nastavení pak stabilních 1,5× až 1,9×. Na referenční GPU B200 se generování zvedlo z 60 na 120 tokenů za sekundu. Podporu přidal i llama.cpp, takže si techniku zapnete běžným parametrem --spec-type draft-dspark s doporučenou hodnotou --spec-draft-n-max 3.
Co si stáhnout: kromě samotného GGUF souboru modelu ještě draft model (kolem 6 GB) a je potřeba počítat s zhruba 10 GB paměti navíc oproti běžnému běhu. DSpark se automaticky zapíná v Unsloth Studiu, grafickém rozhraní, které projekt nabízí pro lokální běh modelů na Macu, Windows i Linuxu.
Důležité upřesnění: DSpark není způsob, jak model vtěsnat do menší paměti — hlavní model běží pořád v plné velikosti a draft model naopak paměť přidává. Smysl je v tom, že za malý příplatek (~10 GB) dostanete dvojnásobnou rychlost bez jediné změny ve výstupu. Bez DSpark by stejné zrychlení znamenalo nákup výrazně dražšího hardwaru nebo přechod na menší kvantizaci s horší kvalitou odpovědí.
Kolik paměti potřebujete — tabulka nároků
DeepSeek V4 Flash má 284 miliard parametrů, ale díky architektuře Mixture of Experts se jich na každém tokenu aktivuje jen 13 miliard. Lokální běh tedy nevyžaduje obří GPU jako u klasických modelů, stačí velká RAM či unified memory — model běží i čistě na procesoru. Unsloth doporučuje kvantizaci UD-IQ3_XXS (103 GB) pro stroje se 128 GB paměti; bezeztrátová 8bitová verze má 162 GB a potřebuje minimálně 169 GB.
| Kvantizace | Standardní běh | S DSpark |
| 2-bit | 102 GB | 112 GB |
| 3-bit (doporučená) | 110–135 GB | 120–145 GB |
| 4-bit (téměř bezeztrátová) | 162 GB | 172 GB |
| 8-bit (bezeztrátová) | 169 GB | 179 GB |
Sloupec „Standardní běh" uvádí běžné paměťové nároky, sloupec „S DSpark" pak minimální paměť se zapnutým zrychlením. DSpark paměť neušetří — naopak si vyžádá zhruba 10 GB navíc na draft model a jeho režii. Ziskem je tedy výhradně rychlost: na stroji s dostatečnou rezervou (např. 128 GB při 3bitové kvantizaci) běží model bez výměny hardwaru až dvojnásobně rychleji.
V praxi to znamená: 128GB Mac Studio či DGX Spark utáhne 3bitovou verzi s DSpark, 192GB stroje pak zvládnou i kvalitnější kvantizace. Zajímavostí je, že Unslothovy kvantizace jsou bitově identické s oficiálními váhami DeepSeek — všech 1 328 tenzorů prošlo kontrolou bez jediné odchylky.
Lokální běh v Česku: kolik to stojí
Nejdostupnější cesta k lokálnímu V4 Flash je NVIDIA DGX Spark — malý stolní počítač se 128 GB unified memory, který se v českých e-shopech prodává kolem 140 000 Kč. Alternativou jsou Mac Studia s 192 GB (od zhruba 137 000 Kč) nebo svépomocná sestava s velkou DDR5 pamětí — 128GB kit aktuálně vyjde na zhruba 42 000 Kč, ale v současné paměťové krizi jsou ceny nestabilní. DSpark přidává cenu na výkonu: u menších strojů je rozdíl mezi pomalým a použitelným během často právě dvojnásobek rychlosti.
Pro firmy, které řeší GDPR a odesílání citlivých dat do API, je lokální běh stále silnější argument — data vůbec neopouštějí zařízení. DeepSeek navíc tento týden upravil svůj API ceník (input od 0,14 USD za milion tokenů, output 0,28 USD), takže nezávislost na cloudu je pro intenzivní nasazení čím dál zajímavější volba. V4 Flash je přitom v benchmarkách mimořádně silný: v Terminal Bench 2.1 dosahuje 82,7 bodu, čímž poráží preview modelu V4 Pro (72,1) a drží krok s uzavřenou konkurencí jako GLM-5.2 (81,0) nebo Claude Opus 4.8 (85,0). V kódovacím DeepSWE skočil z 7,3 na 54,4 bodu.
Jak to zapnout
Postup pro pokročilejší uživatele je jednoduchý: stáhnete si GGUF kvantizaci a draft model z Hugging Face repozitáře Unsloth a spustíte llama.cpp s parametrem --spec-type draft-dspark. Méně zkušení sáhnou po Unsloth Studiu, které vše nastaví automaticky a navíc umí novou chat šablonu modelu — DeepSeek teď podporuje nastavení úrovně uvažování (Think High je výchozí, k dispozici je i Think Max a vypnutí uvažování pro maximální rychlost). Úplný návod najdete v dokumentaci Unsloth.
Změní DSpark kvalitu odpovědí?
Ne. DSpark je prediktivní dekódování — všechny návrhy malého draft modelu prochází plnou kontrolou hlavního modelu, takže výstup je identický s běžným během. Zrychlení se projeví pouze v rychlosti generování.
Potřebuji ke spuštění grafickou kartu?
Ne, DeepSeek V4 Flash běží i čistě na procesoru s dostatečnou RAM, ale rychlost je pak nízká (jednotky tokenů za sekundu). Nejlepší výkon dávají stroje s velkou unified memory — 128 GB Mac Studio, DGX Spark nebo sestava s 128GB DDR5.
Funguje DSpark i na starší verzi modelu DeepSeek V4 Flash?
Ne. DSpark je dostupný pouze pro nejnovější build DeepSeek-V4-Flash-0731 z 31. července 2026 — draft model je vázaný na tuto konkrétní verzi vah. U starších verzí zrychlení k dispozici není.