Čínský DeepSeek znovu rozčeřil vody globální umělé inteligence. Pod svobodnou licencí MIT vydal kompletní modelové váhy pro DeepSeek-V4.1-Flash. Tento multimodální Mixture-of-Experts (MoE) model disponuje celkem 552 miliardami parametrů a nativním milionovým kontextovým oknem. Velké překvapení přinášejí srovnávací testy: nová odlehčená verze Flash v klíčových agentních a programovacích benchmarcích nejen poráží dosavadní V4 Flash, ale překonává i těžkotonážní vlajkový model DeepSeek-V4 Pro. Samotná laboratoř proto oznámila, že V4 Pro posílá do důchodu.
Architektonický obrat: Causal Encoder-Decoder a drastická úspora paměti
Zatímco většina moderních velkých jazykových modelů spoléhá na standardní architekturu dekodéru (Decoder-Only), DeepSeek-V4.1-Flash přechází na hybridní uspořádání Causal Encoder-Decoder (CED). Model tvoří 40 vrstev Transformeru rozdělených rovnoměrně na dvacetivrstvý kauzální enkodér a dvacetivrstvý dekodér.
V čem spočívá hlavní výhoda tohoto přístupu? V architektuře CED se globální stav klíčů a hodnot (KV cache) pro dekodér projektuje přímo z finálních skrytých stavů enkodéru, namísto toho, aby se odvozoval a držel v paměti pro každou vrstvu dekodéru zvlášť. Výsledkem jsou dramaticky asymetrické hardwarové nároky v jednotlivých fázích generování:
- Při zpracování vstupu (prefill) model aktivuje pouze 8 miliard parametrů na token.
- Při samotném generování odpovědi (decode) model aktivuje 16 miliard parametrů na token (z celkových 552B parametrů modelu rozdělených mezi 1 sdíleného a 384 směrovaných expertů, z nichž se aktivuje 6 expertů).
Pro dlouhé a na vstup náročné agentní scénáře jde o klíčovou optimalizaci. Model navíc využívá technologii SWA Bounded Replay (posuvné okno pozornosti s omezeným přehráváním), která rekonstruuje chybějící stavy z nedávné historie, aniž by vyžadovala ukládání masivní mezipaměti na SSD. Společně s kompresí CSA2 (Compressed Sparse Attention 2) a FP4 reprezentací globální KV cache klesla paměťová stopa na pouhých 890 bajtů na token. Ve srovnání s původní generací DeepSeek-V4-Flash jde o čtyřnásobnou redukci nároků na paměť.
V4.1-Flash je navíc od základu multimodální. Disponuje vlastním vizuálním enkodérem DeepSeek-ViT trénovaným na 45 bilionech (45T) multimodálních tokenů. Dokáže přímo analyzovat obrázky, grafy i dokumenty a zpracovávat je společně s textovým zadáním.
Překonává V4.1 Flash skutečně model V4 Pro? Ověření benchmarků
Tvrzení, že nová verze Flash překonává těžší model V4 Pro s 1,6 bilionu parametrů (kde bylo na token aktivních 49B parametrů oproti nynějším 8B/16B), je překvapivé, ale oficiální data i nezávislé testy ho potvrzují. Převaha se projevuje především v úlohách softwarového inženýrství, logického uvažování a samostatného řešení problémů v terminálu.
Při nastavení maximálního uvažování (model nově nabízí plynule nastavitelnou hloubku myšlení reasoning_effort na škále od 1 do 100) dosahuje DeepSeek-V4.1-Flash následujících výsledků:
- DeepSWE v1.1 (oprava reálných chyb v softwarových repozitářích): V4.1-Flash vyřešil 74,2 % úloh. Původní V4 Pro dosáhl na 62,7 % a starší V4 Flash na 54,4 %. Nový Flash tak těsně překonal i Claude Opus 5.0 (74,0 %) a GPT-5.6 Sol (73,0 %).
- Terminal-Bench 2.1 (práce v příkazovém řádku a skriptování): V4.1-Flash zaznamenal úspěšnost 90,6 %, zatímco V4 Pro dosáhl 87,9 % a V4 Flash 82,7 %.
- Terminal-Bench 3.0 a 4.0: Na náročnějších verzích benchmarku skóruje V4.1-Flash 30,0 % (verze 3.0) a 31,2 % (verze 4.0). Pro srovnání: původní V4 Pro zde dosahoval jen 11,8 %, respektive 12,4 %.
- Soutěžní programování (Codeforces): Rating modelu vystoupal na 3 471 bodů (oproti 3 348 bodům u V4 Pro).
- Kybernetická bezpečnost (CyberGym): Úspěšnost 88,1 % proti 83,3 % u V4 Pro.
- Všeobecné znalosti (MMLU-Pro a HumanEval): Základní verze modelu (Base) dosáhla v MMLU-Pro skóre 74,1 % (V4 Pro: 73,5 %) a v HumanEval 79,4 % (V4 Pro: 76,8 %).
Kde má V4 Pro ještě mírně navrch? U čistě znalostních testů s masivním rozsahem faktických dotazů, jako je SimpleQA (55,2 % pro V4 Pro vs. 42,3 % pro V4.1 Flash) nebo MultiLoKo. Jakmile však přijde na syntézu, kódování, agentní smyčky a matematiku, menší a lépe natrénovaný V4.1-Flash staršího sourozence jasně poráží.
Důsledek pro API: DeepSeek posílá V4 Pro do důchodu
Nejlepším důkazem převahy nového modelu je reakce samotného DeepSeeku v oficiální API dokumentaci. Společnost oznámila, že protože V4.1 Flash komplexně překonal model V4 Pro ve výkonu, rychlosti i nákladech na provoz, bude model DeepSeek-V4 Pro s konečnou platností vyřazen.
Od pondělí 14. září 2026 (12:00 pekingského času) budou veškeré požadavky směřované na endpoint deepseek-v4-pro automaticky přesměrovány na model V4.1 Flash a účtovány za nižší sazby modelu Flash. Tento stav potrvá až do případného představení budoucího modelu V4.1 Pro.
Oficiální ceník: Konec paušálu, přichází špičkové sazby
Kdo využívá oficiální rozhraní api.deepseek.com (či kompatibilní Anthropic formát), setká se se systémem rozdělení na špičkové (Peak) a mimošpičkové (Off-Peak) hodiny. Mimo špičku jsou ceny přesně poloviční. Špička je definována v pracovních dnech (pondělí až pátek) v časech 01:00–04:00 a 06:00–10:00 UTC (což v letním středoevropském čase SELČ odpovídá hodinám 03:00–06:00 a 08:00–12:00 dopoledne).
Oficiální ceny pro model deepseek-flash (reprezentovaný modelem DeepSeek-V4.1-Flash):
- Vstupní tokeny při shodě v mezipaměti (Cache Hit): 0,003 USD za milion tokenů mimo špičku / 0,006 USD ve špičce (cca 0,07 Kč až 0,14 Kč za milion tokenů).
- Vstupní tokeny bez mezipaměti (Cache Miss): 0,15 USD za milion tokenů mimo špičku / 0,30 USD ve špičce (cca 3,45 Kč až 6,90 Kč za milion tokenů).
- Výstupní tokeny (generování): 0,60 USD za milion tokenů mimo špičku / 1,20 USD ve špičce (cca 13,80 Kč až 27,60 Kč za milion tokenů).
Pro srovnání: dosavadní sazba za generování u starého V4 Pro byla ve špičce až 3,96 USD za milion tokenů. Přechodem na V4.1 Flash vývojáři získají vyšší výkon při více než trojnásobné úspoře nákladů na výstupu. Limit souběžných požadavků (concurrency limit) je u modelu Flash nastaven na velkorysých 2 500 paralelních spojení (zatímco V4 Pro měl limit 500).
Lokální nasazení a licence MIT
Pro komunitu otevřeného softwaru je nejpodstatnější fakt, že váhy modelu jsou na Hugging Face uvolněny pod plně permisivní licencí MIT bez restrikcí na komerční využití. Repozitář obsahuje referenční implementaci tokenizace a prompt encodingu v Pythonu i novou sadu nástrojů deepseek-recipe napsanou v Rustu.
Ačkoliv má model celkem 552 miliard parametrů, díky redukované KV cache (890 bajtů/token) a architektuře aktivující jen 8B/16B parametrů je podstatně přístupnější pro běh na komunitních inferenčních enginech (jako je vLLM, SGLang či specializovaný DwarfStar od Salvatore Sanfilippa). Provoz plného FP8 modelu vyžaduje vícečipové servery, avšak přicházející 3-bitové a 4-bitové kvantizace umožní provoz na kompaktních pracovních stanicích a propojených clusterech s unifikovanou pamětí.
Je DeepSeek-V4.1-Flash dostupný v češtině a rozumí českým dotazům?
Ano, trénovací korpus o objemu 45 bilionů tokenů obsahuje rozsáhlá vícejazyčná data. Model bez obtíží rozumí českému zadání, zvládá plynulou českou syntézu i překlady odborných a technických textů.
Jak je to s licencí a regulací EU AI Act?
Model je vydán pod svobodnou licencí MIT, což umožňuje volné komerční i nekomerční použití a modifikace. Pokud evropské firmy model hostují lokálně v rámci své infrastruktury, nespadají pod restrikce cloudového předávání dat třetím stranám mimo EU, musejí však dodržovat obecná pravidla transparentnosti při nasazení AI systémů v produkci.
Kdy bude možné model spustit v nástrojích typu Ollama nebo LM Studio?
Komunita kolem projektů llama.cpp a GGUF již pracuje na podpoře specifické architektury Causal Encoder-Decoder (CED). Kvantizované verze pro běžnější hardware by se měly v distribučních repozitářích objevit během nejbližších dnů.