Přejít k hlavnímu obsahu

Moonshot AI vydává Kimi K3: Otevřený model s 2,8 triliony parametrů konkuruje špičkám od OpenAI a Anthropicu

Ilustrační obrázek pro jarvis-ai.cz
Čínská společnost Moonshot AI oficiálně zveřejnila modelové váhy a technickou zprávu k modelu Kimi K3. Jde o nejvýkonnější otevřený AI model třídy 3T na světě, který disponuje celkem 2,8 trilionu parametrů (2,8T) a 1 milionem tokenů v kontextovém okně. Díky pokročilé architektuře Mixture-of-Experts (MoE) aktivuje při každém výpočtu pouze 104 miliard parametrů, což přináší 2,5násobnou efektivitu výpočetního výkonu oproti předchozí generaci Kimi K2. Model s nativním zpracováním obrazu a videa je volně ke stažení pro výzkumné i komerční účely.

Nová architektura: Zvýšení inteligence bez zbytečného plýtvání GPU

Vývoj velkých jazykových modelů se v roce 2026 posouvá od pouhého zvětšování velikosti k architektonické efektivitě. Pekingský startup Moonshot AI to dokazuje modelem Kimi K3, který staví na kombinaci vrstev Kimi Delta Attention (KDA) a Gated MLA (Multi-Head Latent Attention) doplněných o mechanismus Attention Residuals (AttnRes).

Pod kapotou Kimi K3 tepe masivní systém Stable LatentMoE se 896 expertními sítěmi. Pro každý generovaný token model dynamicky vybírá a aktivuje pouze 16 z těchto expertů (plus 2 sdílené experty). Z celkových 2,8 trilionu parametrů je tak v libovolném okamžiku aktivních pouhých 104 miliard. Tento přístup umožňuje dosáhnout výjimečné úrovně uvažování (reasoning) a znalostí, aniž by docházelo k neúměrnému nárůstu latence nebo nákladů na infrastrukturu.

Model byl navíc od fáze ladění (SFT) trénován s nativní kvantizací MXFP4 pro váhy a MXFP8 pro aktivace (Quantization-Aware Training). Díky tomu lze tento gigantický systém efektivněji nasazovat na moderních akcelerátorech bez výrazné ztráty přesnosti výstupů.

Dominance v autonomním kódování a agentových úlohách

Kimi K3 byl navržen především jako autonomní agent schopný samostatně řešit dlouhodobé a komplexní inženýrské úkoly. Zvládá projíždět rozsáhlé kódové repozitáře, pracovat s terminálovým rozhraním a vykonávat navazující úkony v oblastech od optimalizace GPU kernelů a vývoje kompilátorů až po CAD návrhy, vývoj her a architekturu čipů.

Současně s modelem vývojáři uvolnili také vývojářský nástroj Kimi Code CLI, který slouží jako terminálový agent. Kimi K3 kombinuje textové uvažování s vizuálním vnímáním díky integrovanému rozhraní MoonViT-V2 s 401 miliony parametrů. Dokáže tak přímo analyzovat uživatelské rozhraní, grafické podklady nebo generovat interaktivní dashboardy a datové vizualizace.

Srovnání v benchmarku: Kimi K3 šlape na paty GPT-5.6 a Claude Opus 4.8

Oficiální technická zpráva zveřejněná na blogu Kimi.com nabízí detailní srovnání s předními komerčními i otevřenými modely dneška, jako jsou GPT-5.6 Sol, Claude Fable 5 nebo Claude Opus 4.8.

Benchmark (Oblast) Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
GPQA Diamond (Vědecké uvažování) 93.5 % 92.6 % 94.1 % 91.0 %
BrowseComp (Webový agent) 91.2 % 88.0 % 90.4 % 84.3 %
SWE-Marathon (Dlouhodobé kódování) 42.0 % 35.0 % 39.0 % 40.0 %
Terminal-Bench 2.1 (Práce v terminálu) 88.3 % 88.0 % 88.8 % 84.6 %
Video-MME (Multimodální video) 90.0 % N/A 89.5 % 86.0 %

Výsledky ukazují, že Kimi K3 vyniká zejména v autonomním vyhledávání (BrowseComp 91,2 %) a komplexním vícekrokovém vývoji softwaru (SWE-Marathon 42,0 %), kde poráží i ty nejvýkonnější uzavřené modely na trhu.

"Preserved Thinking" a jak model funguje v praxi

Podobně jako některé předchozí uvažující modely má Kimi K3 trvale zapnutý proces vnitřního myšlení. V rámci API rozhraní vrací objekt reasoning_content, přičemž vývojáři mohou nastavit intenzitu uvažování (reasoning_effort) na hodnoty "low", "high" nebo "max".

Unikátní vlastností je trénink v režimu zachované historie myšlení (preserved thinking history mode). Pokud vedete s modelem vícekolovou konverzaci nebo využíváte volání funkcí (tool calling), musíte do historie zpráv předávat kompletní předchozí odpověď asistenta včetně vnitřních úvah reasoning_content. Model tak neztrácí nit a dokáže v dalších krocích navázat na své dřívější myšlenkové pochody.

Dostupnost v ČR, čeština a dopad pro evropské firmy

Jedním z nejdůležitějších aspektů vydání Kimi K3 je jeho licencování. Modelové váhy jsou dostupné ke stažení v úložišti HuggingFace pod Kimi K3 License. Zpřístupnění otevřených vah takového rozsahu představuje zásadní výhodu pro evropské a české firmy.

Dopad na český trh a regulace: Evropské podniky často narážejí na přísné požadavky GDPR a předpisy EU AI Act při odesílání citlivých dat na americké cloudy. Otevřené váhy Kimi K3 umožňují běh modelu na vlastní infrastruktuře (on-premise) nebo v lokálních cloudových centrech v rámci EU.

Čeština a lokalizace: Model byl primárně trénován na anglických a čínských datech doplněných o rozsáhlé vícejazyčné korpusy. Zkoušky ukazují, že Kimi K3 bez problémů rozumí a komunikuje v češtině i slovenštině, zvládá překlady i úpravy českého kódu či dokumentace, ačkoliv jeho nejhlubší odborné znalosti logicky vycházejí z anglických zdrojů.

Cena a výpočetní nároky: Stažení samotných vah modelu je zdarma. Pro vývojáře, kteří nechtějí provozovat vlastní hardware, je k dispozici oficiální API na portálu platform.kimi.ai, které je plně kompatibilní s formátem OpenAI a Anthropic. Pro lokální nasazení jsou oficiálně podporovány produkční inferenční frameworky jako vLLM, SGLang nebo TokenSpeed.

Jaké jsou hardwarové nároky pro lokální spuštění Kimi K3?

Vzhledem ke 2,8 trilionům parametrů (i při MXFP4 kvantizaci) vyžaduje plné načtení modelu enterprise serverové sestavy s více GPU akcelerátory (např. clustery Nvidia H100/H200 nebo B200). Pro menší vývojové týmy je praktičtější využít API nebo běh aktivovaných 104B částí na specializovaných cloudech.

Lze Kimi K3 poumístit do existujících vývojářských nástrojů jako VS Code?

Ano, díky REST API kompatibilnímu s rozhraním OpenAI/Anthropic lze Kimi K3 snadno připojit do většiny populárních IDE pluginů (např. Continue, Cursor) nebo využít oficiální terminálový nástroj Kimi Code CLI.

Co znamená příznak "reasoning_effort" při volání API?

Parametr určuje, kolik výpočetního času a tokenů model věnuje vnitřní analýze problému než formuluje finální odpověď. Hodnota "low" je vhodná pro rychlé a jednoduché dotazy, zatímco "max" zapojuje plné hloubkové uvažování pro složité matematické, vědecké nebo programátorské úlohy.

X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.