Přejít k hlavnímu obsahu

Qwen3.8-Max-0902 vede Code Arena: za webové AI porazil Claude i Kimi

Čínská AI a DeepSeek
Alibaba dnes zpřístupnila aktualizovaný model Qwen3.8-Max-0902 a jeho první výrazný výsledek přišel z hodnocení tvorby webů. V Code Arena: WebDev získal 1 691 bodů a obsadil první příčku. Přeskočil Claude Opus 5 (Max) o tři body, Kimi K3 (Max) o 17 bodů a předchozí Qwen3.8-Max o 22 bodů. Je to těsný náskok, ne důkaz univerzálně nejlepší AI. Pro vývojáře ale jde o relevantní signál: čínské modely dál sílí tam, kde se AI posuzuje podle hotového rozhraní, ne podle izolovaného testu kódu.

První místo za web, ne za všechno

Qwen3.8-Max-0902 je podle oficiální stránky QwenCloud novější snapshot řady Qwen3.8-Max, označený také jako qwen3.8-max-2026-09-02. Alibaba u něj uvádí lepší práci s rozsáhlejšími programátorskými projekty, dlouhými autonomními úlohami, nástroji a obrazovým vstupem. Zachovává kontextové okno o velikosti jednoho milionu tokenů a režim přemýšlení.

Výsledek 1 691 bodů zveřejnila AI Arena ve svém oznámení Code Arena: WebDev. Tento žebříček nefunguje jako klasický test s jednou sadou úloh a pevně známým správným řešením. Lidé porovnávají webové výstupy modelů a vybírají lepší variantu. Skóre tedy popisuje relativní preferenci v daném systému hodnocení. O tři body vyšší výsledek než Claude Opus 5 (Max) je proto velmi těsný rozdíl, který se může s dalšími souboji změnit.

Tohle omezení není formalita. Model může vyniknout podobou stránky, rozvržením nebo rychlostí zpracování zadání, a přitom nebýt nejlepší volbou pro audit zabezpečení, údržbu velkého repozitáře či návrh složité backendové architektury. AI Arena navíc v době oznámení ještě nesdělila výsledky Qwenu v žebříčku Agent Arena. Z jedné tabulky proto nelze vyvozovat, že nový Qwen porazil Claude, Gemini nebo Kimi ve všech programátorských situacích.

Silný výsledek napříč typy webových zadání

Nejvyšší celkové pořadí není jediný údaj z oznámení. Qwen3.8-Max-0902 získal první místa v kategoriích Data & Analytics a Consumer Product. Druhé místo drží v Brand & Marketing, Gaming a Simulations. Ve dvou dalších oblastech, Content Creation Tools a Reference-Based Design, je třetí. Přesná struktura hodnocení má význam: model neuspěl jen na jedné úzce vymezené úloze.

Pro člověka, který si nechává vytvořit administrační přehled, prototyp produktové stránky nebo vizuální návrh interního nástroje, je to slibnější informace než obecné tvrzení o „schopnosti programovat“. Webové zadání obvykle spojuje HTML a CSS s JavaScriptem, stavem aplikace, daty a požadavkem, aby výsledek také působil použitelně. Právě tato kombinace bývá pro jazykové modely těžší než doplnění jedné funkce.

Zároveň je dobré ponechat si odstup. Hodnocení webu zvýhodňuje výsledek, který vypadá dobře na první pohled. Produkční projekt ale stojí i na testech, přístupnosti, výkonu, ochraně dat a schopnosti vývojáře změny bezpečně zkontrolovat. Model může urychlit první verzi obrazovky, nikoli převzít odpovědnost za nasazení.

Cena: důležitější jsou skutečné sazby než jedno průměrné číslo

AI Arena označila Qwen3.8-Max-0902 za nejlépe bodovaný model na takzvané Pareto hranici a pracuje s kombinovanou cenou 5 dolarů za milion tokenů. Takové číslo je užitečné pro srovnání výkonu a nákladů, ale není univerzální ceník. Záleží na poměru vstupních a výstupních tokenů, na použití cache i na zvoleném poskytovateli API.

Oficiální ceník QwenCloud uvádí 2 dolary za milion vstupních tokenů a 6 dolarů za milion výstupních tokenů. Při implicitní cache klesá vstupní cena na 0,25 dolaru; vytvoření explicitní cache stojí 2,50 dolaru a její čtení 0,17 dolaru za milion tokenů. Pro vývojářský tým to může rozhodnout víc než pořadí o několik bodů: agent, který opakovaně pracuje se stejnou dokumentací a zdrojovými soubory, umí cache využít výrazně lépe než jednorázový chat.

Pokud aplikace například hlavně generuje kód, bude její reálná cena blíž výstupní sazbě než marketingovému průměru. Naopak systém, který v každém kroku posílá dlouhé zadání a jen krátce odpovídá, má jiný profil. Před nasazením se proto vyplatí změřit vlastní provoz na několika skutečných úlohách, ne vybírat jen podle žebříčku.

Co z toho mají čeští vývojáři a firmy

Model je dostupný přes QwenCloud, jehož API je kompatibilní s rozhraním OpenAI. QwenCloud uvádí podporu textového, obrazového a video vstupu; výstupem je text. Nabízí také function calling, strukturované výstupy, webové vyhledávání a nástroje pro práci s kódem. To jsou praktické stavební bloky pro vlastní asistenty a interní agenty, nikoli jen pro konverzační okno.

Alibaba na stránce modelu neslibuje speciální českou lokalizaci. Čeští uživatelé si tedy musí kvalitu češtiny, práci s diakritikou i spolehlivost při zadání v češtině ověřit vlastním testem. U firem je stejně důležité prověřit, kam posílají zdrojový kód a data zákazníků, jaké smluvní podmínky se na zvolený přístup vztahují a zda je zpracování slučitelné s jejich pravidly ochrany dat.

Qwen3.8-Max-0902 má zatím jeden velmi čerstvý a silný důkaz v oblasti webového vývoje. Neproměňuje automaticky každé zadání ve funkční produkt. Ukazuje ale, že při výběru AI pro front-end už nedává smysl sledovat jen americké značky. Stojí za to jej srovnat se současnými modely Claude, Gemini a Kimi při stejných požadavcích, rozpočtu a kontrole kódu.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.