Přejít k hlavnímu obsahu

Qwen3.8-27B: otestovali jsme 27miliardový model na 16GB grafice. Vejde se jen s druhou kartou

Ilustrační foto
Qwen3.8-27B je nový 27miliardový model od Alibaby, který v sobě spojuje dvě věci najednou: rozumí obrázkům i videu a zároveň je laděný na programování a dlouhé agentní úlohy. My jsme ho otestovali na vlastním hardwaru — na 16GB grafice se v této konfiguraci nevešel, ale s druhou, starší kartou už běžel rychlostí 15 tokenů za sekundu. Změřili jsme reálný výkon konkrétní sestavy, ne obecnou rychlost modelu ani marketingové slajdy.

Model, který není jen na obrázky

Když se řekne „multimodální model", většina lidí si představí chatbota, kterému pošlete fotku a on ji popíše. Qwen3.8-27B tohle umí taky — nativně zpracovává obrázky i video. Jenže tím jeho záběr nekončí. Alibaba ho staví především jako kódovací a agentní model, který má zvládat složité, vícestupňové úlohy od začátku do konce.

To je zásadní rozdíl oproti starším multimodálním modelům, které často vidění „uměly", ale při psaní kódu nebo delší práci s nástroji zaostávaly. Tady je to naopak: vidění je přidaná hodnota, ale hlavní svaly jsou v logice a kódu.

Architektura ve zkratce: hybridní pozornost a dlouhý kontext

Model používá takzvanou hybridní lineární pozornost (Gated DeltaNet). Z dostupné modelové karty nelze spolehlivě potvrdit, že Qwen3.8-27B skutečně vychází z architektury Qwen3.5, proto tuto atribuci neuvádíme. V praxi část vrstev zpracovává informace efektivněji než klasická pozornost, což šetří paměť a umožňuje delší kontext. Qwen3.8-27B zvládne nativně 262 144 tokenů. Případné rozšíření až na milion tokenů zde neuvádíme, protože by záviselo na konkrétní implementaci a podmínkách použití.

Druhá věc, kterou ocení vývojáři: model má přepínatelné „myšlení". Výchozí režim nejdřív promýšlí, teprve pak odpovídá — a hloubku uvažování lze ladit parametrem, nebo ho úplně vypnout, když potřebujete rychlou odpověď.

Jak jsme testovali

Benchmarky od výrobce jsou fajn, ale říkají málo o tom, jak model poběží u vás na stole. Proto jsme Qwen3.8-27B spustili na vlastním serveru s těmito komponentami:

  • GPU 1: NVIDIA RTX 5060 Ti, 16 GB VRAM
  • GPU 2: NVIDIA RTX 3050, 6 GB VRAM
  • Procesor AMD Ryzen; přesný model procesoru nebyl v záznamu původního měření uveden, 39 GB RAM, Ubuntu 24.04 LTS
  • Inference přes llama.cpp; verze nebo commit použité v původním měření nebyly zaznamenány
  • Kvantizace Q4_K_M (deklarovaná velikost souboru s vahami 15,9 GiB)

GB a GiB nejsou stejné jednotky: 1 GB je 1 0003 bajtů, zatímco 1 GiB je 1 0243 bajtů. Deklarovaných 15,9 GiB proto odpovídá přibližně 17,1 GB. Jde o velikost souboru, respektive deklarovaných vah, nikoli o přesné měření celé obsazené VRAM při běhu.

Test probíhal v textovém režimu, nikoli jako obrazový nebo video test. Použité parametry spuštění, přesná délka generování a počet opakování nebyly v původním záznamu uvedeny, takže výsledky nelze bez výhrad považovat za plně reprodukovatelný benchmark. Uvádíme proto konkrétní naměřené hodnoty této konfigurace, nikoli obecný výkon modelu.

Kvantizace Q4_K_M je rozumný kompromis mezi velikostí a kvalitou — model se vejde na spotřební hardware, aniž by podle našeho pozorování výrazně ztratil přesnost.

Výsledek: na jedné 16GB kartě to v našem testu nešlo

První zjištění je jednoznačné pro naši konkrétní konfiguraci, kvantizaci a nastavení. Když jsme model nahrávali jen na 16GB RTX 5060 Ti, llama.cpp skončil chybou a model se vůbec nenačetl. Špičková obsazená VRAM podle zaznamenaného měření dosáhla přibližně 16,5 GB. Tento údaj není možné zpětně přesně porovnat s deklarovanou velikostí souboru vah 15,9 GiB: jde o jiné měření a nebylo zaznamenáno stejnou metodikou. Kapacita označená výrobcem jako 16 GB navíc není totéž co dostupná kapacita po odečtení režie systému a dalších potřeb. Požadavky navíc dále rostou s délkou kontextu.

Tohle je důležité vědět, než si 27miliardový model stáhnete: v této konkrétní konfiguraci 16 GB nestačilo. Podle nastavení může být vhodnější karta s 24 GB, nebo druhá GPU. Z jediného testu nelze vyvozovat obecný limit všech 16GB grafických karet.

S druhou kartou už to běží: v této konfiguraci 15 tokenů za sekundu

Po přidání starší RTX 3050 (6 GB) se model rozložil přes obě karty a rozjel se. Naměřili jsme:

  • Generování: 15,16 tokenu za sekundu
  • Zpracování promptu: 418 tokenů za sekundu (512tokenový vstup ≈ 1,2 s)
  • Špičková spotřeba VRAM: přibližně 16,5 GB podle zaznamenaného měření (11,5 + 5,0 GB)

Hodnota 15,16 tokenu za sekundu je výsledkem tohoto konkrétního textového testu na kombinaci RTX 5060 Ti a RTX 3050, nikoli obecnou rychlostí modelu. Skutečná rychlost výsledného textu závisí také na jazyce a typu výstupu. Na psaní kódu, vysvětlování nebo chat to stačí, i když nejde o bleskovou rychlost menších 7–8miliardových modelů.

Úzké hrdlo: stará karta brzdí novou

Při tomto měření jsme narazili na zajímavý jev, který se v článcích o „multi-GPU" obvykle zamlčuje. Když model generoval, RTX 5060 Ti měla podle našeho pozorování prakticky nulové vytížení — v dané konfiguraci čekala na pomalejší RTX 3050. Starší karta z rodiny Ampere má zhruba poloviční propustnost paměti a výrazně nižší výpočetní výkon, takže se v tomto testu stala úzkým hrdlem.

Praktické ponaučení z našeho měření: přidat druhou, pomalejší kartu sice může pomoci s kapacitou, ale výslednou rychlost může určovat slabší karta z dvojice. Z toho nelze vyvozovat obecný závěr pro všechny multi-GPU konfigurace. Vhodnější může být dvojice podobně výkonných karet (třeba 2× 16 GB), nebo jedna 24GB karta.

Co na to říkají oficiální benchmarky

Výrobce v modelové kartě uvádí srovnání s předchozí generací i s konkurencí. Oproti Qwen3.6-27B jde o znatelný skok: v QwenSWEBench se zlepšil z 49,3 na 79,0 bodu, v DeepSWE 1.1 z 13,3 na 42,2. V agentním kódování SWE-bench Pro dosahuje 61,7 bodu — víc než Claude Opus 4.6 Max (53,4) i Muse Glimmer-30B (51,2).

Metodiku je ale potřeba číst pozorně. QwenSWEBench a CoWorkBench jsou interní testy Qwen. U SWE-bench Pro a DeepSWE 1.1 byly modely hodnoceny pomocí Claude Code harnessu při parametrech uvedených v příslušných materiálech výrobce; tyto podmínky se liší od interních testů Qwen. Srovnání s Claude Opus 4.6 Max je převzaté oficiální skóre, nikoli přímé srovnání provedené ve stejné metodice jako náš test nebo všechny uvedené benchmarky.

Silný je i v obrazových úlohách: OSWorld-Verified (ovládání počítače) 84,3 bodu, AndroidWorld 81,9, analýza grafů CharXiv 90,2 s řetězcem myšlení. Tato čísla berte s rezervou — jsou z vlastního testování Alibaby a používají různé metodiky — ale ukazují, že model je v kategorii „otevřených 27B" velmi schopný.

Co to znamená pro vás

Qwen3.8-27B je open-source (licence Apache-2.0), takže si ho můžete stáhnout a provozovat zdarma, lokálně a bez předplatného — data zůstávají u vás. Kvantizovanou verzi najdete na Hugging Face od týmu unsloth.

Pro běžného českého uživatele je hlavní překážkou hardware: v závislosti na kvantizaci a délce kontextu může být potřeba 24GB GPU nebo dvojice karet. Komu se model nevejde, může ho zkusit v cloudu, až Alibaba spustí slibovanou hostovanou verzi. Z našeho redakčního pozorování v tomto testu vyplývá, že model česky odpovídal korektně, jen s občasnými drobnými kostrbatostmi u delších odborných textů. Nešlo však o systematický test češtiny, takže to nelze předkládat jako obecnou vlastnost modelu.

Verdikt

Qwen3.8-27B ukazuje, že hranice „velkých modelů na domácím hardwaru" se posouvá. Na jediné 16GB kartě se v naší konkrétní konfiguraci, s použitou kvantizací a nastavením, nespustil, ale se dvěma kartami ano — a v tomto testu dosáhl 15,16 tokenu za sekundu. Výsledek naznačuje, že může být zajímavou volbou pro kódování i práci s obrazem, pokud máte odpovídající hardware a nevadí vám kompromisy multi-GPU zapojení. Nejde však o obecný limit všech 16GB grafických karet. Není to bez výhrad: výkon srážela nerovnoměrná dvojice GPU a bez pořádného disku a RAM se neobejdete. Jako open-source alternativa ke cloudovým předplatným proto může dávat smysl pro uživatele, kteří upřednostní lokální provoz a mají k tomu vhodnou sestavu — případně jednu 24GB kartu.

Vejde se Qwen3.8-27B na jednu 16GB grafiku?

V našem testu se na RTX 5060 Ti 16GB nenačetl. Platí to pouze pro tuto konkrétní konfiguraci, kvantizaci Q4_K_M a použité nastavení, nikoli jako obecný limit všech 16GB karet. Deklarovaná velikost souboru s vahami byla 15,9 GiB, což odpovídá přibližně 17,1 GB. Zaznamenané měření špičkové obsazené VRAM v kombinované konfiguraci uvádělo přibližně 16,5 GB; tento údaj nelze zpětně přesně porovnat s velikostí souboru, protože jde o jiné měření. Podle nastavení může být vhodnější jedna 24GB karta nebo dvě GPU.

Jakou kvantizaci zvolit?

Pro přibližně 22 GB celkové VRAM (16 + 6 GB) byla v našem testu použita Q4_K_M. Odhad, že Q3_K_M zabere zhruba 13,8 GB, je pouze orientační a závisí na kontextu i nastavení. Stejně tak Q5_K_M a Q6_K mohou vyžadovat přibližně 24GB kartu nebo dvojici karet, ale skutečná kapacita se mění podle konkrétní implementace, délky kontextu a parametrů spuštění.

Je model dostupný v češtině?

Model v našem redakčním testu na české dotazy odpovídal česky, ale nešlo o systematické hodnocení českého jazyka. Výsledek proto berte jako pozorování z konkrétního testu, nikoli jako obecnou garanci kvality češtiny. Primárně je model určen pro angličtinu a čínštinu.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.