Čínské jazykové modely se u politicky citlivých otázek často nedrží neutrálního popisu. Podle benchmarku německé společnosti Aleph Alpha poskytly modely od Alibaba, DeepSeek a Moonshot AI vyváženou odpověď pouze v 17 až 41 procentech případů. Ve zbytku opakovaly oficiální čínskou doktrínu, odváděly pozornost nebo odpověď úplně odmítly.
Studie testovala témata, kterým se modely vyhýbají
Benchmark zveřejnila společnost Aleph Alpha 28. září 2026. Test se zaměřil na 967 ručně vybraných otázek o tématech, která jsou v Číně politicky citlivá. Patřily mezi ně protesty na náměstí Nebeského klidu, status Tchaj-wanu, Sin-ťiang, lidská práva, opozice nebo internetová cenzura.
Výzkumníci nehodnotili pouze to, zda model odpověděl. Sledovali také, jakým způsobem s otázkou naložil. Model mohl poskytnout vyvážené vysvětlení, zopakovat oficiální stranickou pozici, odpověď obejít, případně odmítnout reagovat.
U šesti testovaných čínských modelů označil hodnoticí systém Aleph Alpha za vyvážených jen 17 až 41 procent odpovědí. Jde o výsledek konkrétního benchmarku, nikoli o obecné skóre všech odpovědí daných modelů. Na běžná technická, vzdělávací nebo praktická témata mohou reagovat podstatně méně problematicky.
To potvrzuje i samotná studie. U obecných dotazů, které se Číny přímo netýkaly, byla odpověď čínských modelů většinou vyvážená. Politický náklon však zcela nezmizel. U některých systémů se objevil i v otázkách, které původně čínskou politiku vůbec nezmiňovaly.
Čínské modely někdy obhajují vlastní systém i u cizího tématu
Jako příklad uvádí Aleph Alpha dotaz na cenzuru ve Spojených státech. Model Qwen 3.6 začal relativně vyváženým popisem amerického prostředí. Na konci odpovědi však přešel k obhajobě čínského přístupu ke správě internetu a zdůraznil, že podobná opatření mohou sloužit k udržení sociální stability a národní bezpečnosti.
Pro uživatele je to důležitý rozdíl. Odpověď nemusí obsahovat zjevnou lež ani přímé odmítnutí. Model může nejprve uvést několik relevantních skutečností a potom nenápadně přidat hodnotící rámec, který odpovídá politické linii jeho země původu.
Starší studie Central European Institute of Asian Studies popsala podobný přenos politických postojů. Při dotazech na lidská práva, opozici nebo sledování obyvatel se v odpovědích čínských modelů objevovaly formulace odpovídající oficiální rétorice Pekingu, například důraz na nevměšování do vnitřních záležitostí nebo na „společenství se sdílenou budoucností lidstva“.
Model tedy nemusí být politický při každém použití. Stačí, když se jeho chování změní u určité skupiny témat. Pro překlad e-mailu nebo shrnutí technické dokumentace to může být bez významu. U rešerše, výuky dějepisu, novinářské práce nebo analýzy mezinárodních vztahů už jde o vlastnost, kterou je potřeba znát.
Odmítnutí odpovědi je jiný typ cenzury
Ne všechny modely volí stejný postup. Podle výsledků zveřejněných Aleph Alpha model DeepSeek V4 Pro odmítl odpovědět přibližně na dvě třetiny citlivých otázek. To je čitelnější chování než dlouhá odpověď plná politických formulací, protože uživatel alespoň vidí, že systém téma považuje za nepřístupné.
Pro srovnání poskytly modely Claude Sonnet 5 a Mistral Small vyváženou odpověď v 70, respektive 92 procentech testovaných případů. Tato čísla však nelze číst jako absolutní pořadí všech modelů. Jde o výsledky konkrétního testu, sady otázek a hodnoticí metody.
Současně je nutné zmínit původ benchmarku. Aleph Alpha prodává takzvanou suverénní AI vládám a firmám a snaží se odlišit od čínských konkurentů. Společnost proto má obchodní zájem na tom, aby podobné rozdíly zdůraznila. To samo o sobě výsledky nevyvrací, ale čtenář by měl vědět, kdo test připravil a jaké modely srovnával.
Studie zveřejňuje metodiku i příklady odpovědí, takže její závěry lze kontrolovat podrobněji. Přesto z ní nelze odvodit, že každý čínský model bude při každém politickém dotazu postupovat stejně.
Politické hodnoty se mohou přenést i do jiných modelů
Nejzajímavější část výzkumu se netýká pouze čínských systémů. Aleph Alpha upozornila také na model Nvidia Nemotron Cascade 2, u kterého se stranická linie objevila v 17 procentech odpovědí.
Autoři tento výsledek spojují s trénovacími daty. Z celkem 9,3 milionu záznamů pro další učení modelu jich zhruba 3 500 vzniklo pomocí modelů DeepSeek a Qwen. Pokud tyto modely při generování dat odmítaly některá témata nebo do odpovědí vkládaly oficiální čínský pohled, mohly se stejné vzorce dostat do dalšího systému.
Technicky nejde o přímé „překopírování názoru“. Model se učí z mnoha příkladů a snaží se napodobit jejich styl i obsah. Když se politicky zabarvené odpovědi objeví v trénovacím souboru dostatečně často, mohou ovlivnit chování výsledného modelu. U syntetických dat je problém v tom, že další model nemusí vždy poznat, že původní odpověď byla zaujatá.
Výzkumná práce k modelu Nemotron Cascade 2 popisuje jeho postupy učení, zatímco Aleph Alpha upozorňuje na konkrétní příklady politického přenosu. Závěr o příčině je proto potřeba chápat jako interpretaci autorů studie, nikoli jako definitivně prokázaný mechanismus u každé problematické odpovědi.
Čínská pravidla vysvětlují část chování modelů
Výsledky odpovídají čínskému regulačnímu prostředí. Tamní pravidla pro generativní AI požadují, aby veřejně dostupné služby dodržovaly takzvané socialistické základní hodnoty. Oficiální výklad čínského úřadu pro kyberprostor uvádí, že poskytovatelé mají zajišťovat bezpečnost obsahu, kvalitu trénovacích dat a soulad s těmito hodnotami.
Podle čínských pravidel pro generativní AI nesmějí služby vytvářet obsah, který porušuje zákony nebo ohrožuje státní moc a národní jednotu. U veřejných modelů tak nejde jen o technické filtrování vulgarit nebo nebezpečných návodů. Regulace zasahuje i do politického rámce odpovědí.
Čínské modely jsou přitom dostupné také mimo Čínu. Některé lze používat přes API, jiné jsou nabízené jako open-weight modely pro vlastní provoz. Dostupnost konkrétní služby v Česku a Evropské unii se liší podle poskytovatele, licence a způsobu nasazení. Samotné stažení modelu navíc neznamená, že se odstraní jeho původní nastavení nebo naučené vzorce odpovědí.
Cena API proto není dostatečné kritérium pro výběr. Například DeepSeek V4.1-Flash má podle aktuálních údajů vstupní cenu 0,30 dolaru za milion tokenů ve špičce a 0,15 dolaru mimo špičku. Kimi K3 stojí 3 dolary za milion vstupních tokenů. Levnější provoz může být zajímavý pro firmu nebo vývojáře, ale neříká nic o politické neutralitě modelu.
Co si z toho odnést při práci s AI
U běžných úkolů není nutné čínské modely automaticky vyřazovat. Mohou být použitelné pro programování, sumarizaci nebo lokální provoz, pokud uživatel rozumí jejich licenci a technickým omezením. Politické, historické a společenské otázky však vyžadují větší opatrnost.
Praktický postup je jednoduchý. Citlivou odpověď je vhodné porovnat s více modely, vyžádat si zdroje a oddělit popis události od hodnocení. U firem by měl výběr modelu zahrnovat také kontrolu trénovacích dat, pravidel moderace a možností auditu. Pokud model odmítne otázku, je to informace sama o sobě. Pokud odpoví sebejistě a jednostranně, může být problém hůře viditelný.
Výzkum Aleph Alpha ukazuje dvě odlišné podoby politického vlivu. Model může citlivé téma odmítnout, nebo nabídnout odpověď, která zní věcně, ale postupně přechází k oficiální doktríně. U čínských systémů se tento vzorec podle benchmarku objevuje nejčastěji právě u témat, jako jsou Tchaj-wan, Sin-ťiang, lidská práva a politická opozice.
FAQ
Znamená odmítnutí odpovědi vždy politickou cenzuru?
Ne nutně. Model může odmítnout také kvůli bezpečnostním pravidlům, nejasnému zadání nebo omezení služby. U opakovaných odmítnutí konkrétních politických témat je však vhodné zohlednit původ modelu, jeho pravidla a výsledky nezávislého testování.
Mohou se čínské politické postoje dostat do západního AI modelu?
Ano, pokud model při dalším učení používá syntetická data vytvořená čínskými modely. Aleph Alpha tento mechanismus spojila s případem Nemotron Cascade 2, kde se stranická linie objevila u 17 procent testovaných odpovědí.
Jsou čínské modely kvůli tomu nepoužitelné v Česku?
Ne. Pro technické nebo administrativní úkoly mohou být použitelné. U politických, historických a společenských témat je ale potřeba odpovědi ověřovat z více zdrojů a počítat s tím, že některá témata mohou být filtrována nebo jednostranně rámována.