Guardrail, který vidí i obrázek
Pojďme si to nejdřív přeložit do běžné řeči. Když dnes provozujete chatbota, obvykle před ním běží „hlídač" — menší model, který se podívá na příchozí dotaz a rozhodne, jestli není nebezpečný, podvodný nebo v rozporu s pravidly. Tomu se říká guardrail (zábradlí) a známe ho třeba od rodiny Llama Guard od Mety nebo Qwen3Guard od Alibaby.
Problém je, že většina těchto filtrů rozumí jen textu. Nový Nemotron 3.5 CS od NVIDIE je multimodální — v jednom kontextu zpracuje uživatelský dotaz, případný obrázek i odpověď, kterou měl model vygenerovat. Tím zachytí útoky, kde je škodlivý záměr ukrytý v obrázku nebo kde bezpečnost závisí na kombinaci textu a vizuálu. Přesně to je podle výzkumné práce slepé místo textových guardrailů.
Základ: Google Gemma 3, naladěný na bezpečnost
Model nestavěli od nuly. Jako základ vzali Gemma 3-4B od Googlu — otevřený 4miliardový model — a doladili ho (SFT, tedy supervised fine-tuning) čistě na úlohu bezpečnostní moderace. Trénink běžel na GPU NVIDIA H100 a využili open-source framework LlamaFactory.
Proč zrovna 4 miliardy parametrů? Je to dost malé na to, aby model běžel levně a rychle — zhruba 8 GB paměti v 16bitové přesnosti, po kvantizaci ještě méně. Prakticky to znamená, že se vejde na jednu běžnou grafiku a dá se nasadit i na „hraně" (edge), tedy mimo cloud. Pro firmu, která nechce posílat uživatelská data třetí straně, je tohle zásadní rozdíl oproti velkým modelům běžícím v cloudu.
Bezpečnostní kategorie převzal z taxonomy AEGIS 2.0 (13 základních kategorií) a přidal ještě jednu navíc — ekonomickou újmu, tedy finanční podvody, predátorské půjčky nebo manipulaci s trhem.
Dva režimy: rychlý filtr, nebo zdůvodnění pro audit
Nemotron 3.5 CS umí běžet ve dvou režimech. V tom prvním, přímém, vrátí jen nálepku „bezpečné / nebezpečné" a případný seznam porušených kategorií — co nejrychleji, jako frontová linka. Ve druhém, reasoningovém, k verdiktu přidá stručnou řetězovou úvahu, kterou lze přepnout tokenem /think. Ta se hodí, když chcete zpětně zkontrolovat, proč filtr něco zablokoval — třeba při auditu nebo ladění pravidel.
Klíčová vlastnost je ale jiná: model přijímá vlastní politiku za běhu. Můžete mu v textové formě říct, co přesně je u vás povolené, a on se tomu přizpůsobí — žádné přetrénování pro každou doménu. Finanční poradenství, zdravotnictví, školství? Každé má jiná pravidla, a tenhle model to zvládne v jednom balíku.
Jak si stojí proti konkurenci
Autoři model porovnali s nejsilnějšími dostupnými guardraily. Výsledek je čitelný: nikde úplně nedominuje, ale všude je slušný — a v multimodální bezpečnosti vítězí s rezervou.
| Schopnost (benchmark) | Nemotron 3.5 CS | Nejlepší konkurent | Rozdíl |
|---|---|---|---|
| Multimodální bezpečnost (F1) | 0,81 | 0,68 (Gemma 3-4B) | +0,13 |
| Textová bezpečnost – dotaz (F1) | 0,85 | 0,89 (Qwen3Guard) | −0,04 |
| Textová bezpečnost – odpověď (F1) | 0,83 | 0,86 (Qwen3Guard) | −0,03 |
| Multijazyčnost – odpověď (F1) | 0,847 | 0,817 (Qwen3Guard) | +0,03 |
| Vlastní politiky (F1) | 0,85 | 0,83 (Granite Guardian 3.3) | +0,02 |
| Falešné poplachy (FPR, méně je lépe) | 0,030 | 0,026 (Llama Guard 4) | +0,004 |
V číslech je vidět jasný obchod: v čistě textové bezpečnosti zůstává Qwen3Guard o pár bodů lepší, ale Nemotron přidává porozumění obrázkům a vlastním politikám, aniž by se text propadl. U rychlosti je pak rozdíl nejmarkantnější: 60 ms do prvního tokenu na obrázkově-textových vstupech oproti 99 ms u Llama Guard 4. End-to-end 76 ms znamená zhruba 13 rozhodnutí za sekundu na jeden stream; u čistě textových politik je to kolem 33 ms, tedy ~30 dotazů za sekundu.
Čeština mezi 12 jazyky není
Pojďme rovnou k tomu, co českého čtenáře zajímá nejvíc. Model explicitně trénovali na 12 jazycích: angličtina, němčina, španělština, francouzština, italština, nizozemština, arabština, hindština, čínština, japonština, korejština a thajština. Čeština mezi nimi není.
To ale nutně neznamená, že česky nefunguje. Autoři na benchmarku LinguaSafe testovali i jazyky mimo trénovací sadu — konkrétně vietnamštinu a ruštinu — a model si podle nich vedl konzistentně i tam. Pro českou firmu to není záruka, ale spíš pokyn k vlastnímu otestování, než filtr nasadíte do produkce.
Proč na tom v EU záleží
Pro evropské a české provozovatele AI má tenhle model konkrétní přitažlivost. Nařízení o umělé inteligenci (AI Act) tlačí poskytovatele modelů k tomu, aby měli bezpečnostní mechanismy, včetně moderace obsahu. A protože je Nemotron 3.5 CS otevřený (open weights) a dost malý na lokální provoz, jde provozovat přímo u vás — bez posílání dat do cloudu třetí strany, což ladí s požadavky GDPR na ochranu osobních údajů.
NVIDIA k modelu zveřejnila i trénovací data a celou pipeline pro syntetickou generaci dat. To je v bezpečnostním výzkumu neobvyklé — takové datasety se obvykle drží pod zámkem, protože obsahují citlivé příklady. Autoři k tomu sami dodávají, že data je potřeba brát jako citlivý artefakt a že s otevřením nesou i riziko zneužití (třeba k hledání cest, jak filtr obejít).
Kde jsou limity
Než se nadchnete: model umí zpracovat jeden obrázek vedle textu. Videa, vícestránkové dokumenty ani zvuk nejsou v záběru. Hlavní zdroj falešných poplachů je podle autorů DocVQA — tedy vstupy, které vypadají jako formuláře, skeny a tabulky a mohou připomínat citlivé dokumenty. A reasoningový režim zvyšuje latenci, takže pro ostrý provoz je určená rychlá přímá klasifikace, zatímco zdůvodňování se hodí spíš pro zpětné audity.
Sečteno: Nemotron 3.5 CS není univerzální vítěz. Je to ale praktický signál, že se bezpečnost AI přesouvá od velkých monolitů k malým, otevřeným a levným modelům, které zvládnete provozovat sami — a které konečně vidí i to, co stojí v obrázku.
Je Nemotron 3.5 CS dostupný zdarma a mohu ho nasadit komerčně?
Ano, NVIDIA zveřejnila váhy modelu, trénovací data i pipeline pod otevřenými licencemi. Model je postavený na otevřené Google Gemma 3-4B, takže ho lze stáhnout a provozovat lokálně — včetně komerčního nasazení. Konkrétní licenční podmínky si ale před ostrým provozem ověřte u jednotlivých komponent.
Jaký hardware potřebuji pro provoz?
Při 16bitové přesnosti zabere model zhruba 8 GB videopaměti, takže stačí běžná grafika s 8–16 GB VRAM. Po kvantizaci se nároky ještě sníží, což umožňuje i nasazení na slabším hardwaru nebo na hraně mimo cloud.
Nahradí tenhle model klasické moderování obsahu na sociálních sítích?
Ne tak docela. Jde o nástroj pro provozovatele AI aplikací, kteří potřebují automaticky kontrolovat vstupy a výstupy svých modelů. Velké platformy řeší moderování vlastními procesy a lidskými týmy; Nemotron 3.5 CS je spíš stavební blok, který si firma nasadí do vlastního potrubí jako frontovou bezpečnostní vrstvu.