Přejít k hlavnímu obsahu

Nemotron 3.5 CS: NVIDIA má 4B model, který v obrázku vidí hrozbu, kterou text přehlédne

Ilustrační obrázek
Bezpečnostní filtr pro AI dnes obvykle umí kontrolovat jen text. Jenže stále víc aplikací zpracovává i obrázky, screenshoty a dokumenty — a útočník může nebezpečný záměr schovat právě do vizuálu, který textový filtr vůbec nevidí. NVIDIA teď zveřejnila Nemotron 3.5 Content Safety Moderator: kompaktní 4miliardový model, který posuzuje text, obrázek i odpověď asistenta najednou, ve 12 jazycích. Všechny váhy i trénovací data jsou volně ke stažení.

Guardrail, který vidí i obrázek

Pojďme si to nejdřív přeložit do běžné řeči. Když dnes provozujete chatbota, obvykle před ním běží „hlídač" — menší model, který se podívá na příchozí dotaz a rozhodne, jestli není nebezpečný, podvodný nebo v rozporu s pravidly. Tomu se říká guardrail (zábradlí) a známe ho třeba od rodiny Llama Guard od Mety nebo Qwen3Guard od Alibaby.

Problém je, že většina těchto filtrů rozumí jen textu. Nový Nemotron 3.5 CS od NVIDIE je multimodální — v jednom kontextu zpracuje uživatelský dotaz, případný obrázek i odpověď, kterou měl model vygenerovat. Tím zachytí útoky, kde je škodlivý záměr ukrytý v obrázku nebo kde bezpečnost závisí na kombinaci textu a vizuálu. Přesně to je podle výzkumné práce slepé místo textových guardrailů.

Základ: Google Gemma 3, naladěný na bezpečnost

Model nestavěli od nuly. Jako základ vzali Gemma 3-4B od Googlu — otevřený 4miliardový model — a doladili ho (SFT, tedy supervised fine-tuning) čistě na úlohu bezpečnostní moderace. Trénink běžel na GPU NVIDIA H100 a využili open-source framework LlamaFactory.

Proč zrovna 4 miliardy parametrů? Je to dost malé na to, aby model běžel levně a rychle — zhruba 8 GB paměti v 16bitové přesnosti, po kvantizaci ještě méně. Prakticky to znamená, že se vejde na jednu běžnou grafiku a dá se nasadit i na „hraně" (edge), tedy mimo cloud. Pro firmu, která nechce posílat uživatelská data třetí straně, je tohle zásadní rozdíl oproti velkým modelům běžícím v cloudu.

Bezpečnostní kategorie převzal z taxonomy AEGIS 2.0 (13 základních kategorií) a přidal ještě jednu navíc — ekonomickou újmu, tedy finanční podvody, predátorské půjčky nebo manipulaci s trhem.

Dva režimy: rychlý filtr, nebo zdůvodnění pro audit

Nemotron 3.5 CS umí běžet ve dvou režimech. V tom prvním, přímém, vrátí jen nálepku „bezpečné / nebezpečné" a případný seznam porušených kategorií — co nejrychleji, jako frontová linka. Ve druhém, reasoningovém, k verdiktu přidá stručnou řetězovou úvahu, kterou lze přepnout tokenem /think. Ta se hodí, když chcete zpětně zkontrolovat, proč filtr něco zablokoval — třeba při auditu nebo ladění pravidel.

Klíčová vlastnost je ale jiná: model přijímá vlastní politiku za běhu. Můžete mu v textové formě říct, co přesně je u vás povolené, a on se tomu přizpůsobí — žádné přetrénování pro každou doménu. Finanční poradenství, zdravotnictví, školství? Každé má jiná pravidla, a tenhle model to zvládne v jednom balíku.

Jak si stojí proti konkurenci

Autoři model porovnali s nejsilnějšími dostupnými guardraily. Výsledek je čitelný: nikde úplně nedominuje, ale všude je slušný — a v multimodální bezpečnosti vítězí s rezervou.

Schopnost (benchmark)Nemotron 3.5 CSNejlepší konkurentRozdíl
Multimodální bezpečnost (F1)0,810,68 (Gemma 3-4B)+0,13
Textová bezpečnost – dotaz (F1)0,850,89 (Qwen3Guard)−0,04
Textová bezpečnost – odpověď (F1)0,830,86 (Qwen3Guard)−0,03
Multijazyčnost – odpověď (F1)0,8470,817 (Qwen3Guard)+0,03
Vlastní politiky (F1)0,850,83 (Granite Guardian 3.3)+0,02
Falešné poplachy (FPR, méně je lépe)0,0300,026 (Llama Guard 4)+0,004

V číslech je vidět jasný obchod: v čistě textové bezpečnosti zůstává Qwen3Guard o pár bodů lepší, ale Nemotron přidává porozumění obrázkům a vlastním politikám, aniž by se text propadl. U rychlosti je pak rozdíl nejmarkantnější: 60 ms do prvního tokenu na obrázkově-textových vstupech oproti 99 ms u Llama Guard 4. End-to-end 76 ms znamená zhruba 13 rozhodnutí za sekundu na jeden stream; u čistě textových politik je to kolem 33 ms, tedy ~30 dotazů za sekundu.

Čeština mezi 12 jazyky není

Pojďme rovnou k tomu, co českého čtenáře zajímá nejvíc. Model explicitně trénovali na 12 jazycích: angličtina, němčina, španělština, francouzština, italština, nizozemština, arabština, hindština, čínština, japonština, korejština a thajština. Čeština mezi nimi není.

To ale nutně neznamená, že česky nefunguje. Autoři na benchmarku LinguaSafe testovali i jazyky mimo trénovací sadu — konkrétně vietnamštinu a ruštinu — a model si podle nich vedl konzistentně i tam. Pro českou firmu to není záruka, ale spíš pokyn k vlastnímu otestování, než filtr nasadíte do produkce.

Proč na tom v EU záleží

Pro evropské a české provozovatele AI má tenhle model konkrétní přitažlivost. Nařízení o umělé inteligenci (AI Act) tlačí poskytovatele modelů k tomu, aby měli bezpečnostní mechanismy, včetně moderace obsahu. A protože je Nemotron 3.5 CS otevřený (open weights) a dost malý na lokální provoz, jde provozovat přímo u vás — bez posílání dat do cloudu třetí strany, což ladí s požadavky GDPR na ochranu osobních údajů.

NVIDIA k modelu zveřejnila i trénovací data a celou pipeline pro syntetickou generaci dat. To je v bezpečnostním výzkumu neobvyklé — takové datasety se obvykle drží pod zámkem, protože obsahují citlivé příklady. Autoři k tomu sami dodávají, že data je potřeba brát jako citlivý artefakt a že s otevřením nesou i riziko zneužití (třeba k hledání cest, jak filtr obejít).

Kde jsou limity

Než se nadchnete: model umí zpracovat jeden obrázek vedle textu. Videa, vícestránkové dokumenty ani zvuk nejsou v záběru. Hlavní zdroj falešných poplachů je podle autorů DocVQA — tedy vstupy, které vypadají jako formuláře, skeny a tabulky a mohou připomínat citlivé dokumenty. A reasoningový režim zvyšuje latenci, takže pro ostrý provoz je určená rychlá přímá klasifikace, zatímco zdůvodňování se hodí spíš pro zpětné audity.

Sečteno: Nemotron 3.5 CS není univerzální vítěz. Je to ale praktický signál, že se bezpečnost AI přesouvá od velkých monolitů k malým, otevřeným a levným modelům, které zvládnete provozovat sami — a které konečně vidí i to, co stojí v obrázku.

Je Nemotron 3.5 CS dostupný zdarma a mohu ho nasadit komerčně?

Ano, NVIDIA zveřejnila váhy modelu, trénovací data i pipeline pod otevřenými licencemi. Model je postavený na otevřené Google Gemma 3-4B, takže ho lze stáhnout a provozovat lokálně — včetně komerčního nasazení. Konkrétní licenční podmínky si ale před ostrým provozem ověřte u jednotlivých komponent.

Jaký hardware potřebuji pro provoz?

Při 16bitové přesnosti zabere model zhruba 8 GB videopaměti, takže stačí běžná grafika s 8–16 GB VRAM. Po kvantizaci se nároky ještě sníží, což umožňuje i nasazení na slabším hardwaru nebo na hraně mimo cloud.

Nahradí tenhle model klasické moderování obsahu na sociálních sítích?

Ne tak docela. Jde o nástroj pro provozovatele AI aplikací, kteří potřebují automaticky kontrolovat vstupy a výstupy svých modelů. Velké platformy řeší moderování vlastními procesy a lidskými týmy; Nemotron 3.5 CS je spíš stavební blok, který si firma nasadí do vlastního potrubí jako frontovou bezpečnostní vrstvu.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.