Přejít k hlavnímu obsahu

Bezpečnost AI v mobilu drží na 0,19 % vah. Stačí je poškodit

Bezpečnostní pojistky jazykového modelu v telefonu
Malý jazykový model v telefonu má oproti velkým modelům v cloudu jednu práci navíc: odmítat. Když se ho někdo zeptá, jak vyrobit výbušninu nebo obejít zabezpečení, má říct ne. Nová studie, kterou přijal workshop konference NeurIPS 2026, ukazuje, jak tenká tahle pojistka je. Stačí změnit 0,19 % vah modelu a odmítání se zhroutí. Model přitom dál počítá skoro jako dřív.

Dvě metody hledání citlivých vah

Autoři práce How Fragile Is On-Device Language Model Safety? si položili jednoduchou otázku: je bezpečnostní chování modelu rozprostřené rovnoměrně po celé síti, nebo se schovává v malé skupině vah? Druhá možnost by znamenala malou plochu pro cílenou analýzu chyb, a taky pro případné poškození.

Testovali model LLaMA-2-7B-Chat od Meta, tedy model se zhruba 7 miliardami parametrů. Dvěma metodami hledali váhy, které nejvíc ovlivňují bezpečnost: nízkodimenzionální analýzou bezpečnostního podprostoru a filtrací vah podle poměru důležitosti pro bezpečnost versus užitečnost. Obě metody se shodly, citlivost na bezpečnost je po síti rozložená hodně nerovnoměrně.

Výsledek pak ověřili prakticky. Měřili takzvanou attack success rate (ASR), tedy kolikrát model skutečně odpoví na dotaz, který by měl odmítnout. Zkusili dva typy útoků: přímé škodlivé dotazy a automatizovaný útok GCG, který k dotazu hledá záludné dovětky.

Bezpečnost se soustředí do down_proj

Nejcitlivější je komponenta down_proj, součást takzvaných MLP vrstev. Zjednodušeně: každý blok transformátoru se skládá z pozornosti (attention) a dopředné sítě (MLP). down_proj je výstupní částí té dopředné sítě. Oproti tomu o_proj, který patří k pozornosti, přispívá k bezpečnosti jen málo.

Konkrétní čísla: když autoři změnili jen 0,19 % vah modelu v down_proj, dostali 53 % Basic ASR a 56 % GCG ASR. Po téhle drobné úpravě tak model odpověděl na zhruba každý druhý škodlivý dotaz, který měl předtím odmítnout.

A teď to podstatné. Model po zásahu nezhloupl. V testu tinyBenchmarks klesl z 52,2 % na 51,6 %, rozdíl zhruba 0,6 bodu. Pojistky se tedy dají vyřadit, aniž by si běžný uživatel podle kvality odpovědí čehokoli všiml. 0,19 % ze 7 miliard parametrů je zhruba 13 milionů čísel. Tolik stačí upravit, aby se model přestal bránit zakázaným dotazům.

Dopad na modely v telefonu

Malé modely běžící přímo na zařízení přibývají. Provozovatelé je nasazují kvůli soukromí a rychlosti, data neopouštějí telefon. S tím ale roste jiný typ rizika, o kterém se tolik nemluví: integrita vah uložených přímo v zařízení.

Chyba nemusí být úmyslná. Studie míří na takzvanou fault analysis, tedy analýzu toho, co se stane, když se část paměti poškodí. Může jít o poruchu hardwaru, přepis paměti nebo útok na lokální úložiště. Autoři mluví o selektivní ochraně integrity, tedy o tom, že místo ochrany celého modelu stačí chránit malou, ale citlivou část.

To je dobrá zpráva zabalená ve špatné. Když víme, které váhy bezpečnost drží, dá se je chránit cíleně a levně. Kontrolní součty nebo redundance nemusí pokrývat všech 7 miliard parametrů, stačí zlomek procenta.

Limity studie

Je férové dodat, že jde o workshopový článek a jediný model. LLaMA-2-7B-Chat je model z roku 2023, dnes už zdaleka není špička. Zda stejná koncentrace bezpečnostních vah platí i u novějších on-device modelů, práce netestuje.

Také to neznamená, že by šlo o snadný útok. Změnit zhruba 13 milionů konkrétních parametrů vyžaduje přístup k vahám modelu, ne jen chytrý dotaz. Výsledek spíš ukazuje, kam se má soustředit obrana, než návod, jak model obejít.

Časté dotazy

Dá se tahle slabina využít jenom dotazem zvenčí?

Ne. Studie pracuje přímo s vahami modelu, takže útočník nebo chyba hardwaru musí sáhnout na uložené parametry. Samotný šikovně napsaný prompt k úpravě vah nepovede.

Proč se měří zrovna attack success rate?

ASR říká, kolikrát model skutečně odpoví na dotaz, který má odmítnout. Je to standardní metrika bezpečnosti modelů, vyšší číslo znamená slabší pojistky.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.