Přejít k hlavnímu obsahu

Jak pustit AI k citlivým datům, aniž by je viděla

Ilustrační obrázek
Když chcete dnes AI naučit něco z citlivých dat — zdravotních záznamů, bankovních transakcí, personálních složek — stojíte před nepříjemným dilematem. Buď data necháte tak, jak jsou, a riskujete únik. Nebo je před modelem zamaskujete, a výsledek je horší či výrazně pomalejší. Kanadská firma Integrated Quantum Technologies teď oznámila, že našla třetí cestu: data zmenšit natolik, že je nelze složit zpátky, a přitom v nich nechat vše, co AI ke své práci potřebuje.

V tiskové zprávě z 24. září firma, obchodovaná na kanadské burze pod tickerem CSE: VEIL, oznámila, že svůj výzkum připravuje k odeslání do recenzního řízení konference IEEE SaTML 2027 (Secure and Trustworthy Machine Learning), která se v květnu 2027 uskuteční v islandském Reykjavíku. Metoda, kterou firma označuje zkratkou ICA (Informationally Compressive Anonymization), je podle ní jádrem technologie VEIL, kterou prodává firmám.

Proč soukromí a AI pořád nejdou dohromady

Když má model zpracovat citlivá data, máte dnes v zásadě dvě zaběhnuté techniky. První je diferenciální soukromí (DP): k datům přidáte statistický šum, takže jednotlivé záznamy nelze spolehlivě identifikovat. Jenže šum snižuje přesnost a správně ho nakalibrovat je samo o sobě věda. Druhá je homomorfní šifrování (HE): model počítá přímo nad zašifrovanými daty, takže nikdo nevidí nic. Cena je ale astronomická — výpočty jsou řádově pomalejší a dražší.

Právě na tento kompromis míří i abstrakt článku, který firma zveřejnila na serveru arXiv. Obě dosavadní cesty podle ní řeší soukromí „za cenu zhoršeného výkonu, větší složitosti nebo neúnosné výpočetní režie“.

ICA a VEIL: komprese místo šifrování

Základní nápad je vlastně jednoduchý, a to je na něm to zajímavé. Představte si, že místo celé zdravotní dokumentace pošlete AI jen její zhuštěný otisk: seznam klíčových rysů, které model potřebuje ke svému úkolu — věk, rizikové faktory, výsledky testů — ale bez jména, adresy nebo doslovných poznámek. Z takového otisku odpověď na otázku „jaké je riziko“ stále spočítáte, ale původní dokument už z něj nesložíte.

Technicky to funguje tak, že v důvěryhodném prostředí (které firma označuje jako Source Environment) běží enkodér. Ten surová data převede do nízkodimenzionální vektorové reprezentace sladěné s konkrétním úkolem strojového učení. Ven — do neověřeného tréninkového a inferenčního prostředí — putují už jen tyto nevratně anonymizované vektory, nikoli originál.

Podle firmy přináší tato komprese i vedlejší praktický bonus: na webu uvádí, že VEIL data zmenší o více než 95 %. V praxi by to znamenalo, že gigabajt citlivých záznamů se smrskne na méně než 50 MB vektorů — což je mimochodem i důvod, proč by celý proces mohl zůstat rychlý.

Co je nového a co firma tvrdí

Článek, který podepsal technický ředitel firmy Jeremy Samuelson, má 47 stran a 29 obrázků. Na arXiv byl poprvé zveřejněn 16. března 2026 a aktualizován 19. května. Jeho klíčové tvrzení zní silně: autoři podle abstraktu „rigorózně dokazují“, že enkódované reprezentace jsou strukturně neinvertovatelné — tedy že zpětná rekonstrukce originálu je „logicky nemožná“, a to dokonce i za idealizovaných předpokladů útočníka.

To je podstatný rozdíl proti starším pokusům postaveným na autoenkodérech, které podle firmy sice také data komprimovaly, ale ztrácely přitom prediktivní užitečnost. ICA naopak reprezentaci učí přímo vůči cílovému úkolu, takže přesnost má zůstat zachovaná.

Kde jsou háčky

A tady je potřeba zůstat nohama na zemi. Zpráva je placená tisková zpráva distribuovaná přes Newsfile a sama konference zdůrazňuje, že „odeslání neznamená přijetí, potvrzení ani validaci“ ze strany IEEE. Článek má jediného autora a zatím prošel jen archivem arXiv, nikoli nezávislou recenzí.

Silné tvrzení o tom, že je rekonstrukce „logicky nemožná“, je zatím tvrzením samotné firmy — a neexistuje žádný druhý zdroj, který by je nezávisle ověřil. Stejně tak číslo o 95% kompresi pochází z marketingového webu produktu, nikoli z recenzovaného textu. IQT je malá veřejně obchodovaná společnost, která svou technologii zároveň prodává, takže zájem na pozitivním vyznění je tu přirozeně velký.

Proč to zajímá i české firmy

Bez ohledu na to, jestli ICA uspěje, stojí za ním problém, který české firmy řeší denně. Nařízení GDPR a evropský AI Act tlačí na princip „privacy by design“ a na minimalizaci dat — tedy na to, aby AI viděla co nejméně. Kdo pracuje se zdravotními, bankovními nebo personálními daty, ten zná přesně to dilema z úvodu: jak z citlivých údajů vytěžit hodnotu, aniž by se vystavily.

Důležité ale je, že VEIL je enterprise infrastruktura pro firmy, nikoli nástroj pro běžné uživatele, a žádná česká lokalizace ani dostupnost pro český trh nebyla oznámena. Pro běžného čtenáře je tahle zpráva spíš signálem, kam obor směřuje, než něčím, co si zítra nainstaluje.

Srovnání přístupů

Pro přehled, jak si jednotlivé techniky stojí vedle sebe:

Metoda Jak chrání data Hlavní nevýhoda
Diferenciální soukromí (DP) přidává statistický šum zhoršuje přesnost, složitá kalibrace
Homomorfní šifrování (HE) počítá nad zašifrovanými daty obrovská výpočetní režie, pomalé
ICA / VEIL komprese do úkolově sladěných vektorů dosud nezávisle neověřeno

Kompletní preprint najdete na arXiv pod číslem 2603.15842, původní oznámení pak na Yahoo Finance.

Je metoda ICA nezávisle ověřená?

Zatím ne. Jde o preprint s jediným autorem na arXiv a tvrzení firmy. Recenzní řízení konference IEEE SaTML teprve začíná a odeslání článku neznamená jeho přijetí ani validaci.

Nahradí ICA šifrování a diferenciální soukromí?

Ne v dohledné době. Je to zatím neověřený přístup jedné firmy, nikoli etablovaná náhrada. V citlivých aplikacích zůstávají dosavadní techniky standardem, dokud ICA neprojde nezávislou kontrolou.

Můžu si VEIL vyzkoušet jako běžný uživatel?

Ne. Jde o enterprise řešení prodávané firmám, bez oznámené české lokalizace nebo nabídky pro český trh. Pro domácí použití není určené.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.