Federované učení se přesunulo na server
Federované učení vzniklo jako způsob, jak trénovat model bez toho, aby se všechna data nejdřív shromáždila v cloudu. Telefon zpracuje vlastní příklady lokálně, odešle pouze aktualizaci modelu a server z více zařízení složí společný výsledek. U Gboardu tak může systém využívat informace o psaní pro návrhy dalších slov, opravy nebo automatické doplňování.
Původní přístup měl jasnou výhodu. Citlivá data zůstávala na telefonu. Měl však také provozní limity. Mobilní zařízení nemají stejný výkon, uživatelé je používají v různých časech a samotné trénování musí šetřit baterii i datové přenosy.
Nový systém část výpočtů přesunul na servery. Nejde o obyčejný server, na kterém by správce mohl kdykoli otevřít pracovní soubory. Google využívá TEE neboli Trusted Execution Environment, tedy důvěryhodné vykonávací prostředí. To je hardwarově izolovaná část systému, která má chránit data před zbytkem serveru a zároveň umožnit ověřit, jaký program v ní běží.
Google Research popsal architekturu v článku Toward provably private learning from federated data. Podle autorů se zařízení připojují k procesu, jehož kód a pravidla zpracování lze vzdáleně ověřit. Výsledkem má být federované učení, u kterého není nutné slepě věřit provozovateli serveru, že během výpočtu správně použil ochranu soukromí.
Data se šifrují před odesláním
Gboard šifruje trénovací data přímo na zařízení. Na server putují v podobě, kterou lze zpracovat až uvnitř TEE. Tam se provádí agregace a přidává se diferenční soukromí. Tato metoda do výsledků záměrně vnáší kontrolovaný šum, aby nebylo možné z výsledného modelu zpětně snadno odvodit příspěvek konkrétního uživatele.
Samotné tvrzení „data jsou v bezpečí“ by u takového systému nestačilo. Google proto využívá také vzdálenou atestaci a veřejný transparentní protokol Rekor. Do něj se zapisují pravidla přístupu a identita programů, které s daty pracují. Externí auditor může kryptograficky ověřit, zda se zpracování drželo zveřejněných pravidel.
To je rozdíl oproti staršímu modelu, kde bylo možné ověřit hlavně to, co se děje na telefonu. Serverová část zůstávala větší měrou otázkou důvěry. U nového návrhu se kontrola přesouvá k ověřitelnému kódu, hardwarové izolaci a auditní stopě.
Anglický model se trénoval tři týdny
Google uvádí, že nový systém zkrátil celkovou dobu trénování jednoho jazykového modelu z původních 1 až 2 měsíců na 3 týdny. Serverový výpočet není tolik závislý na tom, kdy se telefony připojí, jaký mají výkon nebo zda zrovna šetří baterii.
Výsledky pocházejí z testování Gboardu v běžném provozu. V každé větvi anglického testu bylo 3,5 milionu zařízení. Google sledoval mimo jiné rychlost psaní a četnost oprav navržených slov. Tyto metriky zůstaly podle zveřejněných výsledků beze změny, takže přesun výpočtů do TEE nevedl k měřitelnému zhoršení uživatelského chování.
Důležitější číslo se týká ochrany soukromí. Nově vytvořený anglický model dosáhl rozpočtu 0,215 zCDP, zatímco dosavadní produkční model měl po srovnání stejnou metodou hodnotu 0,641. U zCDP platí, že nižší hodnota znamená silnější formální garanci soukromí. Rozdíl je tedy přibližně trojnásobný ve prospěch nového systému.
Nejde o běžný benchmark kvality jazyka. zCDP měří míru ochrany dat, nikoli přesnost návrhů nebo stylistickou úroveň klávesnice. Google proto současně sledoval provozní metriky Gboardu, aby ověřil, zda lepší soukromí nevede k horším návrhům slov.
Angličtina a japonština jsou první nasazení
Nová architektura je podle Google Research produkčně nasazená pro modely predikce dalšího slova v Gboardu pro angličtinu a japonštinu. Neznamená to, že všechny funkce Gboardu nebo všechny jazykové modely automaticky používají stejný způsob trénování.
Gboard je dostupný také v češtině jako klávesnice pro Android a iOS. Google ale v oznámení uvádí konkrétní produkční nasazení nového TEE systému pouze pro angličtinu a japonštinu. U českého uživatele proto nelze z dostupných informací tvrdit, že jeho jazykový model už prochází stejným procesem.
To je důležité omezení. Přítomnost české klávesnice v aplikaci neznamená automaticky stejnou dostupnost všech nových modelů, funkcí a trénovacích postupů. Google pro český trh neoznámil samostatné nasazení této architektury.
Proč Google přesouvá výpočty mimo telefony
Federované učení na telefonech je vhodné tam, kde je možné rozdělit práci mezi velké množství zařízení. Každé zařízení však přidává vlastní omezení. Některé se připojí jen zřídka, jiné mají slabší hardware a část uživatelů odmítne trénování kvůli spotřebě energie nebo dat.
Serverové TEE umožňuje soustředit výpočet do předvídatelného prostředí. Google může lépe plánovat počet kol, kontrolovat použitý kód a využít výkonnější infrastrukturu. Současně se zachovává požadavek, aby provozovatel neviděl nezpracovaná data mimo chráněnou část systému.
Google tento směr rozvíjí už několik let. Výzkumné práce o Gboardu popisují federované učení s formální diferenční ochranou soukromí a systém Parfait, který sdružuje nástroje pro federované učení, anonymizaci a externě ověřitelné výpočty. Nové oznámení posouvá tyto postupy z experimentálního prostředí do produkčního trénování modelů pro klávesnici.
Omezení důvěryhodného hardwaru
TEE není kouzelná krabička, která odstraní všechna rizika. Ochrana závisí na použitém procesoru, správné konfiguraci, zveřejněném kódu i způsobu, jakým se řeší útoky na samotnou infrastrukturu. Google proto popisuje externí ověřitelnost jako součást systému, nikoli jako důkaz, že každý možný problém s důvěrnými výpočty zmizel.
Audit také ověřuje konkrétní vlastnosti implementace. Neříká automaticky, že model nikdy neudělá chybu, že návrhy slov budou stejně dobré v každém jazyce nebo že z něj nelze získat žádnou statistickou informaci. Diferenciální soukromí omezuje únik informací podle formálně definovaných parametrů. Nenahrazuje bezpečnostní kontrolu celé aplikace.
Pro uživatele Gboardu se změna projeví především uvnitř vývojového procesu. Klávesnice může získávat nové modely rychleji, aniž by se trénování muselo spoléhat pouze na výpočetní možnosti telefonů. Uživatel přitom neuvidí nové tlačítko ani speciální režim. Ochrana se odehrává v infrastruktuře, která zpracovává aktualizace modelu.
Google tvrdí, že nový systém už zachoval stejné klíčové metriky psaní a současně dosáhl nižšího rozpočtu soukromí. Nasazení se zatím týká angličtiny a japonštiny. Pro češtinu firma samostatný termín ani výsledek neuvedla.
FAQ
Ukládá Google text, který píšu do Gboardu?
Nový systém je navržen tak, aby se trénovací data šifrovala na zařízení a zpracovávala v izolovaném TEE. To neznamená, že každý text napsaný v Gboardu automaticky putuje do trénování. Zveřejněné informace popisují konkrétní proces federovaného učení modelů.
Používá nový systém také český Gboard?
Gboard je v češtině dostupný, ale Google v oznámení potvrdil produkční nasazení nové TEE architektury pouze pro angličtinu a japonštinu. Samostatné české nasazení ani jeho výsledky firma neuvedla.
Co znamená hodnota 0,215 zCDP?
Jde o formální parametr diferenčního soukromí. U zCDP nižší hodnota znamená silnější garanci ochrany. V testu měl nový model hodnotu 0,215 oproti 0,641 u srovnávaného produkčního modelu. Toto číslo samo o sobě neměří přesnost klávesnice.
Zdroje: Google Research, výzkumná práce k systému TEE, MarkTechPost, nápověda Gboardu k podporovaným jazykům.