Bezpečnost AI: Jaké údaje umělé inteligenci nesdělovat?
Pečlivá kontrola zadávaných údajů je základem bezpečného používání běžně dostupných jazykových modelů. Informace odeslané do veřejných nástrojů umělé inteligence totiž opouštějí vaše zařízení. Vkládání důvěrných údajů do AI s sebou nese riziko úniku informací, vyzrazení obchodního tajemství i porušení předpisů o ochraně osobních údajů. Ke každé interakci s AI proto přistupujte, jako byste informace zveřejňovali.
Co do AI nevkládat?
Do veřejně dostupných modelů nikdy nevkládejte následující kategorie údajů:
- osobní údaje – jména, příjmení, adresy, rodná čísla, telefonní čísla nebo e-mailové adresy klientů, zaměstnanců ani své vlastní;
- zdravotnickou dokumentaci – anamnézy, výsledky vyšetření a diagnózy pacientů, na které se vztahují přísné právní předpisy (např. GDPR nebo HIPAA);
- důvěrné firemní informace – nezveřejněné finanční zprávy, marketingové strategie, databáze klientů či plány fúzí, akvizic nebo propouštění;
- obchodní tajemství – zdrojové kódy softwaru, výrobní postupy, jedinečné algoritmy nebo interní technickou dokumentaci firmy;
- hesla a přístupové údaje – klíče API, přihlašovací údaje, autorizační tokeny, údaje o platebních kartách a jakékoli šifrovací klíče;
- materiály chráněné autorským právem – celé knihy, placené vědecké články nebo scénáře, k jejichž použití nemáte odpovídající licenci;
- nezákonný obsah – materiály propagující násilí či nenávist nebo návody k jednání v rozporu s platnými zákony.
Co se děje s údaji zadanými do umělé inteligence?
Údaje odeslané poskytovatelům cloudových služeb procházejí několika fázemi zpracování a analýzy. Jejich životní cyklus nekončí vygenerováním odpovědi.
Trénování modelů
Údaje zadávané do standardních verzí generativních nástrojů pro běžné uživatele se často využívají k dalšímu trénování modelů. Zadané informace tak mohou ovlivnit váhy neuronové sítě a teoreticky se v budoucnu objevit v odpovědi pro zcela jiného uživatele.
Ruční kontrola a moderování
Kromě automatizovaného zpracování používají systémy AI bezpečnostní filtry. Pokud algoritmus vyhodnotí dotaz jako podezřelý, například jako porušení podmínek služby, může konverzaci označit a předat k ruční kontrole. Zaměstnanci poskytovatele nebo externí pracovníci podílející se na označování dat tak mohou získat přímý přístup k zadanému obsahu, aby pomohli zlepšit moderování.
Uchovávání údajů a zálohy
Poskytovatelé AI uchovávají záznamy konverzací na svých serverech kvůli zajištění provozu služeb, diagnostice chyb a zachování kontextu pro budoucí relace. Smazání chatu v uživatelském rozhraní přitom zpravidla neznamená okamžité odstranění informací ze serverů. Údaje zůstávají po určitou dobu v záložních systémech poskytovatele, což při úspěšném kybernetickém útoku na cloudovou infrastrukturu zvyšuje riziko odhalení důvěrných informací.
Osobní a firemní účty: Jak se liší úroveň ochrany?
Úroveň zabezpečení AI se výrazně liší podle typu předplatného a způsobu nasazení.
Bezplatné i placené standardní osobní účty u mnoha oblíbených služeb ve výchozím nastavení používají zadané informace k trénování. Pokud do nich vložíte důvěrný obsah, každá taková relace přináší riziko, že nad jeho dalším využitím ztratíte kontrolu.
Ve firemních a podnikových prostředích (např. u účtů Enterprise nebo služeb provozovaných v privátním cloudu prostřednictvím API poskytovatelů, jako jsou Microsoft Azure, AWS či Google Cloud) bývají standardy ochrany přísnější. Poskytovatelé zaručují soulad s bezpečnostními standardy a předpisy (ISO 27001, SOC 2, GDPR) a ve smlouvách (SLA/DPA) uvádějí, že zákaznická data nepoužívají k trénování veřejných základních modelů. Pravidla pro vkládání údajů proto mohou být v těchto prostředích méně omezující, stále však vyžadují řízení rizik a kontrolu přístupu.
Co lze do AI bezpečně vložit?
Navzdory omezením existuje řada informací, které lze do AI zadávat a zpracovávat bez obav. Patří mezi ně například:
- veřejně dostupné materiály – články z otevřených zdrojů, blogové příspěvky, veřejné zprávy o trhu, právní předpisy nebo obsah webových stránek (např. Wikipedie);
- nedůvěrné informace – obecné pokyny, otázky k teoretickým konceptům, pravidla gramatiky a pravopisu, matematické rovnice nebo dotazy na význam slov;
- anonymizované části dokumentace – šablony dopisů, vzory smluv nebo úryvky programového kódu, z nichž byly zcela odstraněny jedinečné proměnné, klíče, názvy klientů a informace o interní architektuře;
- vlastní autorské texty – návrhy e-mailů, příspěvky na sociální sítě, osnovy prezentací nebo články, které neobsahují citlivé obchodní informace;
- otevřené datové soubory – syntetická data nebo statistiky z veřejných repozitářů používané k procvičování analýzy a formátování.
Jak před odesláním do AI účinně anonymizovat zprávy a údaje?
Než důvěrné dokumenty odešlete jazykovému modelu, řádně je připravte a odstraňte z nich citlivé informace. S textem pak můžete pracovat bezpečněji, aniž byste zbytečně riskovali únik důvěrných údajů.
Nahrazování identifikátorů a tokenizace
Při tokenizaci se citlivé údaje nahrazují zástupnými hodnotami. Jméno „Jan Novák“ lze například změnit na značku „[Klient_1]“ a název společnosti „Firma ABC“ na „[Organizace_A]“. Jazykový model tak může pracovat se strukturou, skladbou i kontextem dokumentu, aniž by z těchto údajů dokázal určit původní subjekt.
Maskování citlivých informací
Maskování znamená přímé skrytí důležitých řetězců, nejčastěji jejich nahrazením speciálními znaky (např. číslo karty 4532 **** **** ****). Účinná je také generalizace údajů: místo přesných hodnot, například mzdy 55 000 Kč, použijete interval nebo obecnější údaj, například „mzda v rozmezí 50 000–60 000 Kč“. Tím snížíte riziko zpětné identifikace.
Automatizace (nástroje DLP a RegEx)
Při ručním odstraňování informací z dlouhých textů lze snadno něco přehlédnout. V profesionálním prostředí se proto používají skripty založené na regulárních výrazech (RegEx) nebo systémy DLP (Data Loss Prevention). Tyto nástroje dokážou zadání před odesláním automaticky zkontrolovat a rozpoznat, zablokovat nebo nahradit řetězce odpovídající formátům rodných čísel, DIČ, e-mailových adres či čísel bankovních účtů.
Jak zabránit trénování AI na vašich údajích?
Riziko spojené s vkládáním informací do AI můžete omezit také nastavením samotného nástroje. Možnost odmítnout používání obsahu k trénování nabízí většina poskytovatelů.
- ChatGPT (OpenAI) – v nastavení účtu (Settings) otevřete sekci „Data controls“ a vypněte možnost „Improve the model for everyone“. Tím zabráníte využívání nově zadávaných textů k trénování modelu. V současné verzi rozhraní konverzace nadále zůstávají ve vaší historii chatů. OpenAI však i po vypnutí této možnosti uchovává záznamy na svých serverech po dobu 30 dnů kvůli monitorování zneužití a zajištění bezpečnosti, než je trvale smaže.
- Gemini (Google) – v nastavení soukromí vypněte funkci „Gemini Apps Activity“. Nové konverzace se pak neukládají do vašeho účtu Google a nepoužívají se k trénování modelů. Změna ale neodstraní záznamy z infrastruktury poskytovatele okamžitě: Google je může kvůli bezpečnosti služby uchovávat až 72 hodin.
- Claude (Anthropic) – u bezplatných a standardních verzí pro běžné uživatele je v současnosti ve výchozím nastavení zapnuto využívání zadaných údajů ke zlepšování modelů. Jde o významnou změnu oproti dřívějšímu přístupu společnosti Anthropic, která zdůrazňovala, že konverzace uživatelů k trénování nepoužívá. Chcete-li tuto možnost vypnout, přejděte v nastavení účtu do sekce soukromí a deaktivujte „Help improve Claude“.
Pamatujte, že změny nastavení soukromí a vypnutí souhlasu s trénováním platí pouze do budoucna. Informace odeslané před změnou nastavení, které již byly zahrnuty do trénování, nelze tímto způsobem z modelu odstranit.
Na závěr
- Ke každé interakci s běžnými nástroji AI přistupujte jako ke zveřejnění informací. Nevkládejte do nich osobní údaje, zdravotnickou dokumentaci, hesla ani obchodní tajemství.
- Odeslané informace mohou procházet několika fázemi zpracování, včetně trénování modelů, moderování a ukládání záloh na externích serverech.
- Riziko můžete snížit předchozí anonymizací, maskováním citlivých řetězců, tokenizací a používáním nástrojů DLP.
- Účty Enterprise a vyhrazená firemní cloudová prostředí nabízejí přísnější ochranu a smluvní záruky, že zákaznická data nebudou použita k trénování veřejných modelů.
- Změna nastavení soukromí a vypnutí využívání údajů k trénování působí pouze do budoucna. Údaje již použité při trénování tím z modelu neodstraníte.
Napsat komentář