Dataset Anonymization
Proces odstranění osobně identifikovatelných informací (PII) z trénovacích sad. Používáme techniky jako k-anonymita, l-rozmanitost a t-blízkost, abychom zabránili reverznímu inženýrství dat. Cílem je zachovat statistickou hodnotu dat pro model při nulovém riziku identifikace konkrétních subjektů.
- Maskování citlivých atributů
- Diferenciální soukromí (Differential Privacy)
- Tokenizace identifikátorů