Privacy-enhancing technologies (PETs) zijn een familie van technische methoden die het mogelijk maken persoonsgegevens te analyseren, te delen of te gebruiken voor AI-training zonder die gegevens direct bloot te stellen. Voor Europese organisaties in gereguleerde sectoren, van ziekenhuizen tot rechtbanken en overheidsinstanties, zijn PETs inmiddels geen academisch concept meer maar een concrete implementatievraag met directe compliance-consequenties.
Welke PETs zijn relevant voor soevereine organisaties?
De drie meest toegepaste PETs in organisatiecontexten zijn differential privacy, volledig homomorfe encryptie (FHE) en synthetische data-generatie. Ze dienen elk een ander doel en kennen elk eigen beperkingen.
Differential privacy voegt wiskundig gekalibreerde ruis toe aan een dataset of aan de output van een query, zodat de bijdrage van individuele personen onherleidbaar wordt. Het wordt gebruikt bij het publiceren van statistieken, het trainen van machine learning-modellen en het uitvoeren van populatieanalyses. Apple en Google passen het toe in hun telemetriesystemen, maar de methode is ook toepasbaar in publieke sectoren zoals de belastingdienst of het CBS.
Homomorfe encryptie (FHE) maakt het mogelijk berekeningen uit te voeren op volledig versleutelde data, zonder de data ooit te ontsleutelen. De cloudprovider of externe rekendienst ziet nooit de plaintext. Dit is relevant voor organisaties die rekenkracht willen uitbesteden maar de inhoud van de data privé willen houden. De keerzijde is een aanzienlijke rekenlast: FHE is voor grootschalige AI-inferentie in productie nog beperkt inzetbaar, hoewel bibliotheken zoals Microsoft SEAL en OpenFHE de drempel verlagen.
Synthetische data-generatie produceert kunstmatige datasets die de statistische eigenschappen van echte data nabootsen zonder directe koppeling aan individuen. Generatieve modellen, waaronder variational autoencoders en diffusiemodellen, worden hiervoor ingezet. Synthetische data is waardevol voor het testen van software, het trainen van AI-modellen en het delen van datasets over organisatiegrenzen.
PETs en de AVG-beginselen dataminimalisatie en doelbinding
Artikel 5 van de AVG verplicht organisaties tot dataminimalisatie en doelbinding. PETs vertalen deze juridische beginselen naar technische architectuurkeuzes.
Dataminimalisatie betekent dat alleen de gegevens worden verwerkt die strikt noodzakelijk zijn voor het opgegeven doel. Differential privacy ondersteunt dit doordat het query’s beantwoordt op geaggregeerd niveau, zonder toegang tot individuele records. Federated learning gaat verder: het model traint op de locatie waar de data staat, waardoor de ruwe data nooit hoeft te worden gecentraliseerd.
Doelbinding vereist dat data niet voor andere doeleinden wordt gebruikt dan waarvoor ze zijn verzameld. Synthetische data kan hier een rol spelen: als de synthetische variant geen directe relatie meer heeft met de brondata, kan ze voor secundaire doeleinden worden gebruikt zonder dat de oorspronkelijke doelbinding wordt doorbroken. Maar dit vereist zorgvuldige anonimiseringsanalyse. De Autoriteit Persoonsgegevens stelt expliciet:
“Synthetische data kan een nuttige aanvulling zijn op andere privacymaatregelen, maar vervangt de vereisten van de AVG niet. Organisaties moeten aantonen dat de data daadwerkelijk niet herleidbaar is tot individuen.”
Federated learning versus volledig on-premise AI: wanneer kies je wat?
Dit onderscheid is cruciaal voor compliance officers en IT-beslissers die een AI-strategie zonder externe dataverwerking willen bouwen.
| Kenmerk | Federated learning | Volledig on-premise AI |
|---|---|---|
| Locatie ruwe data | Blijft op lokale nodes | Blijft volledig intern |
| Externe communicatie | Modelupdates (gradiënten) worden gedeeld | Geen externe communicatie |
| Restrisico | Gradiënten kunnen privacygevoelig zijn (gradient inversion-aanvallen) | Minimaal, afhankelijk van beveiligingsarchitectuur |
| Rekencapaciteit | Verdeeld over nodes | Volledig eigen hardware vereist |
| Geschikt voor | Samenwerkende organisaties (b.v. ziekenhuisnetwerken) | Hoog-vertrouwelijke omgevingen, justitie, inlichtingen |
Een NHS-pilot beschreven in Nature Medicine (Rieke et al., 2020) toonde aan dat het mogelijk is oncologiemodellen te trainen over vijf ziekenhuizen zonder patiëntdata te centraliseren. Dit illustreert de kracht van federated learning in netwerken van organisaties die data niet mogen overdragen.
Kies voor volledig on-premise AI wanneer de juridische of veiligheidseisen elke externe verbinding uitsluiten, zoals bij staatsgeheimen, strafdossiers of patiëntenrecords onder NEN 7510 met maximale gevoeligheidsclassificatie.
Hoe beoordeelt de Autoriteit Persoonsgegevens synthetische data?
De AP hanteert het standpunt dat synthetische data niet automatisch buiten de AVG valt. Bepalend is of de data aantoonbaar anoniem is in de zin van Overweging 26 van de AVG: zelfs indirecte herleidbaarheid via membership inference-aanvallen, waarbij een aanvaller kan bepalen of een specifiek individu in de trainingsdata zat, maakt de data opnieuw persoonsgegeven.
Bij cloudmigraties wordt synthetische data soms ingezet om een testomgeving op te bouwen zonder echte klant- of patiëntendata naar een externe provider over te dragen. De AP verwacht van organisaties dat zij een anonimiseringsrisicoanalyse documenteren, als onderdeel van de verwerkingsverantwoordelijkheden onder Artikel 5 lid 2 AVG (accountability-beginsel).
PETs in de EU AI Act: hoog-risico AI op gevoelige datasets
De EU AI Act (Verordening (EU) 2024/1689), van toepassing vanaf 2026, categoriseert AI-systemen naar risiconiveau. Systemen in de gezondheidszorg, de rechtspraak en overheidsinstanties vallen doorgaans onder Annex III als hoog-risico. Voor deze systemen gelden strenge eisen aan datakwaliteit, representativiteit en documentatie van de trainingsdata.
PETs spelen hier een dubbele rol. Ten eerste maken ze het mogelijk hoog-risico modellen te trainen op gevoelige datasets zonder de onderliggende data onnodig te centraliseren of bloot te stellen, wat aansluit op de data governance-eisen van Artikel 10 van de EU AI Act. Ten tweede kunnen ze worden ingezet bij de validatie van modellen: differential privacy biedt aantoonbare garanties over de mate waarin het model individuele trainingsrecords heeft opgeslagen, wat relevant is bij audits door een notified body.
Het European Data Protection Board (EDPB) stelt in dit verband:
“Privacy-enhancing technologies zijn geen luxe maar een noodzaak voor organisaties die verantwoord AI willen inzetten op gevoelige gegevens.”
De OECD Digital Government Outlook 2023 sluit hierbij aan door te beschrijven hoe overheden PETs integreren in hun data-governance-kaders om publiek vertrouwen in AI-systemen te onderbouwen met technische garanties in plaats van alleen beleidsverklaringen.
Sectorverschillen: zorg, rechtspraak en overheid
De implementatie van PETs verschilt sterk per sector, zowel in technische aanpak als in het toepasbare normenkader.
Zorgsector en NEN 7510
In de zorg geldt NEN 7510 als de Nederlandse norm voor informatiebeveiliging. Patiëntendata valt bovendien onder de bijzondere categorieën van Artikel 9 AVG, wat verwerking in beginsel verbiedt tenzij aan strikte uitzonderingen is voldaan. Federated learning en differential privacy zijn hier het meest inzetbaar omdat ze statistische analyses en modeltraining mogelijk maken zonder directe overdracht van medische dossiers. Ziekenhuizen die samenwerken in een diagnostisch AI-netwerk kunnen zo gezamenlijk een model verbeteren zonder de NEN 7510-beveiligingsperimeter te doorbreken.
Rechtspraak en justitie
In de rechtspraak gaat het vrijwel altijd om volledig geïsoleerde on-premise omgevingen. Strafdossiers en rechtbankgegevens vallen onder het Wetboek van Strafvordering en aanvullende staatsgeheimhouding. Federated learning is hier minder geschikt omdat elke externe communicatie van modelparameters een juridisch risico vormt. Synthetische data kan worden ingezet voor het trainen van hulpmodellen (zoals documentclassificatie) op basis van geanonimiseerde vonnissen, waarbij de AP-anonimiseringseis bijzonder zwaar telt vanwege de identificeerbaarheid van betrokkenen in juridische contexten.
Overheid en digitale dienstverlening
Overheidsorganisaties werken steeds vaker met de Baseline Informatiebeveiliging Overheid (BIO) en zijn onder de NIS2-richtlijn verplicht risicobeheer en incidentrapportage te formaliseren. PETs worden hier ingezet voor beleidsanalyse op populatieniveau (differential privacy op CBS-data), interoperabiliteit tussen overheidsregisters (secure multi-party computation) en het testen van nieuwe systemen zonder productiedata te gebruiken (synthetische data). De OECD Digital Government Outlook beschrijft dit als een groeiende trend waarbij technische privacygaranties onderdeel worden van de publieke verantwoordingscyclus.
Van beleid naar architectuur: PETs implementeren in de praktijk
Een effectieve PET-strategie begint niet met een technologiekeuze maar met een gegevensstroom-analyse. Welke data verlaat de organisatie, naar welke partij, voor welk doel en op basis van welke grondslag? Pas na deze inventarisatie kan een afweging worden gemaakt tussen de drie benaderingen: data lokaal houden via on-premise AI, data statistisch beschermen via differential privacy, of data structureel ontkoppelen via synthetische generatie.
Compliance officers doen er goed aan PETs te documenteren als technische maatregel in hun Data Protection Impact Assessment (DPIA) onder Artikel 35 AVG. De keuze voor een specifieke PET, inclusief de gehanteerde privacybudget (epsilon-waarde bij differential privacy) of de gebruikte generatieve architectuur bij synthetische data, maakt deel uit van de aantoonbaarheidsplicht onder Artikel 5 lid 2 AVG.
Veelgestelde vragen
Maakt het gebruik van synthetische data een dataset automatisch buiten de scope van de AVG?
Nee. De Autoriteit Persoonsgegevens stelt dat synthetische data alleen buiten de AVG valt als aantoonbaar is dat de data niet herleidbaar is tot individuen. Dat vereist een gedegen anonimiseringsanalyse, zoals een membership inference-test.
Wat is het praktische verschil tussen federated learning en een volledig on-premise AI-model?
Bij federated learning blijft de ruwe data op de lokale nodes, maar worden modelupdates (gradiënten) gedeeld met een centrale coördinator, wat een restrisico oplevert. Een volledig on-premise model draait en traint binnen de eigen infrastructuur zonder enige externe communicatie, wat maximale controle biedt maar meer eigen rekencapaciteit vereist.
Welke PETs zijn het meest geschikt voor een zorgorganisatie die wil voldoen aan NEN 7510?
Federated learning en differential privacy zijn in de zorg het meest toegepast omdat ze statistische analyses en modeltraining mogelijk maken zonder patiëntdata te centraliseren of direct bloot te stellen. Homomorfe encryptie is veelbelovend maar nog beperkt inzetbaar vanwege de hoge rekenlast.
Wanneer valt een AI-systeem dat gebruikmaakt van PETs onder de hoog-risico categorie van de EU AI Act?
De risicoklasse wordt bepaald door het toepassingsdomein en de mogelijke impact, niet door de gebruikte privacytechnologie. Een AI-systeem in de gezondheidszorg of rechtspraak valt in beginsel onder Annex III van de EU AI Act als hoog-risico, ongeacht of PETs worden toegepast.
Kan homomorfe encryptie worden ingezet voor AI-inferentie in de cloud zonder de AVG te schenden?
In theorie maakt FHE het mogelijk berekeningen uit te voeren op versleutelde data zonder dat de cloudprovider de inhoud ziet. In de praktijk zijn de prestaties nog beperkt voor grootschalige inferentie. Juridisch blijft de vraag wie de verwerkingsverantwoordelijke is en welke Standard Contractual Clauses of Binding Corporate Rules van toepassing zijn bij doorgifte buiten de EER.
