Federated learning is een gedistribueerde machine learning-techniek waarbij een AI-model wordt getraind op lokale datasets bij meerdere partijen, zonder dat de ruwe data ooit een centrale server bereikt. Alleen geaggregeerde modelparameters of gradiënten worden uitgewisseld. Voor Europese organisaties die AI willen inzetten zonder gevoelige data buiten hun eigen infrastructuur te brengen, is dit een van de meest veelbelovende privacy-enhancing technologies van dit moment.
Hoe federated learning de datagrens bewaakt
Bij federated learning blijft gevoelige informatie strikt lokaal. Het globale model stuurt een initiële versie naar deelnemende nodes, elke node traint lokaal op eigen data, en stuurt uitsluitend de berekende gradiënten of gewichtsupdates terug naar een centrale aggregator. De aggregator combineert deze updates tot een verbeterd globaal model, zonder ooit de onderliggende data te zien.
Dit architectuurprincipe is fundamenteel anders dan cloudgebaseerde AI-training, waarbij alle data naar een centrale omgeving stroomt. De Europese Toezichthouder voor Gegevensbescherming (EDPS) heeft dit in de EDPS TechDispatch #1/2025 over Federated Learning expliciet beschreven als een aanpak waarbij “het model naar de data gaat, in plaats van de data naar het model.” Dat maakt federated learning een technische uitwerking van het privacy by design-beginsel dat centraal staat in de Europese gegevensbeschermingsfilosofie.
Sectoren met de grootste meerwaarde
Federated learning levert de meeste toegevoegde waarde in sectoren waar gevoelige data inherent verspreid is over meerdere organisaties of locaties, en waar wet- en regelgeving centralisatie bemoeilijkt of verbiedt.
Gezondheidszorg
Ziekenhuizen en diagnostische laboratoria beschikken elk over relatief kleine, maar kwalitatief rijke datasets. Gezamenlijk AI-onderzoek naar zeldzame ziekten of diagnostische patronen was tot nu toe moeilijk omdat patiëntdata niet zomaar gedeeld mag worden. Federated learning maakt het mogelijk dat een consortium van ziekenhuizen samen een diagnostisch model traint zonder dat enig ziekenhuis zijn patiëntendossiers deelt. Initiatieven als het pan-Europese MELLODDY-project, waarbij farmaceutische bedrijven moleculaire data federatief deelden voor medicijnontwikkeling, illustreren de praktische haalbaarheid. Tegelijk onderstreept de gezondheidszorgstatistiek hoe urgent dit is: in 2023 waren gezondheidszorgorganisaties wereldwijd goed voor meer dan 24% van alle gemelde datalekken (Verizon Data Breach Investigations Report 2023).
Juridische en financiële sector
Advocatenkantoren en juridische afdelingen van grote ondernemingen hebben te maken met geheimhouding, beroepsgeheim en concurrentiegevoelige informatie. Gezamenlijk trainen op contractpatronen of jurisprudentie kan waardevolle inzichten opleveren, maar vereist dat de brondata de organisatie nooit verlaat. Federated learning biedt hier een technisch antwoord. Hetzelfde geldt voor financiële instellingen die transactionele patronen voor fraudedetectie willen verbeteren zonder transactiedata onderling te delen.
Overheid en publieke sector
Gemeenten, uitvoeringsorganisaties en toezichthouders verzamelen elk afzonderlijk data over burgers. Beleid op basis van geaggregeerde patronen kan effectiever zijn dan op basis van één gemeentelijke dataset, maar koppeling van datasets stuit op juridische en politieke bezwaren. Federated learning laat overheden samenwerken aan gedeelde AI-modellen voor bijvoorbeeld armoededetectie of verkeersoptimalisatie, zonder dat burgerdata tussen organisaties stroomt.
Resterende privacyrisico’s: gradient leakage en membership inference
Ondanks de architecturale voordelen kent federated learning specifieke aanvalsoppervlakken die compliance-officers niet mogen onderschatten.
Gradient leakage is het meest gedocumenteerde risico. Onderzoek heeft aangetoond dat een kwaadwillende aggregator of een afgeluisterde verbinding de gradiënten kan gebruiken om individuele trainingsdatasets gedeeltelijk te reconstrueren. Dit is geen theoretisch risico: gepubliceerde aanvallen zoals de zogenoemde “Deep Leakage from Gradients”-methode (Zhu et al., NeurIPS 2019) tonen aan dat beelddata en tekst onder bepaalde omstandigheden reconstrueerbaar zijn.
Membership inference attacks zijn een tweede categorie: een aanvaller kan op basis van het getrainde model afleiden of een specifiek datapunt deel uitmaakte van de trainingsset. In de zorgcontext betekent dit dat het model indirect kan onthullen of een bepaalde patiënt aan een studie heeft deelgenomen, zelfs zonder toegang tot de data zelf.
Model poisoning is een derde risico: een deelnemende node stuurt bewust vervuilde gradiënten om het globale model te manipuleren of een achterdeur in te bouwen. Dit is zowel een beveiligings- als een integriteitsrisico voor AI-systemen die onder de EU AI Act worden geclassificeerd als hoog-risico.
Federated learning en de AVG: dataminimalisatie en doelbinding
De AVG, specifiek Artikel 5, stelt twee beginselen centraal die direct relevant zijn: dataminimalisatie (data mag niet verder worden verwerkt dan noodzakelijk) en doelbinding (data mag niet worden gebruikt voor andere doelen dan waarvoor het is verzameld). Federated learning sluit technisch goed aan bij beide beginselen: de ruwe data blijft bij de verwerkingsverantwoordelijke, en de modelupdates bevatten in beginsel geen identificeerbare informatie.
Maar de juridische kwalificatie is genuanceerder. De EDPB Support Pool of Experts heeft herhaaldelijk benadrukt dat privacy-enhancing technologies geen vervanging zijn voor juridische waarborgen. Vragen die los van de technische architectuur beantwoord moeten worden: wie is de verwerkingsverantwoordelijke voor het getrainde model, wie is de aggregator, en onder welke grondslag worden de gradiënten verwerkt? De aggregatie van gradiënten kan zelf als verwerking van persoonsgegevens worden aangemerkt als reverse engineering mogelijk is.
Bovendien bepaalt de EU AI Act (Verordening (EU) 2024/1689) aanvullende eisen voor hoog-risico AI-systemen, zoals systemen in de zorg, rechtspraak en overheidsbesluiten. Datagovernance, technische documentatie en robuustheid zijn vereisten die ook bij federatief getrainde modellen getoetst worden.
| AVG-beginsel | Hoe federated learning bijdraagt | Resterende juridische vraag |
|---|---|---|
| Dataminimalisatie (Art. 5 lid 1c) | Ruwe data verlaat de lokale omgeving niet | Zijn gradiënten zelf persoonsgegevens? |
| Doelbinding (Art. 5 lid 1b) | Elk model is getraind voor een specifiek doel | Wie controleert hergebruik van het globale model? |
| Integriteit en vertrouwelijkheid (Art. 5 lid 1f) | Data blijft binnen eigen beveiligde omgeving | Zijn de verbindingen tussen nodes adequaat versleuteld? |
Combinaties met andere privacy-enhancing technologies
Federated learning bereikt zijn hoogste privacybescherming in combinatie met aanvullende technische maatregelen. Twee combinaties zijn bijzonder relevant voor Europese organisaties.
Differentiële privacy
Differentiële privacy voegt gekalibreerde ruis toe aan de gradiënten voordat ze worden verstuurd, zodat individuele datapunten niet meer reconstrueerbaar zijn. De mate van ruis wordt uitgedrukt in een privacybudget (epsilon). Een lage epsilon biedt meer bescherming maar tast de nauwkeurigheid van het model aan. Voor de meeste zorgtoepassingen is een epsilon-waarde van 1 tot 10 gebruikelijk in de literatuur, waarbij lagere waarden vereist zijn als het trainingsdata van identificeerbare personen betreft. Differentiële privacy is de meest praktisch inzetbare tegenmaatregel voor gradient leakage en membership inference attacks.
Homomorfe encryptie
Homomorfe encryptie maakt het mogelijk berekeningen uit te voeren op versleutelde data, zodat de aggregator gradiënten samenvoegt zonder ze ooit in leesbare vorm te zien. Dit elimineert het vertrouwen in de aggregator als potentieel aanvalspunt. De keerzijde is aanzienlijke rekenoverhead: volledig homomorfe encryptie (FHE) is momenteel tien tot duizend keer langzamer dan onversleutelde berekeningen, afhankelijk van de implementatie. Voor productieomgevingen zijn partieel homomorfe schema’s zoals CKKS een bruikbaarder compromis.
De combinatie van federated learning met zowel differentiële privacy als homomorfe encryptie levert de sterkste privacygaranties, maar stelt hoge eisen aan rekenkracht en architectuurtechnische expertise. Organisaties in de gezondheidszorg of overheid die federatieve modellen willen inzetten voor hoog-risico besluitvorming, doen er goed aan deze combinatie te overwegen en te documenteren in hun Data Protection Impact Assessment.
Praktische uitdagingen bij on-premise en soevereine implementatie
De implementatie van federated learning in een on-premise of soevereine cloudomgeving confronteert IT-beslissers met uitdagingen die verder gaan dan de theoretische architectuur.
Heterogeniteit van data en hardware is het meest onderschatte probleem. In een ziekenhuisnetwerk of bij een groep gemeenten variëren lokale datasets sterk in omvang, kwaliteit en distributie. Modellen die trainen op niet-uniform verdeelde data (ook wel “non-IID data” genoemd) convergeren trager en minder betrouwbaar. Dit vereist specifieke aggregatiealgoritmen zoals FedProx of FedNova in plaats van het basisalgoritme FedAvg.
Communicatiebandbreedte vormt een bottleneck als nodes over WAN-verbindingen zijn verbonden. Gradiënten voor grote taalmodellen of beeldherkenningsnetwerken kunnen gigabytes per trainingsronde beslaan. Compressietechnieken en asynchrone aggregatie zijn noodzakelijk voor productiewaardige implementaties.
Governance en auditbaarheid zijn juridisch cruciaal. De EU AI Act vereist voor hoog-risico systemen een audit trail van trainingsdata en modelversies. Bij federated learning is dit technisch complex: de ruwe data is nooit gecentraliseerd, wat traceerbaarheid van modelgedrag bemoeilijkt. Organisaties moeten een governance-raamwerk opzetten dat lokale logs, gradiëntarchivering en aggregatieprotocollen omvat.
Vertrouwensmodellen tussen deelnemende organisaties vereisen contractuele en technische afspraken. In een consortium van ziekenhuizen of gemeenten moet worden vastgelegd wie de aggregator beheert, hoe toegangsbeheer is geregeld, en hoe een deelnemende node kan worden uitgesloten bij vermoeden van poisoning of datalek. Dit is niet alleen een technische maar ook een juridische en bestuurlijke opgave.
De wereldwijde markt voor federated learning werd in 2022 geschat op circa 127 miljoen USD, met een verwachte groei naar meer dan 210 miljoen USD in 2028 (MarketsandMarkets, 2022). Die groei weerspiegelt de toenemende erkenning dat AI-adoptie in gereguleerde sectoren gebaat is bij een architectuur die data niet centraliseert.
Samenvattend perspectief voor compliance-officers
Federated learning is geen privacyoplossing die je installeert en vergeet. Het is een architectuurkeuze die de risicobalans verschuift: minder risico op gecentraliseerde datalekken, meer complexiteit in het beheer van gedistribueerde aanvalsoppervlakken. Voor compliance-officers en IT-beslissers in zorg, overheid en de juridische sector is de prioriteitenlijst helder: beoordeel of gradiënten als persoonsgegevens worden gekwalificeerd in uw specifieke context, zorg dat differentiële privacy standaard is ingebouwd, documenteer de verwerkingsgrondslag voor de aggregatiefase, en toets het systeem aan de eisen van de EU AI Act als het besluitvorming raakt die als hoog-risico wordt geclassificeerd.
Veelgestelde vragen
Maakt federated learning een organisatie automatisch AVG-compliant?
Nee. Federated learning vermindert de blootstelling van persoonsgegevens, maar ontslaat een organisatie niet van haar verplichtingen onder de AVG. Een verwerkingsgrondslag, een verwerkersovereenkomst en een Data Protection Impact Assessment blijven vereist.
Kunnen gradiënten worden gebruikt om originele data te reconstrueren?
Ja, dit is een reëel risico dat “gradient leakage” wordt genoemd. Onderzoekers hebben aangetoond dat uit modelupdates onder bepaalde omstandigheden individuele trainingsdatasets kunnen worden afgeleid. Combinatie met differentiële privacy beperkt dit risico aanzienlijk.
Wat is het verschil tussen federated learning en gewone gedistribueerde verwerking?
Bij gewone gedistribueerde verwerking worden data gecentraliseerd voordat het model traint. Bij federated learning blijft de ruwe data lokaal en worden alleen modelparameters of gradiënten uitgewisseld. Dat is een fundamenteel andere architectuur vanuit privacyperspectief.
Is federated learning ook relevant voor kleine organisaties?
Federated learning is het meest waardevol wanneer meerdere partijen willen samenwerken zonder data te bundelen, zoals ziekenhuizen of gemeenten. Maar ook intern, binnen een organisatie met meerdere afdelingen of locaties, kan het worden ingezet om data-isolatie te handhaven.
Hoe verhoudt federated learning zich tot de eisen van de EU AI Act?
De EU AI Act (Verordening (EU) 2024/1689) stelt voor hoog-risico AI-systemen eisen aan datakwaliteit, transparantie en governance. Federated learning kan bijdragen aan het aantonen van privacy by design, maar ontslaat aanbieders niet van de verplichte risicobeoordelingen en technische documentatie die de wet vereist.
