Een soevereiniteitsrisico bij AI-code-assistenten ontstaat wanneer een ontwikkelomgeving automatisch codefragmenten, commentaar, variabelenamen en omgevingscontext doorstuurt naar servers buiten de directe controle van de organisatie. Voor overheids-, juridische en gereguleerde organisaties is dit geen theoretisch gevaar: het raakt direct aan de AVG, NIS-2, het beroepsgeheim en toenemende EU-wetgeving zoals de AI Act en de Cyber Resilience Act (CRA).
Hoe GitHub Copilot data verwerkt en waarom dat risico’s meebrengt
GitHub Copilot (ontwikkeld door Microsoft in samenwerking met OpenAI) stuurt zogenoemde “context windows” door naar Azure OpenAI-servers. Die context omvat niet alleen de regel die een ontwikkelaar typt, maar ook omliggende code, geopende bestanden, commentaarblokken en soms configuratiebestanden in de editor.
Dit betekent concreet dat de volgende typen informatie de organisatiegrenzen verlaten zonder dat de gebruiker dat actief bevestigt:
- Interne API-endpoints en databaseschema’s die in code zijn vastgelegd
- Hardgecodeerde configuratiewaarden of sleutels die nog niet zijn vervangen door geheimenbeheer
- Namen van systemen, personen of projecten die herleidbaar zijn als persoonsgegevens
- Bedrijfslogica die als bedrijfsgeheim of staatsgeheim is geclassificeerd
- Architectuurpatronen van kritieke infrastructuursoftware
Het Europees Comité voor Gegevensbescherming (EDPB) stelt hierover: “Het gebruik van AI-tools die trainingsdata verwerken buiten de EU valt onder de AVG zodra die data persoonsgegevens bevat of herleidbaar is. Een verwerkersovereenkomst ex artikel 28 AVG is dan geen optie maar een verplichting.”
De Autoriteit Persoonsgegevens voegt daar aan toe: “Organisaties moeten ervan uitgaan dat elke prompt die naar een externe AI-dienst wordt gestuurd, potentieel gevoelige informatie bevat. Het ontbreken van een verwerkersovereenkomst maakt dit een meldingsplichtig datalek.”
Daarboven geldt dat Amerikaanse wetgeving zoals de CLOUD Act de Amerikaanse overheid de mogelijkheid geeft om data op te vragen bij Amerikaanse technologiebedrijven, ook als die data op Europese servers staat. Microsoft is een Amerikaans bedrijf en daarmee onderworpen aan deze jurisdictie.
Welke data loopt het grootste risico in gereguleerde omgevingen
De risico’s zijn concreter dan vaak wordt aangenomen. In de praktijk bevatten codebases van overheids- en juridische organisaties meer gevoelige data dan ontwikkelaars zich realiseren.
Uit onderzoek van GitGuardian (State of Secrets Sprawl 2023) bleek dat in meer dan 10 miljoen publieke GitHub-commits hardgecodeerde geheimen zoals API-sleutels en wachtwoorden werden aangetroffen. In private repositories bij gereguleerde organisaties is dit probleem minstens even groot, maar minder zichtbaar.
Specifieke risicosituaties voor compliance officers:
- Advocatenkantoren en notarissen: codebase van dossiersystemen bevat klantreferenties, zaaknummers en soms namen. Dit valt onder het beroepsgeheim én de AVG.
- Overheidsinstanties: systemen voor vergunningverlening of handhaving bevatten BSN-logica, adreskoppelingen en beslisregels die als staatsgeheime informatie kunnen gelden.
- Financiële instellingen: risicomodellen en fraudedetectielogica zijn bedrijfsgeheimen die via context windows worden meegestuurd.
Zelfgehoste alternatieven: Continue.dev, Ollama en Tabby vergeleken
Er bestaan volwassen open-source alternatieven die volledig on-premise draaien en geen enkel datapunt naar externe servers sturen.
| Tool | Architectuur | IDE-integratie | Modelflexibiliteit | Datasoevereiniteit |
|---|---|---|---|---|
| GitHub Copilot | Cloud (Azure OpenAI, VS buiten EU-controle) | VSCode, JetBrains, Visual Studio | Geen (gesloten model) | Laag: data verlaat organisatie |
| Continue.dev + Ollama | Lokale LLM via Ollama-backend op eigen server | VSCode, JetBrains | Hoog: keuze uit open modellen (CodeLlama, Mistral, etc.) | Volledig: geen extern verkeer |
| Tabby | Zelfgehoste server met eigen modelregistratie | VSCode, JetBrains, Vim/Neovim | Hoog: eigen modelkeuze en fine-tuning mogelijk | Volledig: geen extern verkeer |
Continue.dev functioneert als een IDE-extensie die via een configureerbaar API-endpoint communiceert. Gekoppeld aan Ollama (een lokale LLM-runtime) draait het volledige inferentieproces op de eigen hardware van de organisatie. Continue.dev ondersteunt codevoltooiing, chat en refactoring-suggesties. De configuratie bepaalt welk model wordt geladen; organisaties kunnen kiezen voor gespecialiseerde code-modellen zoals CodeLlama of StarCoder2.
Tabby is een volledige zelfgehoste server die een eigen API-laag, modelregistratie en beheerdersinterface biedt. Het gedraagt zich functioneel als een interne Copilot-vervanging en is via een interne URL bereikbaar voor alle ontwikkelaars binnen het netwerk. Tabby ondersteunt ook team-gebaseerde statistieken over gebruik, wat relevant is voor audittrails onder de CRA.
Beleid opstellen voor AI-code-assistenten: AI Act, NIS-2 en beroepsgeheim
Een effectief gebruik- en risicobeleid voor AI-code-assistenten vereist afstemming op drie wettelijke kaders tegelijk.
EU AI Act: verboden praktijken en hoog-risico classificatie
De EU AI Act (Verordening 2024/1689) bevat in artikel 5 een lijst van verboden AI-praktijken en in bijlage III de categorieën hoog-risico AI. Een code-assistent die wordt ingezet bij de ontwikkeling van software voor kritieke infrastructuur, rechtshandhaving of overheidsbesluitvorming valt indirect onder de hoog-risico classificatie. Dit brengt documentatie-, risicobeoordeling- en auditverplichtingen mee voor de ontwikkelorganisatie, niet alleen voor de aanbieder van de AI-tool.
GitHub heeft meer dan 1,3 miljoen betaalde Copilot-abonnees gerapporteerd per Q4 2023, wat aangeeft hoe breed de adoptie is in professionele omgevingen, ook bij organisaties die mogelijk onder de hoog-risico categorieën vallen.
NIS-2: supply chain security en meldplicht
NIS-2 (Richtlijn 2022/2555) verplicht organisaties in essentiële en belangrijke sectoren tot aantoonbare maatregelen voor supply chain security. Een cloudgebaseerde code-assistent is een externe leverancier in de softwareontwikkelingsketen. Het ontbreken van een risicoanalyse van dit tool is bij een NIS-2-audit een concreet gebrek. Zelfgehoste alternatieven vallen volledig binnen de eigen supply chain en zijn daarmee controleerbaar.
Beroepsgeheim en dataclassificatie
Voor advocaten, notarissen, accountants en medische organisaties geldt dat de codebase van systemen die zij gebruiken indirect onder het beroepsgeheim valt. Het gebruik van een AI-tool die deze code verwerkt op externe servers zonder toestemming van de cliënt is in veel gevallen een schending van het beroepsgeheim, ongeacht of er direct persoonsgegevens in de context zitten.
CRA en de AI-SBOM-verplichting in softwareontwikkeling
De Cyber Resilience Act, gepubliceerd in het Publicatieblad van de EU in 2024, verplicht organisaties die software op de EU-markt brengen een Software Bill of Materials (SBOM) bij te houden voor alle componenten. Nieuw ten opzichte van eerdere SBOM-praktijken is dat ook AI-tools die worden ingezet in het ontwikkelproces gedocumenteerd moeten worden.
Concreet betekent dit dat voor elke AI-code-assistent die in de ontwikkelworkflow wordt gebruikt, de volgende informatie aantoonbaar aanwezig moet zijn:
- Naam en versie van de tool
- Verwerkingslocatie van de ingevoerde data
- Of de tool traint op ingevoerde prompts (en zo ja, onder welke voorwaarden)
- Juridische basis voor de gegevensverwerking (AVG artikel 28 verwerkersovereenkomst)
Bij zelfgehoste tools zoals Tabby of Continue.dev met Ollama is deze documentatie aanzienlijk eenvoudiger: de verwerkingslocatie is de eigen infrastructuur, er is geen externe verwerker en trainingsgedrag wordt volledig door de organisatie zelf bepaald.
DevSecOps met lokale AI: integratie in soevereine CI/CD-pipelines
Het integreren van een lokale AI-code-assistent in een soevereine DevSecOps-omgeving vereist een aantal concrete architectuurkeuzes.
Netwerkarchitectuur en geheimenbeheer
De Ollama- of Tabby-backend draait als interne microservice op een server zonder internettoegang. Netwerksegmentatie zorgt ervoor dat de AI-laag nooit extern bereikbaar is. Geheimenbeheer (via HashiCorp Vault on-premise of een equivalent) blijft gescheiden van de AI-backend: de AI-assistent mag nooit rechtstreeks toegang hebben tot secrets stores.
CI/CD-integratie en audittrails
In een zelfgehoste CI/CD-omgeving (zoals GitLab Self-Managed of Gitea met Forgejo) kunnen AI-gegenereerde codeblokken worden gemarkeerd via gestandaardiseerde commit-metadata. Dit ondersteunt de traceerbaarheid die de CRA vereist: welke code is (deels) door AI gegenereerd en onder welke toolversie. Geautomatiseerde SAST-scans (Static Application Security Testing) in de pipeline controleren AI-gegenereerde code op bekende kwetsbaarheidpatronen voordat deze de hoofdbranch bereikt.
Modelgovernance binnen de organisatie
Bij lokale modellen bepaalt de organisatie zelf welk model wordt gebruikt en op welke data het is getraind. Voor extra zekerheid kunnen organisaties werken met modellen die volledig open trainingsdata hebben (zoals StarCoder2, getraind op The Stack v2 met expliciete licentiefiltering), waarmee ook intellectueel eigendomsrisico’s worden geminimaliseerd.
Een intern modelregister, aangehaakt op de SBOM-documentatie, legt vast welke modelversie op welk moment actief was. Dit maakt retroactieve audits mogelijk als er vragen ontstaan over de herkomst van bepaalde codeonderdelen.
FAQ
Is GitHub Copilot verboden voor medewerkers van overheidsorganisaties?
Er bestaat geen algemeen verbod, maar de AVG en NIS-2 verplichten organisaties te beoordelen welke data naar externe servers gaat. Als een codebase persoonsgegevens, staatsgeheimen of geclassificeerde bedrijfslogica bevat, is het gebruik van cloudgebaseerde code-assistenten zonder goedgekeurde verwerkersovereenkomst en een dataclassificatiebeleid juridisch problematisch.
Wat is het verschil tussen Continue.dev met Ollama en Tabby?
Continue.dev is een IDE-extensie (VSCode, JetBrains) die via een configureerbare backend werkt en lokale modellen via Ollama of LM Studio aanspreekt. Tabby is een volledige zelfgehoste server met eigen modelbeheeren een webinterface, vergelijkbaar met een on-premise Copilot-vervanging. Beide sturen geen data naar externe partijen.
Wat houdt de AI-SBOM-verplichting onder de CRA precies in voor softwareontwikkeling?
De Cyber Resilience Act verplicht organisaties die software op de EU-markt brengen een Software Bill of Materials bij te houden voor alle componenten, inclusief AI-tools die worden ingezet in het ontwikkelproces. Dit betekent dat het gebruik van GitHub Copilot of andere AI-assistenten gedocumenteerd moet zijn, inclusief welke data deze verwerken en onder welke jurisdictie.
Valt een AI-code-assistent onder hoog-risico AI volgens de EU AI Act?
Dat hangt af van de toepassing. Bijlage III van de EU AI Act (Verordening 2024/1689) benoemt hoog-risico categorieën zoals kritieke infrastructuur en overheidsbesluiten. Een code-assistent die wordt ingezet in de ontwikkeling van software voor deze categorieën kan indirect onder de hoog-risico classificatie vallen, wat documentatie- en auditverplichtingen meebrengt.
Hoe integreer ik een lokale AI-code-assistent in een bestaande CI/CD-pipeline?
Lokale modellen via Tabby of Continue.dev met Ollama draaien als interne API-endpoint binnen het netwerk. In een soevereine CI/CD-omgeving (bijvoorbeeld Gitea of GitLab self-hosted) koppelt u de code-assistent als interne service. Geheimenbeheer (zoals HashiCorp Vault on-premise) blijft gescheiden van de AI-laag, en netwerksegmentatie zorgt ervoor dat de AI-backend nooit extern bereikbaar is.
