Kort: Organisaties in gereguleerde sectoren kunnen open-source taalmodellen zoals LLaMA 3, Mistral en OLMo 2 32B lokaal hosten via tools als Ollama, waarmee ze voldoen aan AVG en AI Act zonder bedrijfsdata te delen met externe aanbieders.

Een open-source LLM on-premise soeverein inzetten betekent dat een organisatie een groot taalmodel draait op eigen hardware, met open broncode, zonder dat prompts, documenten of inferentiedata de eigen netwerkgrens verlaten. Voor compliance officers en IT-beslissers in de overheid, rechtspraktijk en andere gereguleerde sectoren is dit geen technische luxe, maar een juridische noodzaak zodra bedrijfsgeheimen of persoonsgegevens in het spel zijn.

Waarom soevereine AI-inferentie een juridische kwestie is

Zodra een prompt een externe API bereikt, bepaalt de jurisdictie van de aanbieder welke wetten op die data van toepassing zijn. De Amerikaanse CLOUD Act (2018) verplicht Amerikaanse bedrijven om op verzoek van de federale overheid toegang te verlenen tot opgeslagen data, ook als die fysiek in Europa staat. Dat maakt elke inferentie via OpenAI, Azure OpenAI of Google Vertex AI juridisch risicovol voor organisaties die werken met vertrouwelijke dossiers, persoonsgegevens of staatsgeheimen.

De boete van 1,2 miljard euro die de Ierse Data Protection Commission in mei 2023 oplegde aan Meta wegens onrechtmatige doorgifte van EU-persoonsgegevens naar de VS illustreert dat toezichthouders dit risico serieus nemen. Een intern gehost model elimineert de doorgiftevraag volledig: er is geen derde land, geen subverwerker en geen API-contract.

Let op: Zelfs als een cloudaanbieder claimt dat data “in de EU blijft”, kan de CLOUD Act de moedermaatschappij in de VS dwingen toegang te verlenen. On-premise hosting is de enige architecturele garantie die dit uitsluit.

Geschikte open-source modellen voor gereguleerde sectoren

Niet elk open-source model is geschikt voor productie-inzet in gevoelige omgevingen. De licentie, de transparantie over trainingsdata en de beschikbaarheid van modelkaarten zijn doorslaggevende criteria naast louter prestaties.

Model Ontwikkelaar Parametergrootte Licentie Opmerking
LLaMA 3 Meta 8B / 70B / 405B Meta LLaMA 3 Community License Breed inzetbaar; 70B vereist zware GPU
Mistral 7B / Mixtral Mistral AI (FR) 7B / 8x7B MoE Apache 2.0 Europese oorsprong; sterke meertalige prestaties
OLMo 2 32B Allen Institute for AI (Ai2) 32B Apache 2.0 Volledig open trainingsdata; geschikt voor wetenschappelijke verantwoording

Mistral AI is gevestigd in Parijs en valt daarmee primair onder Franse en Europese jurisdictie, wat voor Europese instellingen een relevant onderscheid is ten opzichte van Amerikaanse aanbieders. OLMo 2 32B van het Allen Institute for AI onderscheidt zich doordat niet alleen de modelgewichten, maar ook de trainingsdata en de trainingscode volledig openbaar zijn, wat auditbaarheid voor toezichthouders aanzienlijk vereenvoudigt.

Hardware-eisen en kostenvergelijking met cloud-AI

De hardware-investering voor on-premise LLM-inferentie is aanzienlijk, maar moet worden afgezet tegen structurele API-kosten en juridische risicoreductie.

Een model als LLaMA 3 8B draait functioneel op een server met één Nvidia RTX 4090 (24 GB VRAM). Voor LLaMA 3 70B zijn minimaal twee tot vier A100- of H100-GPU’s met 80 GB VRAM per kaart nodig. OLMo 2 32B vereist circa 64 GB VRAM in volledige precisie, of 32 GB met 4-bit kwantisatie via GGUF-formaat. De serverkosten voor een tweeledige A100-configuratie liggen ruwweg tussen de 30.000 en 60.000 euro aanschaf, plus energiekosten.

Ter vergelijking: intensief gebruik van GPT-4 via de OpenAI API kost bij verwerking van honderdduizenden tokens per dag al snel duizenden euro per maand, waarbij elke euro ook jurisdictierisico inkoopt. IDC schat dat de wereldwijde markt voor private AI-infrastructuur groeit met een CAGR van circa 40% tussen 2023 en 2027, mede doordat organisaties deze afweging bewust maken.

Ollama als lokale inference-server: architectuur en isolatie

Ollama is een open-source inference-server die modellen in GGUF-formaat lokaal beschikbaar stelt via een REST-API op localhost. De server communiceert niet met externe endpoints; er is geen telemetrie, geen model-update via internet en geen logging naar externe systemen, tenzij de beheerder dit expliciet configureert.

Technisch garandeert een organisatie dataisolatie door: (1) het netwerk van de inferentieserver te segmenteren via VLAN of firewall-regels, zodat uitgaand verkeer naar internet structureel geblokkeerd is; (2) modelbestanden te valideren via SHA-256-hashverificatie bij elke update; en (3) containerisatie met rootless Podman of Docker te gebruiken, zodat het model geen toegang heeft tot het hostbestandssysteem buiten de aangewezen datadirectory.

Let op: Kwantisatie reduceert VRAM-gebruik aanzienlijk, maar introduceert een lichte kwaliteitsvermindering. Voor juridische of medische toepassingen verdient het aanbeveling prestaties te benchmarken op domeinspecifieke testsets vóór productie-inzet.

AVG en AI Act: verplichtingen bij intern gehoste generatieve AI

Het intern hosten van een LLM ontslaat een organisatie niet van alle AVG-verplichtingen. Wanneer het model persoonsgegevens verwerkt, zoals namen in klantvragen of medische gegevens in documenten, is artikel 5 AVG van toepassing (dataminimalisatie, doelbinding) en is een verwerkingenregister-update verplicht. Bij verwerkingen met een hoog risico, waaronder geautomatiseerde besluitvorming of grootschalige verwerking van bijzondere categorieën, schrijft artikel 35 AVG een Data Protection Impact Assessment (DPIA) voor.

De EDPB benadrukte in haar publicatie AI Privacy Risks & Mitigations for LLMs (2025) dat taalmodellen specifieke risico’s kennen, waaronder het onbedoeld memoriseren van trainingsdata en de moeilijkheid om het recht op wissing effectief te implementeren. Dit maakt transparantie over het gebruikte model en de trainingsdata, zoals die bij OLMo 2 beschikbaar is, juridisch relevant.

De EU AI Act (Verordening (EU) 2024/1689) voegt een tweede laag verplichtingen toe. Systemen die worden ingezet voor beslissingsondersteuning in sectoren zoals rechtspraak, HR-selectie of kritieke infrastructuur vallen onder Bijlage III als high-risk AI-systeem. Dit vereist technische documentatie, conformiteitsbeoordeling, menselijk toezicht en registratie in de EU-database. Voor interne documentverwerkingssystemen zonder directe beslissingsbevoegdheid is de classificatie lager, maar logging en transparantie naar eindgebruikers blijven verplicht.

Retrieval-Augmented Generation in een soevereine, offline omgeving

Retrieval-Augmented Generation (RAG) combineert een LLM met een documentendatabase: het model genereert antwoorden op basis van opgehaalde, relevante fragmenten uit interne kennisbronnen in plaats van uitsluitend op getrainde gewichten. In een soevereine architectuur worden alle componenten intern gehost.

Een praktische RAG-stack voor on-premise gebruik bestaat uit: een lokale vectordatabase zoals Qdrant of Weaviate (beide open-source en zelf te hosten), een embedding-model dat eveneens lokaal draait, zoals nomic-embed-text via Ollama, en het LLM zelf voor de generatiestap. Documenten worden gesplitst, omgezet naar vectorrepresentaties en opgeslagen in de vectordatabase. Bij een gebruikersvraag zoekt het systeem de meest relevante fragmenten op en geeft die mee als context aan het LLM, zonder dat enig document of query de organisatiegrens verlaat.

Dit patroon is bijzonder waardevol voor juridische kennisbases, interne beleidshandboeken of medische protocollen: het model hoeft niet opnieuw getraind te worden wanneer documentatie wijzigt, en de eigenaarschap over alle data blijft volledig intern.

Beveiligingsrisico’s specifiek voor on-premise LLM-inzet

On-premise hosten elimineert externe datadeling, maar introduceert eigen beveiligingsvraagstukken die specifieke aandacht vereisen.

Prompt injection is het meest directe aanvalsoppervlak: een kwaadwillende gebruiker probeert via de gebruikersinvoer de systeemprompt te overschrijven of het model instructies te geven die de bedrijfsregels omzeilen. Mitigatie vereist strikte scheiding tussen systeemcontext en gebruikersinvoer op architectuurniveau, gecombineerd met invoervalidatie en auditlogging van alle sessies.

Data poisoning is relevant wanneer de RAG-documentenbase door meerdere medewerkers wordt gevuld. Een aanvaller met schrijftoegang kan documenten invoeren die de retrieval-resultaten manipuleren en zo het model aanzetten tot onjuiste of misleidende antwoorden. Toegangscontrole op de vectordatabase en hashverificatie van ingevoerde documenten beperken dit risico.

Model inversion, waarbij een aanvaller via gerichte queries probeert memorized trainingsdata te reconstrueren, is bij open-source modellen minder kritiek dan bij proprietary modellen omdat de trainingsdata deels al openbaar is. Het risico verschuift naar fine-tuning: wanneer een organisatie het model verder traint op interne data, kan gevoelige informatie in de gewichten worden opgeslagen en later via adversarial queries worden uitgelicht. Differential privacy-technieken bij fine-tuning beperken dit, maar verhogen de computationele last.

Aanvullend verdient het aanbeveling de inferentieserver achter een interne authenticatiegateway te plaatsen (OAuth 2.0 of SAML), zodat ongeautoriseerde interne toegang tot de API wordt voorkomen, en regelmatig penetratietests uit te voeren specifiek gericht op de LLM-stack.

FAQ

Mag een overheidsorganisatie een open-source LLM on-premise inzetten zonder AVG-melding?

Ja, mits de verwerking van persoonsgegevens intern blijft en er geen subverwerker of externe API wordt ingeschakeld. Wel is een verwerkingenregister-update en, bij hoog-risicoverwerking, een DPIA verplicht onder de AVG.

Wat is het verschil tussen Ollama en een commerciële API zoals OpenAI?

Ollama is een lokale inference-server die open-source modellen draait op eigen hardware. Er worden geen prompts of antwoorden naar externe servers gestuurd. Bij een commerciële API vertrekt elke query naar de infrastructuur van de aanbieder, wat jurisdictierisico’s meebrengt onder wetten zoals de CLOUD Act.

Welk open-source model is het meest geschikt voor juridische documentverwerking in het Nederlands?

Mistral 7B en LLaMA 3 8B/70B zijn breed inzetbaar en presteren goed op Europese talen. Voor hogere nauwkeurigheid op lange documenten biedt OLMo 2 32B meer parameterruimte, maar dit vereist zwaardere GPU-hardware. Fijn-afstemming op domeinspecifieke Nederlandse teksten verbetert de resultaten aanzienlijk.

Hoe voorkom je prompt injection bij een interne chatbot op basis van een LLM?

Door systeemprompts strikt te scheiden van gebruikersinvoer, invoer te saniteren via een aparte validatielaag, en het model geen directe toegang tot systeemopdrachten of bestandssystemen te geven. Aanvullend helpen auditlogs van alle prompts en responses bij detectie van misbruik.

Valt een intern gehost LLM onder de AI Act als high-risk systeem?

Dat hangt af van het gebruik. Systemen die beslissingen ondersteunen in sectoren zoals rechtspraak, personeelsselectie of kritieke infrastructuur vallen onder Bijlage III van de EU AI Act (Verordening (EU) 2024/1689) en zijn daarmee high-risk, wat conformiteitsdocumentatie en menselijk toezicht vereist.

Veelgestelde vragen

Mag een overheidsorganisatie een open-source LLM on-premise inzetten zonder AVG-melding?
Ja, mits de verwerking van persoonsgegevens intern blijft en er geen subverwerker of externe API wordt ingeschakeld. Wel is een verwerkingenregister-update en, bij hoog-risicoverwerking, een DPIA verplicht onder de AVG.
Wat is het verschil tussen Ollama en een commerciu00eble API zoals OpenAI?
Ollama is een lokale inference-server die open-source modellen draait op eigen hardware. Er worden geen prompts of antwoorden naar externe servers gestuurd. Bij een commerciu00eble API vertrekt elke query naar de infrastructuur van de aanbieder, wat jurisdictierisico's meebrengt onder wetten zoals de CLOUD Act.
Welk open-source model is het meest geschikt voor juridische documentverwerking in het Nederlands?
Mistral 7B en LLaMA 3 8B/70B zijn breed inzetbaar en presteren goed op Europese talen. Voor hogere nauwkeurigheid op lange documenten biedt OLMo 2 32B meer parameterruimte, maar vereist dit zwaardere GPU-hardware. Fijn-afstemming op domeinspecifieke Nederlandse teksten verbetert de resultaten aanzienlijk.
Hoe voorkom je prompt injection bij een interne chatbot op basis van een LLM?
Door systeemprompts strikt te scheiden van gebruikersinvoer, invoer te saniteren via een aparte validatielaag, en het model geen directe toegang tot systeemopdrachten of bestandssystemen te geven. Aanvullend helpen auditlogs van alle prompts en responses bij detectie van misbruik.
Valt een intern gehost LLM onder de AI Act als high-risk systeem?
Dat hangt af van het gebruik. Systemen die beslissingen ondersteunen in sectoren zoals rechtspraak, personeelsselectie of kritieke infrastructuur vallen onder Annex III van de EU AI Act (Verordening (EU) 2024/1689) en zijn daarmee high-risk, wat conformiteitsdocumentatie en menselijk toezicht vereist.