Soevereine AI inferentie on-premise GPU verwijst naar het volledig lokaal uitvoeren van een groot taalmodel (LLM) op eigen GPU-hardware, zonder dat verzoeken, antwoorden of tussenliggende data de organisatieperimeter verlaten. Dit onderscheidt zich fundamenteel van het aanroepen van API-diensten bij hyperscalers zoals OpenAI, Google of Microsoft Azure, waarbij elke inferentieaanvraag door een buitenlandse juridische entiteit wordt verwerkt.
Waarom hyperscaler AI-inferentie een juridisch risico vormt
Het gebruik van cloudgebaseerde AI-diensten van Amerikaanse hyperscalers plaatst Europese organisaties in een juridisch spanningsveld. De Amerikaanse CLOUD Act (2018) verplicht Amerikaanse technologiebedrijven om op last van een Amerikaanse rechtbank gegevens te overleggen, ongeacht waar die data fysiek is opgeslagen. De USA PATRIOT Act kent vergelijkbare extraterritoriale aanspraken. Dit betekent dat een Europese overheidsinstantie die via een API verbinding maakt met een Amerikaans taalmodel, in principe blootstaat aan inzageverzoeken die buiten de AVG om gaan.
On-premise inferentie doorbreekt deze afhankelijkheid volledig. Het model draait op hardware die eigendom is van de eigen organisatie of een Europese co-locatiefaciliteit, zonder persistent verkeer naar externe servers. Er is geen aanbiedersrelatie met een partij die onder vreemde jurisdictie valt.
Hardware-infrastructuur voor lokale GPU-inferentie
De keuze van GPU-hardware bepaalt welke modellen praktisch inzetbaar zijn. Voor organisaties die beginnen met soevereine inferentie zijn er twee realistische niveaus.
Instapniveau: workstation-klasse GPU’s
Een kwantitatief gecomprimeerd 7-miljard-parametermodel in 4-bit GGUF-formaat vereist circa 6 tot 8 GB VRAM. GPU’s zoals de NVIDIA RTX 3090 (24 GB) of de zakelijke A2000 (12 GB) zijn hiervoor toereikend. Het inferentie-framework Ollama ondersteunt dit formaat direct en kan op een standaard Linux-server worden geïnstalleerd zonder aanvullende CUDA-configuratie. Voor documentanalyse, interne chatbots en juridische samenvattingstaken in een kleine organisatie is dit een realistisch startpunt.
Productieniveau: serverklasse GPU-clusters
Modellen van 13 miljard parameters vereisen twee GPU’s met elk minimaal 24 GB VRAM. Voor een 70-miljard-parametermodel zoals Llama 3 of Mistral Large zijn vier tot acht NVIDIA A100- of H100-kaarten nodig. vLLM, het open-source inferentieframework ontwikkeld door UC Berkeley, biedt via PagedAttention-geheugenoptimalisatie aanzienlijk hogere doorvoer dan Ollama bij parallelle gebruikerssessies, wat het geschikter maakt voor organisaties met tientallen gelijktijdige medewerkers. NPU’s (Neural Processing Units), zoals die in recente Intel Xeon Scalable-processors zijn geïntegreerd, kunnen lichtere inferentietaken ontlasten maar vervangen GPU’s niet voor grote modellen.
| Modelgrootte | Minimale VRAM | Aanbevolen hardware | Geschikt framework |
|---|---|---|---|
| 7B (4-bit kwantisatie) | 8 GB | NVIDIA RTX 3090 / A2000 | Ollama |
| 13B (4-bit kwantisatie) | 24 GB (2x GPU) | NVIDIA A5000 / RTX 4090 | Ollama / vLLM |
| 70B (4-bit kwantisatie) | 160 GB (4x A100) | NVIDIA A100 / H100 cluster | vLLM |
Soevereiniteitsprofiel: on-premise versus hyperscaler inferentie
On-premise inferentie biedt een fundamenteel ander soevereiniteitsprofiel dan cloudgebaseerde diensten. Bij hyperscaler-API’s verlaat elke prompt de organisatieperimeter; bij on-premise inferentie blijft de volledige verwerkingsketen intern. Het verschil is niet alleen technisch maar ook juridisch en contractueel.
Bij cloudgebaseerde AI-inferentiediensten zijn organisaties afhankelijk van de verwerkersovereenkomst van de aanbieder, diens retentiebeleid en de jurisdictie van de rechtspersoon. Hyperscalers gebruiken inferentiedata in toenemende mate voor fine-tuning van toekomstige modelversies, tenzij organisaties expliciet opt-out-opties activeren, wat niet altijd afdwingbaar of controleerbaar is. On-premise inferentie maakt deze vraag volledig irrelevant: er is geen externe partij die data ontvangt.
“AI systems that process personal data must be subject to the same data protection principles as any other processing activity. There is no AI exception to the GDPR.” Andrea Jelinek, voormalig voorzitter van de European Data Protection Board (EDPB)
AVG-vereisten bij soevereine AI-inferentie met persoonsgegevens
Wanneer een on-premise LLM persoonsgegevens verwerkt, bijvoorbeeld bij het samenvatten van dossiers, het analyseren van correspondentie of het ondersteunen van HR-processen, zijn de vereisten van de Algemene Verordening Gegevensbescherming volledig van toepassing. De AVG maakt geen uitzondering voor lokale of soevereine verwerking.
Concreet betekent dit dat organisaties een grondslag voor verwerking moeten kunnen aanwijzen (artikel 6 AVG), en bij bijzondere categorieën zoals gezondheidsdata ook artikel 9. Een Data Protection Impact Assessment (DPIA) is verplicht wanneer de AI-toepassing waarschijnlijk een hoog risico voor betrokkenen met zich meebrengt, conform artikel 35 AVG. Bovendien stelt de EU AI Act (Verordening EU 2024/1689) via Artikel 10 aanvullende eisen aan datakwaliteit en databeheer voor hoogrisico AI-systemen: trainingsdata en inferentiedata moeten worden gedocumenteerd, op bias worden gecontroleerd en onder menselijk toezicht vallen.
In 2023 legden Europese gegevensbeschermingsautoriteiten gezamenlijk meer dan 1,78 miljard euro aan AVG-boetes op (GDPR Enforcement Tracker, CMS Law, 2023). Een aanzienlijk deel van deze handhaving betrof onrechtmatige doorgifte van persoonsgegevens aan derde landen, precies het risico dat soevereine on-premise inferentie elimineert.
Geschikte open-source LLM’s voor gevoelige en gereguleerde omgevingen
Niet elk open-source model is geschikt voor soevereine inzet. Bepalende factoren zijn de licentievorm, de transparantie van het trainingsproces en de mogelijkheid tot verificatie van de modelgewichten.
Mistral AI, het Franse AI-bedrijf, publiceert basismodellen onder een Apache 2.0-licentie, wat commerciële en overheidsinzet zonder royaltyverplichtingen mogelijk maakt. Het Mistral 7B-model en de Mixtral 8x7B-variant zijn breed getest in gereguleerde omgevingen. Meta’s Llama 3-reeks (8B en 70B) is beschikbaar onder een eigen licentie die overheidsgebruik toestaat maar doorverkoop van modelafgeleiden beperkt. Voor organisaties die werkelijk aantoonbare soevereiniteit vereisen, zoals rechtbanken of inlichtingsdiensten, verdient een air-gapped omgeving de voorkeur: een netwerksegment zonder enige buitenverbinding, waarbij de modelgewichten via een gecontroleerd medium worden ingeladen en de integriteit wordt geverifieerd via cryptografische hash-controle.
“Sovereign AI infrastructure is not a luxury for governments; it is a prerequisite for strategic autonomy in the digital age.” ENISA, AI Cybersecurity Guidelines
De ENISA AI Cybersecurity Guidelines geven aanvullende richtlijnen voor het beveiligen van lokale inferentieomgevingen, waaronder het isoleren van het inferentie-eindpunt, het loggen van alle aanvragen voor auditdoeleinden en het periodiek valideren van modelintegriteit.
De Cloud and AI Development Act en Europese rekencapaciteit
De Cloud and AI Development Act (CADA), gepubliceerd als COM(2026) 502 door de Europese Commissie, beoogt de beschikbaarheid van Europese AI-rekencapaciteit structureel te verbeteren. De verordening introduceert een verplichting voor lidstaten om toegang te garanderen tot gedeelde GPU-clusters via nationale AI-factories, en legt de basis voor een EU-breed AI-rekenreservoir dat ook overheidsorganisaties kunnen gebruiken voor soevereine inferentie zonder afhankelijkheid van Amerikaanse hyperscalers. CADA sluit aan op de Gaia-X Sovereign Deployment Stack, een technische referentiearchitectuur voor soevereine cloudinzet die interoperabiliteit, transparantie en Europese juridische controle waarborgt.
Voor compliance officers is relevant dat CADA ook eisen stelt aan de auditbaarheid van AI-rekenfaciliteiten die door publieke instellingen worden gebruikt. De wereldwijde markt voor AI-acceleratorchips wordt verwacht te groeien van 67 miljard dollar in 2023 naar ruim 345 miljard dollar in 2030 (Grand View Research, 2023), wat aangeeft dat investeringen in on-premise GPU-capaciteit economisch onderbouwd zijn en niet louter een compliance-maatregel vormen.
Technische maatregelen tegen ongewenste data-uitwisseling
Zelfs bij on-premise inferentie zijn technische maatregelen nodig om te garanderen dat geen data de organisatieperimeter verlaat. De volgende maatregelen zijn essentieel voor een aantoonbaar soevereine omgeving.
Netwerksegmentatie is de eerste verdedigingslinie: het inferentie-eindpunt (de GPU-server die het model draait) mag geen uitgaande internetverbinding hebben. Firewallregels moeten dit afdwingen en periodiek worden geauditeerd. Het inferentie-framework, of het nu Ollama of vLLM betreft, moet worden geconfigureerd zonder telemetrie-opties en zonder automatische modelupdates via externe repository’s. Modelgewichten worden eenmalig gedownload, cryptografisch gehasht en vervolgens beheerd via een intern artefactregister zoals Harbor of Nexus.
Op applicatieniveau mogen API-sleutels en sessiedata uitsluitend intern circuleren. Logging van inferentieaanvragen dient te worden opgeslagen in een intern SIEM-systeem, conform NIS-2-vereisten voor aantoonbaar logbeheer in kritieke sectoren. Ten slotte dient de gehele inferentiestack, het besturingssysteem, de containisatielaag en het model, te worden opgenomen in een Software Bill of Materials (SBOM) die toegankelijk is voor interne en externe auditors.
In 2023 meldde 39% van de wereldwijde organisaties een datalek in een publieke cloudomgeving (IBM Cost of a Data Breach Report, 2023). On-premise inferentie elimineert een specifieke aanvalsklasse, namelijk diefstal van inferentiedata via gedeelde cloudinfrastructuur, maar introduceert eigen fysieke en operationele beveiligingsvereisten die organisaties bewust moeten adresseren.
Veelgestelde vragen
Welke minimale GPU-capaciteit is nodig voor soevereine AI-inferentie met een 7-miljard-parameter model?
Voor een kwantitatief gecomprimeerd 7B-model in 4-bit formaat volstaat een GPU met 8 tot 12 GB VRAM, zoals een NVIDIA RTX 3090 of A2000. Voor grotere modellen van 13B of 70B parameters zijn respectievelijk twee of meerdere A100-klasse GPU’s met minstens 40 GB VRAM per kaart vereist.
Valt on-premise AI-inferentie automatisch buiten het bereik van de Amerikaanse CLOUD Act?
On-premise hardware die volledig eigendom is van een Europese entiteit en geen verbinding heeft met Amerikaanse cloudproviders valt in principe buiten de reikwijdte van de CLOUD Act. Juridische zekerheid vereist echter ook dat geen onderdelen van de leveranciersketen Amerikaanse diensten doorkruisen, inclusief licentiehouderschap van de gebruikte software.
Is Mistral AI een geschikte keuze voor geclassificeerde of gevoelige omgevingen?
Mistral AI biedt basismodellen onder Apache 2.0-licentie die lokaal kunnen worden uitgerold zonder telemetrie. Voor gerubriceerde omgevingen zijn aanvullende maatregelen vereist: een air-gapped netwerk, verifieerbare modelintegriteit via hashcontrole en een formele risicoanalyse conform de eisen van de betreffende nationale veiligheidsdienst of sectorale toezichthouder.
Wat regelt de EU AI Act specifiek over hoogrisico AI-toepassingen in de publieke sector?
De EU AI Act (Verordening EU 2024/1689) classificeert AI-systemen voor overheidsbesluiten, rechtspraak en kritieke infrastructuur als hoogrisico onder Bijlage III. Artikel 10 stelt strenge eisen aan datakwaliteit en databeheer: trainingsdata en inferentiedata moeten zijn gedocumenteerd, worden gecontroleerd op bias en onderhevig zijn aan menselijk toezicht.
Wat is het praktische verschil tussen Ollama en vLLM als on-premise inferentie-framework?
Ollama is gericht op gebruiksgemak en lokale omgevingen met beperkte hardware; het ondersteunt GGUF-kwantisatieformaten en is snel te installeren. vLLM is geoptimaliseerd voor serveromgevingen met hoge doorvoer via PagedAttention-geheugenoptimalisatie en is beter geschikt voor organisaties die meerdere gelijktijdige gebruikers op GPU-clusters moeten bedienen.
