Lokaal gehoste AI zonder trainingsdata verwijst naar een architectuur waarbij een taalmodel (LLM) volledig draait op de eigen servers van een organisatie, zonder dat prompts, documenten of antwoorden worden teruggestuurd naar een externe cloudprovider of worden gebruikt om het model verder te trainen. Voor organisaties in gereguleerde sectoren zoals de overheid, de juridische praktijk en de financiële sector is dit onderscheid niet theoretisch maar juridisch en operationeel bepalend.
Waarom cloudgebaseerde AI een fundamenteel ander risicoprofiel heeft
Cloudgebaseerde AI-diensten en lokaal gehoste LLMs lijken functioneel vergelijkbaar, maar het verschil in gegevensstroom is wezenlijk. Bij cloudgebaseerde diensten verlaat elke prompt het netwerk van de organisatie.
Wanneer een medewerker Microsoft Copilot gebruikt, worden prompts en bijgevoegde documenten verwerkt op servers van Microsoft. Microsoft heeft weliswaar contractuele afspraken over datagebruik, maar de data passeert infrastructuur die valt onder de Amerikaanse CLOUD Act van 2018. Die wet verplicht Amerikaanse bedrijven om op rechterlijk bevel gegevens te verstrekken aan Amerikaanse autoriteiten, ook als die gegevens zijn opgeslagen in Europa. Bovendien hanteren commerciële AI-aanbieders servicevoorwaarden die periodiek wijzigen en die organisaties verplichten om zorgvuldig te monitoren.
Een lokaal gehost LLM heeft geen uitgaande verbinding naar de modelaanbieder. Inferentie, het omzetten van een prompt in een antwoord, vindt volledig plaats op eigen hardware. Er is structureel geen kanaal waarlangs klantdata de organisatie verlaat voor trainingsdoeleinden.
| Kenmerk | Microsoft Copilot (cloud) | Lokaal gehost LLM |
|---|---|---|
| Datalocatie tijdens inferentie | Microsoft-datacenter (VS of EU) | Eigen server, eigen datacenter |
| Risico CLOUD Act / Patriot Act | Aanwezig | Afwezig |
| Modeltraining op klantdata | Afhankelijk van contractversie | Structureel uitgesloten |
| GDPR-verwerkersovereenkomst vereist | Ja, met Microsoft | Intern beheer, geen derde partij |
| Aanpasbaarheid aan sectorspecifieke eisen | Beperkt | Volledig, inclusief fine-tuning |
Uit een Eurobarometer-enquête over kunstmatige intelligentie uit 2023 bleek dat 62% van de Europese bedrijven dataprivacy als primaire overweging aanmerkt bij de selectie van AI-tools (bron: Eurobarometer Special Survey on Artificial Intelligence, 2023). Toch kiezen veel organisaties nog steeds voor cloudgebaseerde oplossingen, veelal omdat de architectuuralternatieven onvoldoende bekend zijn.
Architectuurkeuzes die trainingsvrij gebruik garanderen
De garantie dat klantdata nooit voor modeltraining wordt gebruikt, is geen belofte van een leverancier maar het resultaat van concrete technische en organisatorische keuzes.
Netwerkisolatie als fundament
De inferentieserver mag geen uitgaande verbindingen hebben naar het publieke internet. Dit betekent dat modelupdates handmatig worden uitgevoerd via een gecontroleerd intern proces, niet via automatische updates. Firewallregels leggen vast dat de server uitsluitend bereikbaar is vanuit het interne netwerk van de organisatie. Logbestanden van de inferentieserver worden lokaal bewaard en vallen binnen het eigen auditspoor.
Stateless inferentie
Een correct geconfigureerde lokale LLM is stateless: het model slaat geen conversatiehistorie op tussen sessies, tenzij de organisatie dit expliciet configureert in een eigen database die zij zelf beheert. Dit is een architectureel verschil met cloudgebaseerde assistenten, die sessiedata kunnen aggregeren voor gebruiksanalyse of fine-tuning.
Geen RLHF-feedback loop
Commerciële modellen worden voortdurend verbeterd via Reinforcement Learning from Human Feedback (RLHF), waarbij gebruikersinteracties het model bijsturen. Bij een lokaal gehost model zonder verbinding naar de modelontwikkelaar bestaat deze feedback loop niet. Het model blijft op de versie die de organisatie heeft geïnstalleerd, totdat zij zelf besluit te updaten.
Geschikte open-source taalmodellen voor gevoelige zakelijke toepassingen
Niet elk open-source model is even geschikt voor organisatiebreed gebruik in gereguleerde sectoren. Relevante criteria zijn licentievoorwaarden, meertalige prestaties, geheugenvoetafdruk en ondersteuning voor instructie-tuning.
Llama 3 (Meta) is beschikbaar in 8B- en 70B-parameterversies. De 70B-variant presteert sterk op complexe redeneer- en samenvattingstaken en ondersteunt meerdere Europese talen. De licentie van Meta staat zakelijk gebruik toe, maar verbiedt inzet als dienst voor meer dan 700 miljoen maandelijkse gebruikers, een drempel die voor de meeste organisaties irrelevant is.
Mistral AI, een Frans bedrijf, biedt Mistral 7B en Mixtral 8x7B aan onder de Apache 2.0-licentie, die onbeperkt zakelijk gebruik toestaat. Mistral-modellen zijn relatief efficiënt qua geheugengebruik en presteren goed op meertalige instructietaken, wat ze aantrekkelijk maakt voor Nederlandse en Franstalige organisaties.
GPT4All van Nomic AI biedt een runtime en een selectie van modellen die zijn geoptimaliseerd voor CPU-gebruik zonder GPU. Dit maakt het toegankelijk voor kleinere organisaties zonder gespecialiseerde grafische hardware, hoewel de prestaties lager liggen dan bij GPU-gebaseerde alternatieven.
Het IBM Institute for Business Value rapporteerde in 2023 dat 57% van de organisaties wereldwijd AI-adoptie belemmerd ziet door privacyzorgen (bron: IBM Institute for Business Value, ‘AI in Action’, 2023). Open-source lokale modellen adresseren dit direct door de databeschikkingsvraag technisch op te lossen.
Ollama als runtime: van model naar organisatiebrede dienst
Ollama is een open-source runtime die het uitrollen en beheren van lokale LLMs sterk vereenvoudigt. Het biedt een REST API waarmee andere applicaties modellen kunnen aanroepen alsof ze een externe API gebruiken, maar dan volledig intern.
Met Ollama kan een beheerder modellen als Llama 3 of Mistral installeren via een eenvoudig commando, waarna de modellen beschikbaar zijn voor meerdere gebruikers via het interne netwerk. De runtime beheert modelversies, GPU-allocatie en parallelle verzoeken. Voor organisaties die migreren van Microsoft 365 naar een soevereine werkplek is Ollama de meest gangbare bruglaag tussen het LLM en applicaties als Nextcloud.
Integratie met een soevereine Nextcloud-omgeving
Nextcloud Assistant is de ingebouwde AI-functionaliteit van Nextcloud en ondersteunt native integratie met lokale LLMs via OpenAI-compatibele API’s. Omdat Ollama een OpenAI-compatibele API nabootst, kan Nextcloud Assistant worden geconfigureerd om verzoeken te sturen naar de lokale Ollama-instantie in plaats van naar OpenAI of een andere cloudprovider.
De configuratie vereist dat de beheerder in de Nextcloud-instellingen het API-eindpunt wijzigt naar het interne adres van de Ollama-server, en een modelkeuze maakt. Vanaf dat moment worden alle samenvattingen, tekstgeneraties en chatfuncties binnen Nextcloud verwerkt op de eigen LLM-server. Er verlaat geen enkele prompt het interne netwerk.
Nextcloud GmbH stelt in haar officiële documentatie dat open-source AI-modellen die lokaal draaien organisaties volledige controle geven over hun gegevensstromen en het risico op onbedoelde blootstelling aan externe cloudproviders elimineren (bron: Nextcloud documentatie, 2024, nextcloud.com).
Hardware-vereisten voor organisatieniveau LLM-gebruik
De hardwarekeuze bepaalt sterk welke modellen inzetbaar zijn en bij hoeveel gelijktijdige gebruikers de prestaties acceptabel blijven.
Voor een 7B-parametermodel als Mistral 7B is minimaal 16 GB GPU-geheugen vereist voor vloeiende inferentie. Een Nvidia RTX 4090 (24 GB VRAM) of een professionele Nvidia A100 (40 of 80 GB) is geschikt voor organisaties tot circa 50 gelijktijdige gebruikers. Voor een 70B-model als Llama 3 70B zijn meerdere GPU’s nodig: twee A100’s van 80 GB zijn een gangbare minimumconfiguratie voor organisatiebreed gebruik.
Organisaties zonder GPU-budget kunnen terugvallen op kwantitatieve modelcompressie (4-bit of 8-bit quantisatie), waardoor grotere modellen draaien op kleinere GPU’s of zelfs op krachtige CPU-servers, zij het met lagere doorvoersnelheid. GPT4All maakt gebruik van deze aanpak voor CPU-only omgevingen.
GDPR-documentatie voor geautomatiseerde verwerking met lokale AI
De Algemene Verordening Gegevensbescherming (AVG) stelt specifieke eisen aan geautomatiseerde verwerking. GDPR Art. 22 bepaalt dat betrokkenen het recht hebben niet te worden onderworpen aan uitsluitend geautomatiseerde besluiten die rechtsgevolgen hebben of hen in aanmerkelijke mate treffen. Voor AI-assistenten die tekst samenvatten of concepten genereren is Art. 22 doorgaans niet van toepassing zolang een mens de uitvoer beoordeelt en het uiteindelijke besluit neemt. Maar de documentatieplicht geldt ongeacht dit onderscheid.
Andrea Jelinek, voorzitter van de European Data Protection Board (EDPB), stelde dat het gebruik van persoonsgegevens voor AI-modeltraining zonder expliciete toestemming een van de meest urgente compliance-uitdagingen is waarmee organisaties vandaag worden geconfronteerd (bron: EDPB verklaring over generatieve AI, edpb.europa.eu).
Vereiste documentatie omvat minimaal: een verwerkingenregister (art. 30 AVG) met vermelding van de AI-toepassing, de categorieën verwerkte gegevens, de bewaartermijn van prompts en antwoorden, en een beschrijving van de technische beveiliging. Bij hogere risicoverwerkingen, zoals het verwerken van bijzondere persoonsgegevens, is een gegevensbeschermingseffectbeoordeling (DPIA) vereist op grond van art. 35 AVG. De maximale boete voor onrechtmatige geautomatiseerde verwerking bedraagt 20 miljoen euro of 4% van de wereldwijde jaaromzet, aldus art. 83 AVG (bron: EUR-Lex, Verordening (EU) 2016/679).
Praktisch betekent dit dat logbestanden van de AI-assistent bewaard moeten worden op een manier die audits mogelijk maakt, maar dat prompts met persoonsgegevens niet langer worden bewaard dan noodzakelijk. Stel een retentiebeleid in voor AI-sessielogs, afgestemd op het algemene bewaarbeleid van de organisatie.
FAQ
Kan een lokaal gehost LLM ooit data terugsturen naar de ontwikkelaar van het model?
Een correct geconfigureerd lokaal gehost LLM stuurt geen data terug naar de modelontwikkelaar. Het model draait volledig op eigen servers, er is geen netwerkverbinding naar externe API’s, en alle inferentie vindt lokaal plaats. De verantwoordelijkheid voor de netwerkconfiguratie ligt bij de eigen IT-afdeling.
Valt het gebruik van een lokale AI-assistent voor tekstsamenvatting onder GDPR Art. 22?
GDPR Art. 22 is van toepassing als er sprake is van uitsluitend geautomatiseerde verwerking die rechtsgevolgen heeft of de betrokkene in aanmerkelijke mate treft. Louter tekstsamenvatting met menselijke beoordeling achteraf valt hier doorgaans niet onder, maar documenteer altijd de menselijke tussenkomst in je verwerkingsregister.
Wat is het verschil tussen Ollama en GPT4All voor zakelijk gebruik?
Ollama is primair een server-georiënteerde runtime die via een REST API modellen aanbiedt aan meerdere gebruikers of applicaties tegelijk, ideaal voor integraties zoals Nextcloud Assistant. GPT4All is meer gericht op individuele desktopgebruikers en biedt een grafische interface, maar heeft beperktere mogelijkheden voor multi-user enterprise-integraties.
Welk LLM is het meest geschikt voor juridische documenten in het Nederlands?
Mistral-modellen, met name Mistral 7B en Mixtral 8x7B, presteren relatief sterk op meertalige taken inclusief Nederlands. Llama 3 van Meta toont eveneens goede resultaten op Europese talen. Voor hoogst gevoelige juridische toepassingen is fine-tuning op domeinspecifieke Nederlandse datasets aan te bevelen, wat alleen mogelijk is als je het model lokaal beheert.
Hoe verhoudt de hardware-investering voor een lokale LLM zich tot de kosten van cloudgebaseerde AI?
Een server met twee Nvidia A100 GPU’s kost eenmalig circa 30.000 tot 60.000 euro, afhankelijk van configuratie. Cloudgebaseerde AI-diensten zoals Microsoft Copilot kosten per gebruiker per maand, wat bij grotere organisaties op jaarbasis vergelijkbare of hogere bedragen oplevert, exclusief de privacyrisico’s en afhankelijkheidskosten.
