lokale AI

Lokale AI: wanneer hoort je model op eigen infrastructuur te draaien?

Geschreven door Ruben Lucas Groothuis ·

Europa zet in 2026 stevig in op digitale soevereiniteit en open modellen zijn goed genoeg geworden voor zakelijk werk. Dat maakt de vraag concreet: laat je bedrijfsdata het pand verlaten of niet?

Lokale AI betekent dat je een taalmodel draait op hardware die jij beheert, op eigen servers of bij een Europese aanbieder, zodat prompts en documenten je omgeving niet verlaten. Dat is sinds 2026 realistisch geworden: open modellen met vrije licenties presteren goed genoeg voor zakelijk werk, en een model als gpt-oss-20b draait al op een machine met 16 GB geheugen. De keuze hangt af van je datagevoeligheid en je volume: bij vertrouwelijke documenten, ketenafspraken of een voorspelbaar hoog gebruik wint lokaal, bij wisselende volumes en zwaar redeneerwerk wint de cloud meestal nog op kosten.

Bekijk cases

Van principiele vraag naar praktische afweging

Twee jaar geleden was lokale AI vooral een principekwestie voor organisaties die hun data niet naar Amerikaanse cloudleveranciers wilden sturen. In 2026 is het een rekensom geworden. De Europese Commissie presenteerde op 3 juni 2026 een pakket voor technologische soevereiniteit, er ligt een meetbaar raamwerk om de soevereiniteit van cloudleveranciers te beoordelen, en de open modellen die je zelf mag draaien zijn goed genoeg voor het merendeel van het werk dat bedrijven ermee doen. In dit artikel leggen we uit wat er precies veranderd is, welke modellen en licenties er zijn, wat je aan hardware nodig hebt en wanneer je juist beter in de cloud kunt blijven.

Waarom lokale AI bij Score Agency?

Data blijft binnen je grenzen

Prompts, documenten en antwoorden verlaten je eigen netwerk of je Europese omgeving niet, wat een hoop verwerkersvragen eenvoudiger maakt.

Voorspelbare kosten

Je betaalt voor hardware of een vaste server, niet per token. Bij hoog en stabiel gebruik is dat makkelijker te begroten.

Geen leveranciersafhankelijkheid

Open modellen met een Apache- of MIT-licentie mag je commercieel draaien en zelf bijtrainen, zonder dat een prijswijziging je businesscase omgooit.

Aantoonbaar voor auditors

Je kunt precies laten zien waar data staat en wie erbij kan, wat helpt bij ISO 27001-trajecten en ketenvragen.

Klaar voor Europese eisen

Het EU-raamwerk voor cloudsoevereiniteit maakt inkoopeisen concreet. Wie dat nu regelt is voorbereid op aanbestedingen en ketenafspraken.

Wat lokale AI precies is

Lokale AI is het draaien van een taalmodel op infrastructuur die jij beheert. Dat kan een server in je eigen serverruimte zijn, maar in de praktijk is het vaker een afgesloten omgeving bij een hostingpartij binnen de EU. Het onderscheid dat telt is niet de fysieke locatie maar de vraag wie bij de data kan en onder welk recht dat valt.

Drie varianten kom je tegen:

- Volledig lokaal: het model draait op je eigen hardware, er gaat geen enkele byte naar buiten
- Eigen omgeving bij een Europese aanbieder: je huurt rekenkracht, maar het model en de data staan in jouw omgeving en worden niet gedeeld
- Cloud-API met verwerkersafspraken: je gebruikt een model van een grote aanbieder met contractuele waarborgen over bewaren en trainen

Alle drie zijn verdedigbare keuzes. Het verschil zit in hoeveel je zelf moet regelen en hoeveel je op papier kunt aantonen. Wij bouwden met IntraGPT een lokale AI-omgeving waarin medewerkers met bedrijfsdocumenten kunnen werken zonder dat die documenten de organisatie verlaten.

Wat Europa in 2026 heeft besloten

Op 3 juni 2026 presenteerde de Europese Commissie het pakket voor technologische soevereiniteit. Dat bestaat uit vier onderdelen:

- Chips Act 2.0 voor halfgeleidercapaciteit
- De Cloud and AI Development Act, die datacenterbouw in Europa moet versnellen en een gezamenlijk beoordelingskader voor cloud- en AI-soevereiniteit vastlegt
- Een open source-strategie die overheden aanmoedigt open alternatieven te gebruiken
- Een routekaart voor digitalisering en AI in de energiesector

Het meest concrete doel: de datacentercapaciteit in de EU moet binnen vijf tot zeven jaar verdrievoudigen, met kortere vergunningsprocedures. De achterliggende gedachte is steeds dezelfde, in de woorden van Commissievoorzitter Von der Leyen: Europa kan zich niet permitteren afhankelijk te zijn van anderen voor de technologie die ziekenhuizen en energienetten draaiende houdt.

Voor bedrijven is dit geen verplichting, maar wel een richting. Wie levert aan overheden of aan organisaties die onder de Cyberbeveiligingswet vallen, krijgt dit soort vragen steeds vaker via de keten binnen.

De vier soevereiniteitsniveaus uit het EU-raamwerk

Het Cloud Sovereignty Framework maakt soevereiniteit voor het eerst meetbaar. Leveranciers worden beoordeeld op acht dimensies, waaronder juridische controle, operationele onafhankelijkheid, transparantie in de toeleveringsketen, technologische openheid, beveiliging en duurzaamheid. Daarbovenop staan vier oplopende zekerheidsniveaus:

- Niveau 1: verwerking vindt plaats op EU-infrastructuur
- Niveau 2: aantoonbare onafhankelijkheid van derde landen, met transparantie daarover
- Niveau 3: eigendom en zeggenschap liggen in de EU
- Niveau 4: volledige ketentransparantie zonder inmenging vanuit derde landen

Dat het geen papieren exercitie is, bleek in april 2026: de Commissie gunde op basis van dit raamwerk voor 180 miljoen euro aan soevereine clouddiensten over zes jaar aan vier Europese partijen, waaronder Scaleway, StackIT, Proximus en een consortium rond Post Telecom met OVHcloud en CleverCloud.

Praktisch nut voor jou: gebruik deze niveaus als vragenlijst bij je eigen leveranciers. Ze dwingen een concreet antwoord af op de vraag waar je data staat en wie er juridisch bij kan.

Welke open modellen bruikbaar zijn en onder welke licentie

De licentie bepaalt of je een model commercieel mag draaien en of je het mag bijtrainen. Dat is bij open modellen niet overal hetzelfde:

- gpt-oss-120b en gpt-oss-20b van OpenAI verschenen in augustus 2025 onder Apache 2.0, een van de ruimste licenties
- Qwen van Alibaba brengt sinds Qwen3 alle open modellen uit onder Apache 2.0
- DeepSeek publiceert de gewichten en inferentiecode onder de MIT-licentie, al zijn de trainingsdata niet vrijgegeven, waardoor het formeel geen open source AI volgens de OSI-definitie is
- Mistral brengt een deel van zijn modellen uit onder Apache 2.0
- Llama van Meta valt onder een eigen communitylicentie met een grens voor zeer grote platformen, dus lees die voorwaarden voordat je erop bouwt

Let op het verschil tussen open weights en open source. Bij open weights krijg je het model en mag je het draaien, maar niet altijd zien waarop het getraind is. Voor de meeste zakelijke toepassingen is dat geen probleem, voor een AI Act-dossier over herkomst kan het dat wel worden. Wat de AI Act van jou verwacht, staat in ons artikel over de verplichtingen vanaf 2 augustus 2026.

Wat je er praktisch voor nodig hebt

De drempel is lager dan veel mensen denken. gpt-oss-20b is ontworpen om te draaien op apparaten met 16 GB geheugen en laadt in zijn eigen MXFP4-precisie in ongeveer 14 GB. Het grotere gpt-oss-120b past met dezelfde quantisatie op een enkele GPU van 80 GB, het type kaart dat je per uur huurt of als investering koopt.

Vertaald naar een keuze:

- Een kleiner model op eigen hardware volstaat voor samenvatten, classificeren, doorzoeken van documenten en het ondersteunen van klantenservicemedewerkers
- Voor zwaar redeneerwerk, complexe codegeneratie of agentische taken zijn de grote gesloten modellen vaak nog merkbaar beter
- Een hybride opzet komt het meest voor: gevoelige documentstromen lokaal, algemene taken via een cloudmodel

Wat vaker onderschat wordt dan de hardware is het werk eromheen: documenten ontsluiten, rechten afdwingen per gebruiker, versiebeheer van prompts en monitoring. Dat is precies dezelfde discipline die we beschrijven bij intelligente documentverwerking.

Wanneer de cloud gewoon de betere keuze is

Lokale AI is geen doel op zich. In deze gevallen adviseren we gewoon een cloudmodel:

- Je gebruik is laag of onvoorspelbaar; dan betaal je bij eigen hardware vooral voor stilstand
- Je hebt de allerbeste redeneerkwaliteit nodig en je data is niet bijzonder gevoelig
- Je hebt geen team dat een model, de bijbehorende updates en de beveiliging kan beheren
- Je wilt eerst valideren of de toepassing uberhaupt waarde oplevert, want dat valideer je sneller met een API

Een verstandige route is beginnen in de cloud met duidelijke verwerkersafspraken, meten wat het gebruik werkelijk is en pas overstappen als het volume of de gevoeligheid van de data daarom vraagt. Wat een AI-toepassing kost in beide varianten hebben we uitgewerkt bij AI-agent kosten.

Hoe wij lokale AI bouwen

Onze aanpak bij lokale AI-projecten kent vier stappen:

- Inventariseren welke datastromen echt gevoelig zijn; vaak is dat een kleiner deel dan gedacht en hoeft niet alles lokaal
- Een model kiezen op basis van taak en licentie, niet op basis van benchmarkscores alleen
- De omgeving inrichten met toegangsrechten per gebruiker, logging van elke vraag en een duidelijke bewaartermijn
- Meten en bijstellen, want het gebruik in maand drie ziet er anders uit dan de pilot

Die logging is geen bijzaak. Zowel voor de AI Act als voor ISO 27001-trajecten moet je kunnen laten zien wat er is gevraagd, door wie en wat het systeem heeft geantwoord. Bouw je AI-agents die zelf acties uitvoeren, dan wordt dat nog belangrijker.

Wil je weten of lokale AI in jouw situatie de juiste keuze is, plan dan een gesprek. We lopen je datastromen langs, rekenen beide varianten door en zijn eerlijk als de cloud voor jou goedkoper en verstandiger is.

Bekijk onze projecten

Alle cases bekijken
Zorg

Project CoWork B.V.

Project CoWork - Website voor zorgstudenten en zorgorganisaties

Voor Project CoWork ontwikkelden we een website die precies aansluit bij wie zij zijn en hoe zij in de praktijk werken. Geen standaard marketingverhaal, maar een heldere en professionele presentatie van een organisatie die de zorg van binnenuit begrijpt. De nieuwe website brengt de kracht van Project CoWork terug tot de essentie: betrokken studenten, passende inzet, sterkere zorg. In de positionering en opbouw van de site stond één ding centraal: Project CoWork is geen standaard uitzend- of detacheringsbureau. Het is een praktijkgerichte partner voor zorgorganisaties in de VVT, die zorgvuldig kijkt naar matching, kwaliteit en duurzame samenwerking. Die inhoudelijke en menselijke benadering hebben we vertaald naar een rustige, moderne website met veel aandacht voor geloofwaardigheid, regionale betrokkenheid en noaberschap. De website spreekt twee doelgroepen tegelijk aan: zorgorganisaties die ondersteuning zoeken én studenten die betekenisvol willen bijdragen in de zorg. Daarnaast is de site meertalig opgezet, zodat Project CoWork ook toegankelijk en professioneel kan communiceren richting verschillende taalgebieden en doelgroepen. Door die boodschap scherp te structureren en visueel rustig neer te zetten, hebben we een platform ontwikkeld dat vertrouwen uitstraalt en direct duidelijk maakt waar Project CoWork voor staat.

3 talen Meertaligheid
2 Doelgroepen
Webdesign UX Design Contentstrategie Responsive Design

Al 15+ jaar partner in digitale transformatie

Score Agency is een full-service digitaal bureau dat al meer dan 15 jaar bedrijven helpt met hun digitale transformatie. Vanuit onze expertise in softwareontwikkeling, webdesign en AI-oplossingen bouwen wij oplossingen die écht impact maken.

Wij geloven in transparantie, kwaliteit en lange termijn partnerships. Geen verborgen kosten, geen onrealistische beloftes - maar eerlijk advies en oplossingen die werken.

150+
Projecten opgeleverd
15+
Jaar ervaring

Resultaatgericht

Wij meten succes aan de hand van je resultaten

Alles over lokale ai

Lokale AI is een taalmodel dat draait op infrastructuur die jij beheert, op eigen servers of in een afgesloten omgeving bij een Europese aanbieder. Prompts, documenten en antwoorden blijven daardoor binnen je eigen omgeving in plaats van naar een externe API te gaan.
Voor samenvatten, classificeren, doorzoeken van documenten en het ondersteunen van medewerkers zijn open modellen in 2026 ruim voldoende. Voor zwaar redeneerwerk en complexe codegeneratie presteren de grote gesloten modellen nog merkbaar beter. Een hybride opzet is daarom gebruikelijk.
Een kleiner model als gpt-oss-20b is ontworpen voor apparaten met 16 GB geheugen. Het grotere gpt-oss-120b past met MXFP4-quantisatie op een enkele GPU van 80 GB. Voor veel zakelijke toepassingen volstaat het kleinere model.
Dat hangt van de licentie af. Modellen onder Apache 2.0 of MIT, zoals gpt-oss, Qwen vanaf Qwen3 en DeepSeek, mag je commercieel draaien. Llama van Meta kent een eigen communitylicentie met voorwaarden voor zeer grote platformen, dus die moet je vooraf lezen.
Dat is het Europese raamwerk waarmee de soevereiniteit van cloudleveranciers meetbaar wordt gemaakt, op acht dimensies en met vier oplopende zekerheidsniveaus. De Europese Commissie gebruikte het in april 2026 bij een aanbesteding van 180 miljoen euro aan soevereine clouddiensten.
Bij laag of wisselend gebruik meestal wel, want je betaalt voor capaciteit die stilstaat. Bij hoog en stabiel gebruik draait dat om, omdat je niet per token betaalt. Reken beide varianten door op basis van je verwachte volume voordat je kiest.

Klaar om te starten met lokale AI?

Neem vandaag nog contact op en ontdek hoe wij je kunnen helpen met lokale AI. Geen verplichtingen, wel eerlijk advies.

053-870 0020