Wat betekent self-hosted precies?
Self-hosted betekent dat het taalmodel draait op hardware waarover jij zeggenschap hebt: een server in je eigen serverruimte, of een dedicated machine bij een hoster onder Europees recht. De prompts verlaten die omgeving niet.
Dat is iets anders dan drie dingen waarmee het regelmatig wordt verward.
Een privé-instance bij een cloudleverancier is nog steeds die leverancier zijn infrastructuur. De isolatie is beter, de rechtsmacht verandert niet.
EU-hosting bij een Amerikaanse aanbieder verplaatst de servers, niet het juridische regime. De CLOUD Act blijft van toepassing op de moedermaatschappij.
Een open source model zegt niets over waar het draait. Je kunt een open model bij een Amerikaanse aanbieder afnemen en een gesloten model in een Europese omgeving gebruiken.
De relevante vraag is dus niet welk model, maar wie feitelijk toegang heeft tot de gegevens die erdoorheen gaan.
Wat kost het echt?
De kostenvergelijking wordt vrijwel altijd verkeerd gemaakt, doordat alleen naar de tokenprijs wordt gekeken.
| Cloud-API | Self-hosted | |
|---|---|---|
| Startkosten | Vrijwel nul | Hardware of dedicated server |
| Variabele kosten | Per token, schaalt met gebruik | Vrijwel nul na aanschaf |
| Beheer | Bij de leverancier | Bij jou of je partner |
| Modelupdates | Automatisch | Zelf inplannen en testen |
| Schaalpiek opvangen | Direct | Vereist capaciteit vooraf |
| Kwaliteit topmodellen | Direct beschikbaar | Achterstand op het beste model |
| Rechtsmacht | Afhankelijk van leverancier | Onder jouw jurisdictie |
Het omslagpunt ligt bij volume en bij gevoeligheid, en die twee lopen niet gelijk op. Bij laag volume en gevoelige data is self-hosted duur per verzoek maar toch de enige route. Bij hoog volume en ongevoelige data kan self-hosted juist goedkoper zijn, maar is de noodzaak er niet.
Reken bij self-hosted altijd het beheer mee. Een server die niemand onderhoudt is binnen een jaar een beveiligingsprobleem.
Wat lever je in op kwaliteit?
Eerlijk: er zit een gat tussen het beste open model dat je zelf kunt draaien en het beste cloudmodel. Dat gat is de afgelopen twee jaar aanzienlijk kleiner geworden, maar het is er.
Waar dat gat in de praktijk knelt, is bij taken die diep redeneren over lange, complexe context. Waar het nauwelijks knelt, is bij de taken die het merendeel van het werk vormen: samenvatten, classificeren, gestructureerde informatie uit documenten halen, en tekst genereren volgens een vast stramien.
Dat is een bruikbare vuistregel. Voor de tachtig procent routinetaken is een lokaal model in de regel ruim voldoende. Voor de twintig procent die om zwaar redeneren vraagt, wil je toegang tot een topmodel, en dan is de vraag welke gegevens daarheen mogen.
Test dit met je eigen data voordat je besluit. Benchmarks zeggen weinig over hoe een model presteert op jouw contracten in jouw vakjargon.
De tussenweg die meestal het antwoord is
Vrijwel geen enkele organisatie zit volledig aan één kant. De werkbare opzet routeert per gegeven in plaats van per organisatie.
Publieke en interne gegevens gaan naar een cloudmodel met EU-hosting en een verwerkersovereenkomst. Vertrouwelijke gegevens gaan gepseudonimiseerd naar de cloud, waarbij de detectie lokaal draait. Gegevens uit de zwaarste categorie, zoals BSN, gezondheidsgegevens en biometrie, worden uitsluitend lokaal verwerkt en verlaten de omgeving nooit.
Dat vraagt een routeringslaag die per verzoek bepaalt waar het heen gaat, en die dat besluit vastlegt. Zonder die laag valt de opzet terug op de discipline van individuele medewerkers, en dat houdt geen stand.
Pilex zet die architectuur op in drie zones: jouw omgeving met de gebruikers, systemen en data, een koppellaag met single sign-on en logging, en het platform zelf op Europese infrastructuur. De data blijft van jou, het platform koppelt en registreert.
Wat heb je nodig om lokaal te draaien?
Drie dingen, en de tweede wordt structureel onderschat.
Hardware. Een moderne GPU met voldoende geheugen om het model te laden. Welk model je wilt draaien bepaalt de eis, en het verschil tussen een klein en een groot model is een factor in aanschafkosten.
Beheer. Modellen worden vervangen, kwetsbaarheden verschijnen, en de omgeving moet gemonitord worden. Dit is geen eenmalige installatie. Wie dit niet belegt, heeft binnen een jaar een verouderd model op een ongepatchte server.
Een evaluatiemethode. Zonder meting weet je niet of het lokale model op jouw taken goed genoeg is, en kun je na een modelwissel niet vaststellen of het beter of slechter is geworden.
Voor het draaien van open modellen gebruiken wij Ollama, dat het laden en aanspreken van modellen op eigen hardware sterk vereenvoudigt. De infrastructuur draait op Europese hosting bij Hetzner, multi-tenant of volledig dedicated.
Wanneer moet je niet zelf hosten?
Vier situaties waarin het antwoord nee is, ook als het aantrekkelijk klinkt.
Je werkt vrijwel uitsluitend met publieke en interne gegevens. Dan betaal je voor een risico dat je niet loopt.
Je hebt geen IT-beheer of partner die het onderhoud draagt. Een onbeheerde AI-server is een groter beveiligingsrisico dan de cloud die je wilde vermijden.
Je gebruik is laag en onvoorspelbaar. Vaste kosten tegenover incidenteel gebruik levert een slechte rekensom.
Je hebt de zwaarste redeneercapaciteit nodig voor je kerntaak. Dan is de kwaliteitsafstand geen detail maar het verschil tussen werkend en niet werkend.
Bij MZA viel de afweging wel de andere kant op: het kantoor wilde gespreksverslagen automatiseren maar de data mocht het kantoor niet verlaten. Dan is lokaal niet de dure optie, maar de enige.
Hoe beslis je?
Vier vragen, in deze volgorde.
- Welk aandeel van je gegevens valt in de zwaarste klasse? Onder de vijf procent: cloud met pseudonimisering volstaat vrijwel zeker. Boven de twintig procent: lokaal wordt serieus.
- Eist een klant, sector of toezichthouder iets? Zorg, overheid en delen van finance kennen eisen die de afweging voor je maken.
- Heb je beheer beschikbaar? Zo nee, dan is de vraag niet of je zelf host, maar wie het voor je doet.
- Wat is je volume over twee jaar? Bij sterke groei verschuift de rekensom richting eigen infrastructuur.
Beantwoord deze vragen voordat je naar hardware of modellen kijkt. De techniek is het makkelijkste deel.
