Mistral of Llama op je eigen GPU's draaien klinkt als het schoonste residentie-antwoord, precies tot je het doorrekent. Het is een serving-stack, een GPU-budget dat factureert of er nu wel of geen request binnenkomt, een piketdienst, en een governance-laag die je nog steeds zelf moet schrijven. Akumi geeft je het EU-soevereine antwoord zonder de vloot, en residentie die je per request kunt aantonen in plaats van per datacenter.
Een open-weights model zelf hosten is het antwoord dat in een vergadering het schoonst klinkt. Mistral of Llama op eigen hardware, niets dat je perimeter verlaat, geen leverancier ertussen. Als engineeringstandpunt is het volstrekt samenhangend.
Wat het je feitelijk oplevert is een model, geen platform. Je hebt nog steeds ergens je documenten nodig en iets om ze op te halen zonder het ene team in de antwoorden van het andere te laten lekken. Je moet nog steeds persoonsgegevens maskeren, prompt injection opvangen en een vastlegging produceren die een toezichthouder accepteert. En onder dat alles ligt een GPU-rekening die binnenkomt of er die maand nu wel of geen request was, plus de persoon die de serving-stack bijwerkt zodra er een beter model landt. Akumi geeft je het EU-soevereine antwoord zonder de vloot, en de governance-laag al gebouwd.
Een beheerd EU-soeverein AI-platform achter één OpenAI-compatibel endpoint. EU-gevestigde modellen, een PII firewall, een guard, een governed knowledge graph voor retrieval en memory, een response cache en observability per request, allemaal per gebruik gemeterd. Niets om aan te maken, te patchen of te schalen, en residentie per request vastgelegd in een audit trail met alleen metadata.
Je draait open-weights modellen op hardware die je zelf beheert, meestal met een inference-server zoals vLLM ervoor. Jij kiest de modellen, de quantisatie en de serving-topologie, en jij bent eigenaar van de capaciteitsplanning, de upgrades, de uptime en alles boven de completion: retrieval, isolatie, redactie, caching en audit.
| Dimensie | Akumi | Zelf hosten |
|---|---|---|
| Bewijs van residentie | Standaard EU-gevestigd, en per request aantoonbaar: elke call legt vast welk model, welke provider en welke regio hem bediend hebben. | Absoluut van constructie, waarbij de audit trail en het bewijs voor je toezichthouder aan jou worden overgelaten. |
| Operationele last | Geen. Serving, schalen, upgrades en capaciteit zijn van ons. | Van jou: GPU-capaciteit, inference-servers, modelupgrades, en iemand die de pieper draagt. |
| Kostenvorm | Gebruiksgebaseerde credits. Draait er niets, dan kost het niets. | Vaste GPU-uitgaven of er nu wel of geen request binnenkomt, plus de engineers die het overeind houden. |
| Governance-laag | PII firewall, guard, egressbeleid, audit trail en retrieval al gebouwd en gemeterd. | Elk onderdeel is van jou om te bouwen, te testen en correct te houden terwijl modellen en regelgeving bewegen. |
| Governed retrieval | Memory van gesprekken en je documenten delen één knowledge graph, zodat een antwoord de link volgt van een gebruiker naar zijn organisatie naar het document dat hem antwoordt. Elke collection is een eigen graph-partitie, genamespaced naar jouw organisatie en workspace nog voordat de query wordt opgebouwd, en elke response draagt de bronnen die gebruikt zijn. | Open weights serveren geeft je een model, geen kennislaag. De store, de ingestie, de ranking en de isolatie tussen teams liggen allemaal nog voor je. |
| Modellen bijhouden | Een gecureerde selectie achter één endpoint. Nieuwe modellen komen getest en geprijsd binnen, en wisselen is een string. | Elke upgrade is een project: nieuwe weights, nieuwe serving-config, nieuwe benchmarks, en een terugrolplan. |
| Tijd tot productie | Minuten. Aanmelden, sleutel, één base_url. | Weken tot maanden, afhankelijk van inkoop, levertijden van hardware, en hoeveel van de stack al bestaat. |
Gebruiksgebaseerde prijzen en gereserveerde capaciteit gedragen zich heel verschillend, en het verschil is geen afrondingsfout. Een zelf gehoste uitrol die op je drukste uur is gedimensioneerd betaal je in elk rustig uur: 's nachts, in het weekend, en in de maanden waarin de feature live is maar de adoptie nog groeit. Dimensioneer je in plaats daarvan op het gemiddelde, dan is het drukke uur waar je gebruikers een wachtrij tegenkomen.
Akumi metert per token en per request, dus een rustige week kost niets en een lanceerweek schaalt zonder inkoopgesprek. Governance-modules meteren apart wanneer ze draaien, en een cache-hit haalt de inference-kosten er helemaal uit, dus de rekening volgt het werk in plaats van de capaciteit die je voor de zekerheid gereserveerd had.
| Dimensie | Akumi | Zelf hosten |
|---|---|---|
| Rustige periodes | Niets. Je betaalt voor requests, niet voor gereserveerde capaciteit. | Volle kosten, ongeacht de bezetting. |
| Een plotselinge piek | Opgevangen. Schalen is onze zorg. | Een wachtrij, of capaciteit die je vooraf kocht en het hele jaar betaalde. |
| Wat de rekening volgt | Verricht werk, uitgesplitst per request en per module. | Gereserveerde hardware, plus de mensen die het gezond houden. |
Een model tokens laten teruggeven op eigen hardware is een opgelost probleem, en een goede engineer heeft het binnen een week draaien. De overige twee derde is het deel dat het kwartaal kost: een documentstore en een ingestiepad, retrieval die goed genoeg rangschikt om bruikbaar te zijn, isolatie zodat de documenten van de ene klant nooit in het antwoord van een andere kunnen opduiken, maskering van persoonsgegevens vóór egress, injectiescanning over alles wat een tool teruggeeft, een cache, en een audit trail die specifiek genoeg is dat iemand kan antwoorden waar een gegeven request draaide.
Niets daarvan is exotisch, en alles ervan is dragend. Het is ook het deel dat aandacht blijft vragen, want de aanvallen veranderen, de modellen veranderen en de verplichtingen veranderen. Op Akumi is het er al, al gemeterd, en al beoordeeld als de tenant-grenscode die het is.
| Dimensie | Akumi | Zelf hosten |
|---|---|---|
| Tokens terugkrijgen | Inbegrepen. | Een week werk, en oprecht het leukste deel. |
| Retrieval en isolatie | Een governed knowledge graph, gepartitioneerd per workspace nog voordat de query wordt opgebouwd. | Een store, een ingestiepad, ranking, en de isolatielogica tussen tenants. |
| Redactie en injectie | PII firewall en guard op dezelfde request, standaard aan. | Zelf te schrijven, en zelf actueel te houden terwijl aanvallen evolueren. |
| Audit en bewijs | Vastlegging met alleen metadata van model, provider en regio, per request. | Zelf te ontwerpen, op te slaan, te bewaren en te verdedigen. |
Modelgeneraties wisselen snel, en op zelf gehoste infrastructuur is elke wissel een project in plaats van een configuratiewijziging: nieuwe weights om te evalueren, serving-parameters om opnieuw af te stemmen, doorvoer en geheugen om opnieuw te meten, kwaliteit om opnieuw te benchmarken tegen je eigen workload, en een terugrolplan voor als het slechter is op een manier die de benchmarks misten. Teams die hierop achterlopen draaien stilletjes een model dat een jaar ouder is dan dat van hun concurrent.
Achter een beheerd endpoint is die wisseling een string. Nieuwe modellen komen getest en geprijsd binnen, de router regelt fallback, en je evaluatie is een vergelijking die je draait in plaats van een upgrade die je inplant.
| Dimensie | Akumi | Zelf hosten |
|---|---|---|
| Een nieuwer model adopteren | Verander een string, draai je evals, houd het oude als fallback. | Weights, serving-config, opnieuw afstemmen, opnieuw benchmarken en een terugrolplan. |
| Achterop raken | Moeilijk, omdat wisselen bijna niets kost. | Gebruikelijk, omdat elke upgrade concurreert met productwerk. |
| Twee naast elkaar draaien | Stuur wat verkeer naar elk en vergelijk vanuit dezelfde tracegegevens. | Dubbele capaciteit, of een serving-topologie die beide kan huisvesten. |
Dat hangt vrijwel volledig af van de bezetting. Zelf gehoste capaciteit is een vaste kostenpost die binnenkomt of er nu wel of geen request is, dus het beloont groot, stabiel en voorspelbaar volume. Gebruiksgebaseerde prijzen belonen wisselende of groeiende workloads, waar je anders voor stilstaande GPU's betaalt. De vergelijking die mensen vergeten is de engineeringtijd: de serving-stack, retrieval, isolatie, redactie en audit moeten allemaal gebouwd en daarna onderhouden worden.
Ja. De applicatie, de data en de modellen zijn EU-gevestigd, en routing buiten de EU wordt geblokkeerd bij een guard die fail-closed gaat tenzij je het expliciet toestaat. Elke request legt vast welk model, welke provider en welke regio hem bediend hebben, dus residentie is per request aantoonbaar in plaats van eenmalig beweerd.
Ja. De EU-soevereine selectie is er juist op gebouwd, geserveerd achter hetzelfde OpenAI-compatibele endpoint als al het andere, dus je krijgt open modellen zonder de serving-stack te bedienen die ze draait.
De API is OpenAI-compatibel, dus in beide richtingen bewegen is een base_url-wijziging in plaats van een herschrijving. Op Akumi beginnen terwijl een zelfhostingproject nog een roadmap-item is, is een redelijke manier om een compliance-deadline te halen die eerder aankomt dan je hardware.
Nee, en Akumi ook niet. Retrieval draait op een governed knowledge graph in plaats van een vector store: memory van gesprekken en je documenten delen één substraat, zodat een antwoord de relaties ertussen kan volgen in plaats van te hopen dat één chunk de hele keten bevat.
Op Akumi zijn wij dat. Nieuwe modellen komen getest en geprijsd binnen achter hetzelfde endpoint, en wisselen is een string-wijziging met het vorige model beschikbaar als fallback. Zelf gehost is elke upgrade van jou om te evalueren, af te stemmen, te benchmarken en terug te rollen.
Basis-inference wordt gemeterd per token en per request, en elke governance-module metert op een eigen regel wanneer hij draait, zodat de PII firewall, retrieval, guard en cache allemaal apart zichtbaar zijn. Een cache-hit slaat de inference-kosten volledig over.
Staat zelf hosten op de roadmap maar komt de compliance-deadline eerder, begin dan nu op Akumi. De API is hoe dan ook OpenAI-compatibel, dus later verhuizen is een base_url.
We use privacy-friendly, EU-hosted analytics to understand how Akumi is used. Accept analytics cookies, or continue without them. See our cookie policy.