The EU AI Act arrives August 2. Can you prove where your AI data goes?
Cache

Betaal nooit twee keer voor hetzelfde antwoord.

Als een request die je eerder hebt afgehandeld opnieuw binnenkomt, speelt Cache het opgeslagen antwoord opnieuw af en slaat het model volledig over, zodat de herhaling vrijwel direct is en bijna niets kost. Exacte matching gaat automatisch, semantische matching vangt parafrases op, en een hit kortsluit de hele pipeline.

exact · semantisch · direct

Requests TTL 24h
Vat het retourbeleid samen. MISS · model
940 ms
Vat het retourbeleid samen. HIT · cache
6 ms
Vat het retourbeleid even samen. HIT · semantic
11 ms
Een hit slaat het model, de firewall en retrieval over.

Je verkeer herhaalt zich. Je betaalt elke keer de volle prijs.

Dezelfde vragen komen keer op keer binnen, vaak woord voor woord, en elke vraag draait de volledige pipeline en wordt afgerekend als een verse model-call. Je betaalt de volle latency en de volle kosten om antwoorden opnieuw te berekenen die je een paar minuten geleden al produceerde. Een doe-het-zelf cache moet dan beslissen wat veilig is om op te slaan en wanneer het verouderd raakt.

Match, en dan kortsluiten.

Zet het aan en cachen gaat automatisch. De cache sleutelt op de request zoals je het stuurde, voordat enige andere service draait.

  • Exact matchen Een sleutel wordt opgebouwd uit de request zoals verstuurd: het model, de berichten, de sampling-parameters en eventuele tools. Een identieke request krijgt het opgeslagen antwoord geserveerd.
  • Semantisch matchen Bij een exacte miss embedt het platform de prompt en zoekt het naar een bijna-duplicaat binnen een gelijkenisdrempel die jij instelt, zodat parafrases ook hitten. Verhoog de drempel voor strakkere matches.
  • Kortsluiten Een hit keert direct terug, voor retrieval, memory, de firewall of de model-run. Dat maakt een hit zowel goedkoop als snel.
cache.yaml api.akumi.cloud
exact on
→ always on
semantic on
→ threshold 0.92
deterministic-only on
→ temperature 0 or seed
ttl set
→ 24 hours

Snel en goedkoop, zonder de valkuilen.

Standaard deterministisch

Alleen reproduceerbare requests worden gecachet, die met temperature 0 of een vaste seed. Volatiele requests gaan ongemoeid door, tenzij je ervoor kiest om ze toch te cachen.

Geïsoleerd en begrensd

Je cache is afgebakend tot je organisatie, nooit gedeeld over tenants heen, en begrensd door een TTL die je instelt van 1 uur tot 30 dagen. Leeg hem wanneer je maar wilt.

Goedkoper en sneller

Een hit registreert een kleine cachekost en slaat de inferentiekost over. Die overgeslagen kost is je besparing, en het antwoord komt binnen milliseconden terug.

Een cache die weet wanneer niet.

Een botte cache geeft verouderde of verkeerde antwoorden terug en ondermijnt het vertrouwen. Deze is zorgvuldig over wat hij opslaat, hoelang hij het bewaart, en wat een hit overslaat.

Stop met het opnieuw berekenen van dezelfde antwoorden.

Maak een sleutel aan, zet Cache aan, en serveer je herhaalverkeer binnen milliseconden vanuit een opgeslagen antwoord.