Als een request die je eerder hebt afgehandeld opnieuw binnenkomt, speelt Cache het opgeslagen antwoord opnieuw af en slaat het model volledig over, zodat de herhaling vrijwel direct is en bijna niets kost. Exacte matching gaat automatisch, semantische matching vangt parafrases op, en een hit kortsluit de hele pipeline.
exact · semantisch · direct
Dezelfde vragen komen keer op keer binnen, vaak woord voor woord, en elke vraag draait de volledige pipeline en wordt afgerekend als een verse model-call. Je betaalt de volle latency en de volle kosten om antwoorden opnieuw te berekenen die je een paar minuten geleden al produceerde. Een doe-het-zelf cache moet dan beslissen wat veilig is om op te slaan en wanneer het verouderd raakt.
Zet het aan en cachen gaat automatisch. De cache sleutelt op de request zoals je het stuurde, voordat enige andere service draait.
Alleen reproduceerbare requests worden gecachet, die met temperature 0 of een vaste seed. Volatiele requests gaan ongemoeid door, tenzij je ervoor kiest om ze toch te cachen.
Je cache is afgebakend tot je organisatie, nooit gedeeld over tenants heen, en begrensd door een TTL die je instelt van 1 uur tot 30 dagen. Leeg hem wanneer je maar wilt.
Een hit registreert een kleine cachekost en slaat de inferentiekost over. Die overgeslagen kost is je besparing, en het antwoord komt binnen milliseconden terug.
Een botte cache geeft verouderde of verkeerde antwoorden terug en ondermijnt het vertrouwen. Deze is zorgvuldig over wat hij opslaat, hoelang hij het bewaart, en wat een hit overslaat.
Maak een sleutel aan, zet Cache aan, en serveer je herhaalverkeer binnen milliseconden vanuit een opgeslagen antwoord.
We use privacy-friendly, EU-hosted analytics to understand how Akumi is used. Accept analytics cookies, or continue without them. See our cookie policy.