Wenn eine Anfrage, die Sie zuvor bereits bedient haben, erneut eingeht, spielt Cache die gespeicherte Antwort ab und überspringt das Modell vollständig, sodass die Wiederholung nahezu sofort erfolgt und fast nichts kostet. Exaktes Matching erfolgt automatisch, semantisches Matching erkennt Umformulierungen, und ein Treffer schließt die gesamte Pipeline kurz.
exakt · semantisch · sofort
Dieselben Fragen treffen immer wieder ein, oft Wort für Wort, und jede einzelne durchläuft die gesamte Pipeline und wird für einen frischen Modellaufruf berechnet. Sie zahlen volle Latenz und volle Kosten, um Antworten neu zu berechnen, die Sie schon vor Minuten erzeugt haben. Ein selbst gebauter Cache muss dann entscheiden, was sicher zu speichern ist und wann es veraltet.
Schalten Sie ihn ein, und das Caching erfolgt automatisch. Der Cache bildet seinen Schlüssel aus der Anfrage, so wie Sie sie gesendet haben, bevor irgendein anderer Dienst läuft.
Nur reproduzierbare Anfragen werden gecacht, jene mit Temperature 0 oder einem festen Seed. Volatile Anfragen werden unangetastet durchgereicht, es sei denn, Sie aktivieren deren Caching ausdrücklich.
Ihr Cache ist auf Ihre Organisation beschränkt, wird nie zwischen Mandanten geteilt und durch eine von Ihnen festgelegte TTL von 1 Stunde bis 30 Tagen begrenzt. Leeren Sie ihn, wann immer Sie möchten.
Ein Treffer verbucht eine kleine Cache-Gebühr und überspringt die Inferenz-Gebühr. Diese übersprungene Gebühr ist Ihre Ersparnis, und die Antwort kommt in Millisekunden zurück.
Ein grober Cache gibt veraltete oder falsche Antworten zurück und untergräbt das Vertrauen. Dieser ist sorgfältig darin, was er speichert, wie lange er es behält und was ein Treffer überspringt.
Erstellen Sie einen Key, schalten Sie Cache ein und bedienen Sie Ihren wiederholten Traffic in Millisekunden aus einer gespeicherten Antwort.
We use privacy-friendly, EU-hosted analytics to understand how Akumi is used. Accept analytics cookies, or continue without them. See our cookie policy.