The EU AI Act arrives August 2. Can you prove where your AI data goes?
Cache

Zahlen Sie nie zweimal für dieselbe Antwort.

Wenn eine Anfrage, die Sie zuvor bereits bedient haben, erneut eingeht, spielt Cache die gespeicherte Antwort ab und überspringt das Modell vollständig, sodass die Wiederholung nahezu sofort erfolgt und fast nichts kostet. Exaktes Matching erfolgt automatisch, semantisches Matching erkennt Umformulierungen, und ein Treffer schließt die gesamte Pipeline kurz.

exakt · semantisch · sofort

Anfragen TTL 24h
Fassen Sie die Rückgaberichtlinie zusammen. MISS · model
940 ms
Fassen Sie die Rückgaberichtlinie zusammen. HIT · cache
6 ms
Fasse die Rückgaberichtlinie zusammen. HIT · semantic
11 ms
Ein Treffer überspringt das Modell, die Firewall und den Abruf.

Ihr Traffic wiederholt sich. Sie zahlen jedes Mal den vollen Preis.

Dieselben Fragen treffen immer wieder ein, oft Wort für Wort, und jede einzelne durchläuft die gesamte Pipeline und wird für einen frischen Modellaufruf berechnet. Sie zahlen volle Latenz und volle Kosten, um Antworten neu zu berechnen, die Sie schon vor Minuten erzeugt haben. Ein selbst gebauter Cache muss dann entscheiden, was sicher zu speichern ist und wann es veraltet.

Matchen, dann kurzschließen.

Schalten Sie ihn ein, und das Caching erfolgt automatisch. Der Cache bildet seinen Schlüssel aus der Anfrage, so wie Sie sie gesendet haben, bevor irgendein anderer Dienst läuft.

  • Exakt matchen Ein Schlüssel wird aus der Anfrage gebildet, so wie sie gesendet wurde: das Modell, die Nachrichten, die Sampling-Parameter und etwaige Tools. Eine identische Anfrage erhält die gespeicherte Antwort.
  • Semantisch matchen Bei einem exakten Verfehlen bettet die Plattform den Prompt ein und sucht innerhalb eines von Ihnen festgelegten Ähnlichkeitsschwellenwerts nach einem Beinahe-Duplikat, sodass auch Umformulierungen treffen. Erhöhen Sie den Schwellenwert für engere Übereinstimmungen.
  • Kurzschließen Ein Treffer kehrt sofort zurück, vor dem Abruf, dem Memory, der Firewall oder dem Modelllauf. Das macht einen Treffer sowohl günstig als auch schnell.
cache.yaml api.akumi.cloud
exact on
→ always on
semantic on
→ threshold 0.92
deterministic-only on
→ temperature 0 or seed
ttl set
→ 24 hours

Schnell und günstig, ohne die Fallstricke.

Standardmäßig deterministisch

Nur reproduzierbare Anfragen werden gecacht, jene mit Temperature 0 oder einem festen Seed. Volatile Anfragen werden unangetastet durchgereicht, es sei denn, Sie aktivieren deren Caching ausdrücklich.

Isoliert und begrenzt

Ihr Cache ist auf Ihre Organisation beschränkt, wird nie zwischen Mandanten geteilt und durch eine von Ihnen festgelegte TTL von 1 Stunde bis 30 Tagen begrenzt. Leeren Sie ihn, wann immer Sie möchten.

Günstiger und schneller

Ein Treffer verbucht eine kleine Cache-Gebühr und überspringt die Inferenz-Gebühr. Diese übersprungene Gebühr ist Ihre Ersparnis, und die Antwort kommt in Millisekunden zurück.

Ein Cache, der weiß, wann nicht.

Ein grober Cache gibt veraltete oder falsche Antworten zurück und untergräbt das Vertrauen. Dieser ist sorgfältig darin, was er speichert, wie lange er es behält und was ein Treffer überspringt.

Hören Sie auf, dieselben Antworten neu zu berechnen.

Erstellen Sie einen Key, schalten Sie Cache ein und bedienen Sie Ihren wiederholten Traffic in Millisekunden aus einer gespeicherten Antwort.