The EU AI Act arrives August 2. Can you prove where your AI data goes?
Inference API

Richten Sie Ihren OpenAI-Client auf die EU.

Die Akumi Inference API ist OpenAI-kompatibel und wird auf EU-Infrastruktur betrieben. Ändern Sie eine base_url und Ihr bestehender Code läuft auf EU-ansässigen Modellen: Chat, Tools, Streaming und strukturierte Ausgaben, abgerechnet pro Nutzung und auditiert ab dem ersten Token.

POST https://api.akumi.cloud/v1/chat/completions

quickstart.py
from openai import OpenAI client = OpenAI( # die einzige Zeile, die sich ändert base_url="https://api.akumi.cloud/v1", api_key=os.environ["AKUMI_API_KEY"], ) client.chat.completions.create( model="mistral/mistral-small-2603", messages=[ {"role": "user", "content": "Summarize this contract."}, ], stream=True, )

Eine Zeile ändern. Den gesamten Stack behalten.

Kein neues SDK, kein Umschreiben, kein Migrationsprojekt. Behalten Sie den OpenAI-Client, mit dem Sie bereits arbeiten, richten Sie ihn auf Akumi aus und fügen Sie Ihren Key ein. Chat, Function Calling, Streaming und JSON-Modus verhalten sich exakt wie bisher, jetzt auf EU-ansässigen Modellen mit einer gemeinsamen Abrechnung.

.env
- OPENAI_BASE_URL=https://api.openai.com/v1
+ OPENAI_BASE_URL=https://api.akumi.cloud/v1

Ihr Stack läuft unverändert.

Endpunkte, Request-Bodies und Responses entsprechen der OpenAI API, sodass die Libraries, Frameworks und Tools, die Sie bereits nutzen, einfach funktionieren.

Chat Completions

POST /v1/chat/completions mit der vollständigen Nachrichten- und Parameteroberfläche, die Sie bereits senden.

Streaming

Token-für-Token Server-Sent Events, dieselbe Antwort wie bei stream=true.

Tools und Function Calling

Definieren Sie Tools, lassen Sie das Modell sie aufrufen und steuern Sie mit tool_choice. Tool-Inhalte werden ebenfalls geregelt.

Strukturierte Ausgaben

response_format mit einem JSON-Schema für zuverlässige, typisierte Antworten, auf die Ihr Code sich verlassen kann.

Embeddings

POST /v1/embeddings auf EU-gehosteten Modellen für Suche, Clustering und Retrieval.

Nativer /v1/process-Endpunkt

Ein nativer Endpunkt, wenn Sie die vollständige Akumi-Pipeline-Antwort mit Residenz- und Modulinformationen benötigen.

Standardmäßig souverän, bei jedem Aufruf geregelt.

EU-ansässige Inferenz

Anfragen werden auf EU-Infrastruktur bedient. Inferenz und Speicherung bleiben in der EU, ohne Exposition gegenüber dem US CLOUD Act.

Egress Guard

Routing zu einem Nicht-EU-Modell ist gesperrt, sofern Sie es nicht explizit erlauben, mit personenbezogenen Daten, die pseudonymisiert werden, bevor sie die EU verlassen.

Auditiert ab dem ersten Token

Jede Anfrage wird abgerechnet und in einem metadatenbasierten Audit-Trail mit Modell, Region und Modulen erfasst. Übergeben Sie dem Compliance-Team das Log.

Viele Modelle, ein Endpunkt.

Der Model Router stellt jedes Modell hinter derselben base_url bereit. Wählen Sie ein EU-souveränes Modell oder erlauben Sie ein externes unter einer Richtlinie. Legen Sie Routing-Regeln und automatisches Fallback fest und bringen Sie Ihre eigenen Provider-Keys mit.

  • Richtlinienbasiertes Routing Entscheiden Sie pro Datenklasse, welche Modelle erlaubt sind, mit besonders sensiblen Daten, die ausschließlich EU-Modellen vorbehalten bleiben.
  • Automatisches Fallback Ein Anbieterausfall wechselt zum nächsten erlaubten Modell, sodass eine Anfrage selten einfach fehlschlägt.
  • Eigene Provider-Keys mitbringen Verwenden Sie Ihre eigenen Anbieter-Zugangsdaten nach Wunsch, abgerechnet und auditiert an einer Stelle.
GET /v1/models api.akumi.cloud
mistral/mistral-small-2603 EU-ansässig
mistral/mistral-large-2512 EU-ansässig
mistral/mistral-large-2512 EU-ansässig
akumi/embed-eu EU-ansässig
openai/gpt-5.4 extern · geregelt
anthropic/claude-sonnet extern · geregelt

Zahlen Sie für tokens, nicht für Seats.

Basis-Inferenz wird pro Token und Anfrage abgerechnet. Jedes Governance-Modul, das Sie aktivieren, wird in einer eigenen Position abgerechnet, sodass die Rechnung genau das widerspiegelt, was die Plattform tatsächlich geleistet hat. Keine Seats, keine Mindestmengen, keine überraschenden Tarifstufen.

Pro Token und Anfrage

Basis-Inferenz wird auf Basis der tatsächlichen Nutzung abgerechnet und aus vorausbezahlten Credits entnommen.

Pro Modul

PII firewall, RAG, Memory, Guard und Cache werden bei Nutzung jeweils separat abgerechnet.

Eine transparente Rechnung

Ein einzelnes Credit-Ledger mit detaillierten Positionen, exportierbar für Finanzen und Compliance.

Starten Sie mit einer base_url.

Erstellen Sie einen Key, richten Sie Ihren Client auf Akumi aus und betreiben Sie heute EU-souveräne Modelle.