Mistral oder Llama auf eigenen GPUs zu betreiben klingt nach der saubersten Antwort zur Ansässigkeit, genau bis Sie es durchrechnen. Es ist ein Serving-Stack, ein GPU-Budget, das abrechnet, ob eine Anfrage kommt oder nicht, eine Rufbereitschaft und eine Governance-Schicht, die Sie weiterhin selbst schreiben müssen. Akumi gibt Ihnen die EU-souveräne Antwort ohne die Flotte, und eine Ansässigkeit, die Sie pro Anfrage nachweisen statt pro Rechenzentrum.
Ein Open-Weights-Modell selbst zu hosten ist die Antwort, die in einer Besprechung am saubersten klingt. Mistral oder Llama auf eigener Hardware, nichts verlässt Ihren Perimeter, kein Anbieter dazwischen. Als technische Position ist das vollkommen schlüssig.
Was es Ihnen tatsächlich einbringt, ist ein Modell, keine Plattform. Sie brauchen weiterhin einen Ort für Ihre Dokumente und etwas, das sie abruft, ohne ein Team in die Antworten eines anderen zu lassen. Sie müssen weiterhin personenbezogene Daten maskieren, Prompt Injection abfangen und eine Aufzeichnung erzeugen, die eine Aufsichtsbehörde akzeptiert. Und darunter liegt eine GPU-Rechnung, die eintrifft, ob in dem Monat jemand eine Anfrage gesendet hat oder nicht, dazu die Person, die den Serving-Stack aktualisiert, sobald ein besseres Modell erscheint. Akumi gibt Ihnen die EU-souveräne Antwort ohne die Flotte, und die Governance-Schicht bereits fertig.
Eine verwaltete EU-souveräne KI-Plattform hinter einem OpenAI-kompatiblen Endpoint. EU-ansässige Modelle, eine PII-Firewall, ein Guard, ein geregelter Wissensgraph für Retrieval und Gedächtnis, ein Response-Cache und Observability pro Anfrage, alles nach Nutzung gemessen. Nichts bereitzustellen, zu patchen oder zu skalieren, und Ansässigkeit pro Anfrage in einem Audit-Trail aus reinen Metadaten protokolliert.
Sie betreiben Open-Weights-Modelle auf Hardware, die Sie kontrollieren, meist mit einem Inferenzserver wie vLLM davor. Sie wählen die Modelle, die Quantisierung und die Serving-Topologie, und Ihnen gehören Kapazitätsplanung, Upgrades, Verfügbarkeit und alles oberhalb der Completion: Retrieval, Isolation, Schwärzung, Caching und Audit.
| Dimension | Akumi | Self-Hosting |
|---|---|---|
| Ansässigkeitsnachweis | Standardmäßig EU-ansässig und pro Anfrage nachweisbar: Jeder Aufruf protokolliert Modell, Anbieter und Region, die ihn bedient haben. | Absolut von Bauart, wobei der Audit-Trail und der Nachweis für Ihre Aufsichtsbehörde Ihnen überlassen bleiben. |
| Betriebsaufwand | Keiner. Bereitstellung, Skalierung, Upgrades und Kapazität gehören uns. | Ihrer: GPU-Kapazität, Inferenzserver, Modell-Upgrades und jemand mit dem Pager. |
| Kostenform | Nutzungsbasierte Credits. Läuft nichts, kostet nichts. | Feste GPU-Ausgaben, ob jemand eine Anfrage sendet oder nicht, plus die Entwickler, die es am Laufen halten. |
| Governance-Schicht | PII-Firewall, Guard, Egress-Richtlinie, Audit-Trail und Retrieval bereits gebaut und gemessen. | Jedes Teil ist Ihres zum Bauen, Testen und Korrekthalten, während Modelle und Vorschriften sich bewegen. |
| Geregeltes Retrieval | Gesprächsgedächtnis und Ihre Dokumente teilen sich einen Wissensgraphen, sodass eine Antwort der Verbindung von einem Nutzer zu seiner Organisation bis zu dem Dokument folgt, das ihn beantwortet. Jede Collection ist eine eigene Graph-Partition, mit Ihrer Organisation und Ihrem Workspace als Namensraum, noch bevor die Abfrage gebaut wird, und jede Antwort führt die verwendeten Quellen mit. | Offene Gewichte bereitzustellen gibt Ihnen ein Modell, keine Wissensschicht. Der Speicher, die Aufnahme, das Ranking und die Trennung zwischen Teams liegen alle noch vor Ihnen. |
| Mit Modellen Schritt halten | Eine kuratierte Auswahl hinter einem Endpoint. Neue Modelle kommen getestet und bepreist an, und der Wechsel ist ein String. | Jedes Upgrade ist ein Projekt: neue Gewichte, neue Serving-Konfiguration, neue Benchmarks und ein Rollback-Plan. |
| Zeit bis zur Produktion | Minuten. Anmeldung, Schlüssel, eine base_url. | Wochen bis Monate, je nach Beschaffung, Lieferzeiten für Hardware und wie viel vom Stack bereits existiert. |
Nutzungsbasierte Preise und reservierte Kapazität verhalten sich sehr unterschiedlich, und der Unterschied ist kein Rundungsfehler. Eine selbst gehostete Installation, die auf Ihre stärkste Stunde ausgelegt ist, wird in jeder ruhigen Stunde bezahlt: nachts, am Wochenende und in den Monaten, in denen das Feature live ist, die Nutzung aber noch wächst. Legen Sie stattdessen auf den Durchschnitt aus, ist die Spitzenstunde der Moment, in dem Ihre Nutzer auf eine Warteschlange treffen.
Akumi misst pro Token und pro Anfrage, sodass eine ruhige Woche nichts kostet und eine Launch-Woche ohne Beschaffungsgespräch skaliert. Governance-Module messen separat, wenn sie laufen, und ein Cache-Treffer entfernt die Inferenzkosten vollständig, sodass die Rechnung der Arbeit folgt statt der Kapazität, die Sie vorsorglich reserviert haben.
| Dimension | Akumi | Self-Hosting |
|---|---|---|
| Ruhige Phasen | Nichts. Sie zahlen für Anfragen, nicht für reservierte Kapazität. | Volle Kosten, unabhängig von der Auslastung. |
| Eine plötzliche Spitze | Aufgefangen. Skalierung ist unsere Sorge. | Eine Warteschlange, oder Kapazität, die Sie im Voraus gekauft und das ganze Jahr bezahlt haben. |
| Wem die Rechnung folgt | Der geleisteten Arbeit, aufgeschlüsselt pro Anfrage und pro Modul. | Der reservierten Hardware, plus den Menschen, die sie gesund halten. |
Ein Modell auf eigener Hardware dazu zu bringen, Tokens zurückzugeben, ist ein gelöstes Problem, und ein guter Entwickler hat es in einer Woche laufen. Die verbleibenden zwei Drittel sind der Teil, der das Quartal kostet: ein Dokumentspeicher und ein Aufnahmepfad, Retrieval, das gut genug rankt, um nützlich zu sein, Trennung, damit die Dokumente eines Kunden nie in der Antwort eines anderen auftauchen, Maskierung personenbezogener Daten vor dem Egress, Injection-Prüfung über alles, was ein Tool zurückgibt, ein Cache und ein Audit-Trail, der spezifisch genug ist, dass jemand beantworten kann, wo eine bestimmte Anfrage lief.
Nichts davon ist exotisch, und alles davon ist tragend. Es ist auch der Teil, der immer wieder Aufmerksamkeit braucht, denn die Angriffe ändern sich, die Modelle ändern sich und die Pflichten ändern sich. Bei Akumi ist es bereits da, bereits gemessen und bereits als der Mandantengrenz-Code geprüft, der es ist.
| Dimension | Akumi | Self-Hosting |
|---|---|---|
| Tokens zurückbekommen | Enthalten. | Eine Woche Arbeit, und ehrlich gesagt der schönste Teil. |
| Retrieval und Trennung | Ein geregelter Wissensgraph, pro Workspace partitioniert, noch bevor die Abfrage gebaut wird. | Ein Speicher, ein Aufnahmepfad, Ranking und die Trennlogik zwischen Mandanten. |
| Schwärzung und Injection | PII-Firewall und Guard auf derselben Anfrage, standardmäßig aktiv. | Selbst zu schreiben und selbst aktuell zu halten, während Angriffe sich entwickeln. |
| Audit und Nachweis | Protokoll aus reinen Metadaten zu Modell, Anbieter und Region, pro Anfrage. | Selbst zu entwerfen, zu speichern, aufzubewahren und zu verteidigen. |
Modellgenerationen wechseln schnell, und auf selbst gehosteter Infrastruktur ist jeder Wechsel ein Projekt statt einer Konfigurationsänderung: neue Gewichte zu bewerten, Serving-Parameter neu abzustimmen, Durchsatz und Speicher neu zu messen, Qualität gegen Ihre eigene Last neu zu benchmarken und ein Rollback-Plan für den Fall, dass es auf eine Weise schlechter ist, die die Benchmarks übersehen haben. Teams, die hier zurückfallen, betreiben still ein Modell, das ein Jahr älter ist als das ihres Wettbewerbers.
Hinter einem verwalteten Endpoint ist dieser Wechsel ein String. Neue Modelle kommen getestet und bepreist an, der Router übernimmt Fallback, und Ihre Bewertung ist ein Vergleich, den Sie durchführen, statt eines Upgrades, das Sie einplanen.
| Dimension | Akumi | Self-Hosting |
|---|---|---|
| Ein neueres Modell übernehmen | Einen String ändern, Ihre Evals laufen lassen, das alte als Fallback behalten. | Gewichte, Serving-Konfiguration, Neuabstimmung, Neu-Benchmarking und ein Rollback-Plan. |
| Zurückfallen | Schwierig, weil der Wechsel fast nichts kostet. | Üblich, weil jedes Upgrade mit Produktarbeit konkurriert. |
| Zwei parallel betreiben | Leiten Sie Traffic auf beide und vergleichen Sie aus denselben Trace-Daten. | Doppelte Kapazität, oder eine Serving-Topologie, die beide beherbergen kann. |
Das hängt fast vollständig von der Auslastung ab. Selbst gehostete Kapazität ist ein Fixkostenblock, der anfällt, ob eine Anfrage kommt oder nicht, also belohnt sie großes, stetiges, vorhersehbares Volumen. Nutzungsbasierte Preise belohnen schwankende oder wachsende Lasten, bei denen Sie sonst für leerlaufende GPUs zahlen. Der Vergleich, den man vergisst, ist die Entwicklungszeit: Serving-Stack, Retrieval, Trennung, Schwärzung und Audit müssen alle gebaut und danach gepflegt werden.
Ja. Die Anwendung, die Daten und die Modelle sind EU-ansässig, und Routing außerhalb der EU wird an einem Guard blockiert, der fail-closed greift, sofern Sie es nicht ausdrücklich erlauben. Jede Anfrage protokolliert Modell, Anbieter und Region, die sie bedient haben, sodass Ansässigkeit pro Anfrage nachweisbar ist statt einmalig behauptet.
Ja. Die EU-souveräne Auswahl ist genau darauf aufgebaut, bereitgestellt hinter demselben OpenAI-kompatiblen Endpoint wie alles andere, sodass Sie offene Modelle bekommen, ohne den Serving-Stack zu betreiben, der sie ausführt.
Die API ist OpenAI-kompatibel, also ist der Wechsel in beide Richtungen eine base_url-Änderung statt einer Neuentwicklung. Auf Akumi zu beginnen, während ein Self-Hosting-Projekt noch ein Roadmap-Punkt ist, ist ein vernünftiger Weg, eine Compliance-Frist zu halten, die vor Ihrer Hardware eintrifft.
Nein, und Akumi ebenfalls nicht. Retrieval läuft auf einem geregelten Wissensgraphen statt auf einem Vector Store: Gesprächsgedächtnis und Ihre Dokumente teilen sich ein Substrat, sodass eine Antwort den Beziehungen dazwischen folgen kann, statt zu hoffen, dass ein einzelner Chunk die ganze Kette enthält.
Bei Akumi wir. Neue Modelle kommen getestet und bepreist hinter demselben Endpoint an, und der Wechsel ist eine String-Änderung mit dem vorherigen Modell als Fallback. Selbst gehostet ist jedes Upgrade Ihres zum Bewerten, Abstimmen, Benchmarken und Zurückrollen.
Basis-Inferenz wird pro Token und pro Anfrage gemessen, und jedes Governance-Modul misst auf einer eigenen Zeile, wenn es läuft, sodass PII-Firewall, Retrieval, Guard und Cache getrennt sichtbar sind. Ein Cache-Treffer überspringt die Inferenzkosten vollständig.
Steht Self-Hosting auf der Roadmap, kommt die Compliance-Frist aber früher, beginnen Sie jetzt auf Akumi. Die API ist ohnehin OpenAI-kompatibel, ein späterer Wechsel ist also eine base_url.
We use privacy-friendly, EU-hosted analytics to understand how Akumi is used. Accept analytics cookies, or continue without them. See our cookie policy.