Zum Hauptinhalt springen
Connic
Zurück zum BlogBranchen-Insights

Kosten eines selbst zusammengestellten KI-Agenten-Stacks

Bei einem eigenen KI-Agenten-Stack entstehen die meisten Kosten durch Integration und Wartung der Tools. Der Vergleich zeigt, wann sich eine Plattform lohnt.

9. Juni 202610 Min. LesezeitAutor: Connic Research Team

Fast niemand nimmt sich vor, eine KI-Agenten-Plattform zu bauen. Am Anfang soll nur ein Agent live gehen. Doch der produktive Betrieb stellt Anforderungen, und für jede davon gibt es ein spezialisiertes Tool. So wächst der Stack schrittweise um ein Framework, eine Vektordatenbank, ein Observability-Tool, ein Evaluationstool, ein Experiment-Tool, einen Secrets Manager und Integrationscode, der alles miteinander verbindet.

Jedes einzelne Element ist eine vernünftige Wahl. Die Kosten stecken nicht in einem bestimmten Tool, sondern in den Übergängen dazwischen. Diese Rechnung erscheint später als Wartungsaufwand statt als eigene Position im Budget.

Der daraus entstehende Stack

Ordnet man die Anforderungen eines produktiven Agenten den Tools zu, die Teams dafür auswählen, entsteht ein vertrautes Bild. In jeder Kategorie stehen führende Produkte. Keines davon wurde dafür entwickelt, die anderen zu verstehen.

Framework
LangChain, LlamaIndex oder ein ähnliches Framework, um Agenten und Tools zu definieren.
Vektordatenbank
Pinecone, Weaviate, Qdrant oder pgvector für Retrieval (RAG), jeweils mit eigener Einrichtung, Skalierung und Preisgestaltung.
Observability
Langfuse, Datadog oder Helicone für Traces pro Schritt und Kostenzuordnung.
Evaluation
Braintrust oder Patronus für die LLM-as-a-Judge-Bewertung von Agenten-Ausgaben.
A/B-Tests
Statsig oder GrowthBook, um Prompts und KI-Modelle mit A/B-Tests im Produktivbetrieb zu vergleichen.
Verbindungen, Secrets und Integrationscode
Webhook-Handler, Queue-Consumer, ein Secrets Manager und die Deployment-Infrastruktur, die niemand einplant.
Bündle den Agenten-Stack in einer Runtime

Retrieval, Observability, Evaluation, A/B-Tests und Verbindungen laufen auf einer Plattform. Dadurch entfällt eigener Wartungscode an den Übergängen.

Connic kostenlos testen

Der Aufwand, den niemand einkalkuliert

Addiert man die Abonnements, wirkt die Summe überschaubar. Der teure Teil steht auf keiner Rechnung.

Integrationscode bleibt dauerhafter Wartungsaufwand

Die Verbindung vom Framework zum Evaluationstool, von dessen Ergebnissen zum Experiment-Tool und von den Traces zum Observability-Backend ist individueller Code. Er hat keinen Product Owner, fällt bei einem Upgrade als Erstes aus und ist genau der Code, den niemand pflegen möchte.

Versionsdrift verstärkt sich

Sechs Tools bedeuten sechs Release-Zyklen. Ein Breaking Change in einem davon wirkt sich auf den Integrationscode aus. Statt den Agenten zu verbessern, verbringt das Team einen festen Anteil jedes Sprints damit, die Übergänge intakt zu halten.

Der Bereitschaftsdienst muss den gesamten Stack beherrschen

Wenn sich ein Agent um zwei Uhr morgens falsch verhält, lautet die Frage: Welche Schicht ist ausgefallen? Die Antwort erfordert den Abgleich von Tools ohne gemeinsame Request-ID. Ohne einen durchgängigen Trace vom Trigger über den Tool-Call bis zur Evaluation muss das Team bei der Fehlersuche Informationen aus mehreren Dashboards zusammenführen.

Das ähnelt stark dem Self-Hosting

Der Aufbau entspricht eigener Infrastruktur, nur eine Ebene höher: Die Kosten entstehen durch Menschen und Zeit, nicht durch Compute. Konkrete Zahlen zur Infrastrukturvariante stehen im Beitrag über die versteckten Kosten des Self-Hostings von KI-Agenten und unserem TCO-Vergleich von verwaltetem Betrieb und Self-Hosting. Der Aufwand des zusammengestellten Stacks kommt noch obendrauf.

Wann ein eigener Stack die richtige Wahl ist

Einen Stack selbst zusammenzustellen ist nicht grundsätzlich falsch. Wenn eine dieser Schichten das Produkt ist, etwa weil das Unternehmen Observability anbietet oder Retrieval-Qualität den Wettbewerbsvorteil bildet, lohnt sich die vollständige Kontrolle. Eine allgemeine Plattform kann hier Grenzen setzen. Das gilt auch für ungewöhnliche Anforderungen, die kein integriertes Produkt erfüllt, oder für einen bestehenden Stack, den das Team hervorragend kennt und aus dem es nicht herauswachsen wird. Eigenentwicklung lohnt sich für Komponenten, die den Wettbewerbsvorteil des Produkts ausmachen. Standardaufgaben kann eine integrierte Plattform übernehmen.

Was eine integrierte Plattform verändert

Die Alternative ist eine Plattform, auf der diese Schichten bereits ein gemeinsames Datenmodell verwenden. Wir bündeln Retrieval, Observability, Evaluation, A/B-Tests, Verbindungen und Secrets in einer Runtime: Ein Trace reicht vom Trigger über den Tool-Call bis zum Judge-Score, Upgrades sind Aufgabe der Plattform und eigener Integrationscode entfällt. Teams definieren den Agenten in YAML, schreiben Tools in Python und pushen nach Git. Einen Überblick darüber, wo Agenten laufen, bietet unser Leitfaden zu Deployment-Plattformen für KI-Agenten 2026.

Häufig gestellte Fragen

Die meisten Teams kombinieren ein Framework wie LangChain oder LlamaIndex, eine Vektordatenbank für Retrieval wie Pinecone, Weaviate, Qdrant oder pgvector, ein Observability-Tool wie Langfuse, Datadog oder Helicone, ein Evaluationstool wie Braintrust oder Patronus, ein Experiment-Tool für A/B-Tests wie Statsig oder GrowthBook, einen Secrets Manager sowie individuellen Integrationscode für Verbindungen und Ereignis-Trigger.

Die Abonnements der einzelnen Tools sind sichtbar, die eigentlichen Kosten entstehen jedoch durch Integration und Wartung: dauerhafter Integrationscode, Versionsdrift über sechs unabhängige Release-Zyklen, viele Komponenten, für die der Bereitschaftsdienst zuständig ist und fehlende durchgängige Traces für das Debugging. Dieser Aufwand erscheint als fortlaufende Entwicklungszeit statt als Rechnungsposition.

Ein eigener Stack lohnt sich, wenn eine Schicht wirklich das Differenzierungsmerkmal des Produkts ist. Er passt auch bei ungewöhnlichen Anforderungen, die keine integrierte Plattform erfüllt, oder bei einem bestehenden Stack, den das Team sehr gut kennt und aus dem es nicht herauswachsen wird. Bei Standardschichten verringert eine integrierte Plattform dagegen die Zahl der Schnittstellen.

Wir bündeln Framework, Vektordatenbank, Observability, Evaluation, A/B-Tests, Secrets-Verwaltung und Verbindungen in einer Runtime mit gemeinsamem Datenmodell. Der wichtigste Vorteil ist der Wegfall des Integrationscodes: Ein Trace umfasst den gesamten Run und das Plattform-Team übernimmt Upgrades.

Mehr aus dem Blog

Branchen-Insights

SLA-Checkliste für KI-Agenten-Plattformen: Was Enterprise-Käufer prüfen sollten

Das SLA einer KI-Agenten-Plattform lässt sich anhand von Uptime-Abdeckung, Abhängigkeiten, Incident Response, Recovery, Security-Nachweisen, Abhilfen und Exit-Bedingungen bewerten.

29. August 202612 Min. Lesezeit
Branchen-Insights

EU-gehostete KI-Modelle 2026: Provider, Abhängigkeit und Optionen

EU-gehostete KI-Modelle im Vergleich: Standort, Aufbewahrung, Betreiber, Portabilität und Betriebsmodell unter Berücksichtigung einer 2026 von der EU-Kommission beauftragten Studie.

18. August 202611 Min. Lesezeit
Branchen-Insights

EU AI Gigafactories: Was der 30-Milliarden-Euro-Plan bedeutet

Die EU hat die Beschaffung für bis zu sieben AI Gigafactories eröffnet. Der 30-Milliarden-Euro-Plan könnte die Rechenkapazität in der EU ausbauen; Preise, Zugang und Zeitplan bleiben offen.

14. August 202610 Min. Lesezeit
Branchen-Insights

Soofi S Preview: Ollama, GGUF, Benchmarks und Zugang

Lässt sich Soofi S mit Ollama ausführen? Alles zu den Zugangsbeschränkungen, offiziellen GGUF-Befehlen, Speicherbedarf, korrigierten Benchmarks und dem Release-Plan für September 2026.

15. Juli 202612 Min. Lesezeit
Branchen-Insights

Was ist eine MCP-Verbindung? Eine praktische Definition

Eine MCP-Verbindung verbindet eine KI-App über das Model Context Protocol mit externen Tools und Daten. Der Artikel erklärt die Funktionsweise und den Vergleich mit einer eigenen API-Integration.

8. Juli 20268 Min. Lesezeit
Branchen-Insights

KI-Agenten-Plattformen mit EU-Datenresidenz: Auswahl 2026

KI-Agenten-Plattformen nach EU-Datenresidenz vergleichen: Traces, Speicher, Modellaufrufe, Backups, Unterauftragsverarbeiter und Support-Zugriffe.

6. Juli 202612 Min. Lesezeit
Branchen-Insights

KI-Agenten in der EU ohne US-Hyperscaler betreiben

Produktive KI-Agenten in der EU ohne US-Hyperscaler betreiben: Was EU-gehostet wirklich bedeuten muss, wo der US CLOUD Act Risiken schafft und welche Souveränitätskriterien zählen.

4. Juni 20269 Min. Lesezeit
Branchen-Insights

Die besten KI-Agenten-Plattformen für EU-Unternehmen 2026

Vergleich von KI-Agenten-Plattformen nach EU-Datenresidenz, Self-Hosting, Unterstützung für MCP-Tools, BYOK, Vorbereitung auf den EU AI Act und SLA-Bedingungen. Aktualisiert im September 2026.

19. Mai 202616 Min. Lesezeit
Branchen-Insights

KI-Agenten: Managed vs. Self-Hosting bei 50.000 LLM-Agenten-Runs

Verwaltete und selbst gehostete KI-Agenten bei 50.000 monatlichen LLM-Agenten-Runs: Connic, Eigenentwicklung und Service-Stack in einem transparenten Drei-Jahres-Kostenmodell.

16. Mai 202614 Min. Lesezeit