Zum Hauptinhalt springen
Connic
Zurück zum BlogBranchen-Insights

Aleph Alpha Kolibri-1: EU-Open-Weight-Modell, Benchmarks und Setup

Kolibri-1 von Aleph Alpha ist ein in Europa trainiertes Open-Weight-Modell für Deutsch und Englisch; der Leitfaden zeigt Benchmarks, Hardware, Lizenz und Setup.

4. Oktober 202613 Min. LesezeitAutor: Connic Research Team

Kolibri-1 ist ein Open-Weight-Sprachmodell, das Aleph Alpha am 3. Oktober 2026 veröffentlicht hat. Es hat 78,1 Milliarden Parameter, aktiviert davon 3,46 Milliarden pro Token und ist für Deutsch und Englisch gebaut. Das Modell unterstützt einstellbares Reasoning und Tool Calling, die Gewichte stehen unter der Apache-2.0-Lizenz auf Hugging Face. Trainiert hat Aleph Alpha das Modell auf Infrastruktur in Deutschland und Finnland. Dieser Leitfaden behandelt Spezifikationen, Lizenz, Benchmarks, Hardwareanforderungen und Community-Quantisierungen und zeigt, wie ein selbst betriebener Kolibri-1-Endpoint hinter KI-Agenten im Produktivbetrieb läuft.

Kolibri-1 im Überblick

Kolibri-1 ist ein Mixture-of-Experts-Modell: Jede Schicht enthält viele Experten-Netze, und ein Router schickt jedes Token nur an wenige davon. Der Rechenaufwand pro Token liegt deshalb nahe an dem eines 3,5B-Modells, obwohl das gesamte Netz 78,1 Milliarden Parameter speichert. Die folgenden Angaben stammen aus der offiziellen Model Card von Kolibri-1 und der Release-Ankündigung von Aleph Alpha.

Technische Spezifikationen von Kolibri-1
MerkmalKolibri-1
EntwicklerAleph Alpha, Heidelberg
Veröffentlichung3. Oktober 2026
Parameter78,1 Mrd. insgesamt, 3,46 Mrd. aktiv pro Token
ArchitekturMixture of Experts, 50 Schichten, 384 geroutete Experten plus 1 geteilter Experte pro Schicht, 6 geroutete Experten pro Token
AttentionSliding-Window-Attention über 512 Tokens in vier von fünf Schichten, volle Attention in der fünften
Kontextfenster262.144 Tokens nativ, validiert bis 1.048.576
SprachenDeutsch und Englisch
ReasoningEinstellbarer Aufwand: none, low, medium, high
Tool CallingJa, über den offiziellen vLLM-Parser
GewichteFP8 (rund 78 GB) und BF16 (rund 156 GB)
Wissensstand18. Juni 2026
Pre-Training-Daten20 Billionen Tokens, davon 21,3 % Deutsch (rund 4,3 Billionen), laut Release-Ankündigung
Pre-Training-Rechenleistung768 NVIDIA-B200-GPUs über 21 Tage
TrainingsstandortInfrastruktur in Deutschland und Finnland
LizenzApache 2.0 für die veröffentlichten Gewichte und Konfigurationsdateien

Aleph Alpha hat außerdem einen neuen Tokenizer trainiert, der die Struktur deutscher Wörter einschließlich Komposita berücksichtigt. Laut Model Card erreicht er bei deutschem Text 4,7 Bytes pro Token und komprimiert damit stärker als führende KI-Modelle mit größerem Vokabular; im Englischen liegt er bei 4,2 Bytes pro Token. Weniger Tokens für denselben deutschen Text bedeuten geringere Latenz und niedrigere Betriebskosten pro Anfrage.

Die Apache-2.0-Lizenz erlaubt kommerzielle Nutzung, Veränderung und Weitergabe der Gewichte. Ihr Geltungsbereich ist eng gefasst: Laut Model Card gelten die Rechte für die Gewichte und Konfigurationsdateien im Hugging-Face-Repository, nicht aber für Code, Modellarchitektur, Parametereinstellungen oder Trainingsmethoden. Das Serving-Plugin aleph-alpha-inference steht separat unter Apache 2.0.

Benchmarks von Kolibri-1

Aleph Alpha hat das nachtrainierte Modell mit 13 anderen KI-Modellen verglichen, überwiegend mit dem eigenen quelloffenen eval-framework. Alle Modelle liefen mit demselben Setup, Kolibri-1 mit Reasoning-Aufwand high. Der Vergleich gruppiert Mixture-of-Experts-Modelle mit ähnlich vielen aktiven Parametern und führt Modelle ohne MoE-Architektur, die pro Token ein Vielfaches an Parametern aktivieren, als Referenz auf. Alle folgenden Zahlen sind Messungen von Aleph Alpha selbst, keine unabhängigen Ergebnisse.

Vergleich mit ähnlichen offenen Modellen

Die Tabelle zeigt Kolibri-1 neben drei Mixture-of-Experts-Modellen ähnlicher aktiver Größe und Qwen3.8 27B, dem stärkeren der beiden Modelle ohne Mixture-of-Experts-Architektur im Vergleich von Aleph Alpha.

Ausgewählte Post-Training-Ergebnisse aus der Model Card von Kolibri-1, Oktober 2026
BenchmarkKolibri-1Qwen3.6 35B-A3BGemma 4 26B-A4BMistral Small 4 119B-A6BQwen3.8 27B (kein MoE)
Gesamt, Englisch75,571,471,963,180,2
Gesamt, Deutsch70,867,366,361,479,9
Agentic-Durchschnitt (EN)63,462,154,640,766,7
Tau3-Bench Banking38,110,616,05,750,0
BFCL v4 Multi-Turn47,558,161,440,455,5
Agentic Wiki QA (DE)69,458,866,265,473,5
Industry-RAG-Durchschnitt (DE)67,565,849,453,480,2
LiveCodeBench v685,982,582,371,293,8
AA-Omniscience Non-Hallucination Rate44,056,714,334,767,3

Ausgewählte Post-Training-Ergebnisse aus der Model Card von Kolibri-1 (FP8-Release), Oktober 2026. Kolibri-1 lief mit Reasoning-Aufwand high, die übrigen Modelle mit ihren dokumentierten Einstellungen. Fett markiert ist der beste Mixture-of-Experts-Wert jeder Zeile; die hinterlegte Spalte zeigt das Referenzmodell ohne MoE-Architektur.

Kolibri-1 erreicht die höchsten Gesamtwerte für Englisch und Deutsch unter allen Mixture-of-Experts-Modellen des Vergleichs, allerdings mit knappem Vorsprung. Qwen3.5 35B-A3B kommt auf 74,7 im Englischen und 69,8 im Deutschen, GPT-OSS 120B auf 70,2 im Deutschen. Qwen3.8 27B liegt im Englischen rund 5 und im Deutschen rund 9 Punkte vor Kolibri-1, aktiviert pro Token aber fast achtmal so viele Parameter.

Ergebnisse für Agenten und Tool Calling

Mit einem englischen Agentic-Durchschnitt von 63,4 liegt Kolibri-1 gleichauf mit Qwen3.5 35B-A3B an der Spitze der Mixture-of-Experts-Modelle. Den deutlichsten Vorsprung hat es bei Tau3-Bench Banking, einer simulierten Kundenservice-Aufgabe im Bankwesen: 38,1 gegenüber höchstens 16,0 bei allen anderen Mixture-of-Experts-Modellen. Bei Tau2-Bench Airline erreicht es 76,7, den besten Wert seiner Gruppe, und bei der deutschen Agentic-Wiki-QA-Aufgabe von Aleph Alpha 69,4, ebenfalls den Bestwert der Gruppe.

Die Schwäche liegt beim Function Calling über mehrere Gesprächsrunden. Im Multi-Turn-Teil des Berkeley Function Calling Leaderboard (BFCL v4) erzielt Kolibri-1 47,5 und liegt damit hinter 9 der 11 anderen Mixture-of-Experts-Modelle. Auch der BFCL-v4-Gesamtwert von 61,4 liegt unter Qwen3.6 35B-A3B (67,2) und Gemma 4 26B-A4B (68,2). Bei TerminalBench 2.1, einem Benchmark für Kommandozeilen-Agenten, kommt es auf 27,7, Qwen3.5 35B-A3B auf 39,7. Agenten, die in einem Gespräch viele voneinander abhängige Tool Calls verketten, sollten vor dem Rollout genau mit diesem Muster getestet werden.

Grounding und Halluzinationen

Aleph Alpha hat Kolibri-1 mit Abstention-Daten trainiert, damit das Modell Fragen ablehnt, die es nicht verlässlich beantworten kann. Im RGB-Negative-Rejection-Test, der prüft, ob ein Modell ablehnt, wenn die mitgelieferten Dokumente keine Antwort enthalten, erreicht es 85,6. Seine AA-Omniscience Non-Hallucination Rate von 44,0 liegt hinter Qwen3.6 35B-A3B (56,7), aber weit vor Gemma 4 26B-A4B (14,3). Schwächer ist das Korrigieren falscher Angaben in mitgelieferten Dokumenten: Im RGB-Fact-Check-Test erzielt Kolibri-1 34,0, die Mixture-of-Experts-Modelle anderer Entwickler liegen zwischen 58,0 und 90,0. Retrieval-Agenten auf Basis von Kolibri-1 profitieren deshalb von Prüfungen, die Antworten mit ihren Quellen abgleichen.

Kontextfenster: 1M validiert, 262k empfohlen

In seiner letzten Long-Context-Phase wurde Kolibri-1 auf Sequenzen mit 262.144 Tokens trainiert; das ist seine native Kontextlänge. Da die Positionskodierung nur in den Sliding-Window-Schichten sitzt, lässt sich der Kontext ohne Position Scaling erweitern. Aleph Alpha hat Qualität und Serving-Effizienz bis 1.048.576 Tokens validiert. Für latenz- oder durchsatzkritische Deployments und für komplexe Aufgaben empfiehlt die Model Card trotzdem höchstens 262.144 Tokens. Die Standardkonfiguration stellt 262.144 Tokens bereit; längere Kontexte brauchen die zusätzlichen vLLM-Flags --max-model-len 1048576 und --hf-overrides '{"max_position_embeddings": 1048576}'.

Die Long-Context-Ergebnisse des Basismodells passen zu dieser Empfehlung. Sein RULER-Durchschnitt sinkt von 86,9 bei 4k Tokens auf 69,8 bei 256k und 63,2 bei 1M. Bei 1M Tokens liegt es vor den Basisversionen von Nemotron 3 Nano 30B-A3B (58,5) und Qwen3.5 35B-A3B (57,5), beide schneiden bis 512k aber bei jeder Länge besser ab.

Agenten brauchen selten eine Million Tokens in einer einzigen Anfrage. Ein lang laufender Agent sammelt Tool-Ergebnisse und Gesprächsverlauf an. Bleibt jede Anfrage unter dem empfohlenen Fenster, profitieren Latenz und Antwortqualität. Die Kontextkomprimierung von Connic kürzt den Verlauf, sobald Prompts ein konfiguriertes Token-Limit erreichen; der Leitfaden zur Kontextkomprimierung erklärt die Abwägungen.

Hardwareanforderungen und Betrieb

Weil pro Token nur wenige Experten rechnen, sinkt der Rechenaufwand pro Token; alle 78,1 Milliarden Parameter müssen aber im GPU-Speicher liegen. Aleph Alpha nennt die folgenden Konfigurationen; KV-Cache und Laufzeit-Overhead kommen zu den Gewichten hinzu.

Speicherbedarf und GPU-Konfigurationen von Kolibri-1
GewichteSpeicher für GewichteMinimumEmpfohlen
FP8 (Kolibri-1)Rund 78 GB2× A100 80 GB, 2× H100 SXM5, 1× H200, 1× B200 oder 1× B3002× H100 SXM5, 2× H200, 1× B200 oder 1× B300
BF16 (Kolibri-1-BF16)Rund 156 GB4× A100 80 GB, 4× H100 SXM5, 2× H200, 1× B200 oder 1× B3004× H100 SXM5, 2× H200, 2× B200 oder 1× B300

Für den Betrieb ist das Paket aleph-alpha-inference von Aleph Alpha nötig. Es ergänzt vLLM um die Unterstützung für Kolibri-1 und installiert die passende vLLM-Version. Alternativ gibt es ein fertiges Container-Image. Der offizielle Befehl aktiviert Reasoning und Tool Calling:

Kolibri-1 mit vLLM bereitstellen
pip install 'aleph-alpha-inference>=1'

vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
  --reasoning-parser kolibri1 \
  --tool-call-parser kolibri1 \
  --enable-auto-tool-choice

Aleph Alpha empfiehlt temperature=1.0, top_p=0.97 und top_k=128; das Repository liefert diese Werte in seiner Generation Config mit. Der Reasoning-Aufwand wird pro Anfrage über das Chat-Template gesetzt, mit den Stufen none, low, medium und high. Setzt eine Anfrage keinen Aufwand, nutzt das Template high, was jeden Aufruf um Reasoning-Tokens und Latenz verlängert. Tool Calls folgen einem Hermes-Format, das der Parser kolibri1 in strukturierte Tool Calls der OpenAI-kompatiblen Antwort umwandelt. Tool Calling funktioniert auch zusammen mit Reasoning.

Quantisierte Versionen: GGUF, MLX und NVFP4

Aleph Alpha veröffentlicht nur die FP8- und BF16-Checkpoints. Innerhalb eines Tages nach dem Release haben Community-Mitglieder mehr als ein Dutzend GGUF-, MLX- und NVFP4-Konvertierungen auf Hugging Face hochgeladen. Stand 4. Oktober 2026 brauchen die GGUF- und MLX-Dateien gepatchte oder geforkte Laufzeitumgebungen. Eine Auswahl:

Ausgewählte inoffizielle Quantisierungen von Kolibri-1 auf Hugging Face, Stand 4. Oktober 2026
FormatRepositoryGrößeLaufzeitHinweise
GGUF Q3_K_SEliasfpv28/Kolibri-1-Q3_K_S-GGUF33,9 GBGepatchtes llama.cppLokal mit 4.096 Tokens Kontext gestartet; Reasoning und Tool Calling nicht validiert
GGUF Q4_K_M, Q8_0Hob-forge/Kolibri-1-GGUF47,5 GB, 83,1 GBGepatchtes llama.cppArchitektur-Patch gegen eine Referenzimplementierung geprüft
MLX 3-Bithere-be-dragons-ai/Kolibri-1-MLX-3bit33 GiBFork von mlx-vlmAusgelegt auf Macs mit 48 GB Unified Memory
MLX 2-Bitvelaia/Kolibri-1-MLX-2bit24 GiBmlx-lm mit mitgeliefertem LauncherMacs ab 36 GB
MLX 4-Bitvelaia/Kolibri-1-MLX-4bit41 GiBmlx-lm mit mitgeliefertem LauncherMacs ab 64 GB
MLX 6-Bitaudreyt/Kolibri-1-MLX-6bit59,16 GiBFork von mlx-lmMacs ab 96 GB
NVFP4 W4A16audreyt/Kolibri-1-NVFP4-W4A1644,14 GiBvLLMVollständige Generierung noch nicht validiert

Das unveränderte llama.cpp, Ollama und LM Studio können die GGUF-Dateien erst laden, wenn sie die Architektur kolibri1 unterstützen. Am 4. Oktober waren ein Feature Request für llama.cpp und ein Pull Request für mlx-lm zu Kolibri-1 noch offen. Der NVFP4-Build zielt auf vLLM mit dem Plugin von Aleph Alpha, hat einen Generierungstest aber noch nicht abgeschlossen. Die meisten Konvertierungen gehen vom FP8-Checkpoint aus, und ihre Autoren berichten von Smoke-Tests und kleinen Perplexity-Stichproben, nicht von Benchmark-Ergebnissen.

Inoffizielle Konvertierungen
Keine dieser Dateien stammt von Aleph Alpha, und niedrigere Bitbreiten verändern die Modellqualität. Für lokale Experimente auf einer Workstation oder einem Mac sind sie geeignet. Für Agenten im Produktivbetrieb bleiben die offiziellen FP8-Gewichte auf vLLM das Referenz-Setup.

Was Kolibri-1 für Europa bedeutet

Entwickelt hat Kolibri-1 ein deutsches Unternehmen, und laut Release-Ankündigung wurde es in Deutschland und Finnland unter europäischem und deutschem Recht trainiert. Die Apache-2.0-Gewichte laufen in jedem EU-Rechenzentrum oder On-Premises, sodass Prompts und Dokumente auf Infrastruktur bleiben, die der Betreiber kontrolliert. Einen Vergleich der Hosting-Optionen bietet unser Überblick zu in der EU gehosteten KI-Modellen.

Die Release-Dokumentation geht auch auf die EU-Regeln für KI-Modelle mit allgemeinem Verwendungszweck ein. Laut Model Card hat Aleph Alpha den EU-Verhaltenskodex für KI-Modelle mit allgemeinem Verwendungszweck (General-Purpose AI Code of Practice) unterzeichnet. Die Model Card nennt außerdem einen Kontakt für Rechteinhaber, und ihre Hinweise zur verantwortungsvollen Nutzung fordern dazu auf, das Modell nicht für Praktiken einzusetzen, die nach Artikel 5 des EU AI Act verboten sind. Als vorgesehenen Einsatz beschreibt sie Assistenten und agentische Workflows, in denen ein Mensch die Ausgabe prüft, bevor danach gehandelt wird, und keine Systeme, die ungeprüft handeln. Welche Pflichten für einen bereitgestellten Agenten gelten, hängt trotzdem von seinem Einsatzzweck ab; der Leitfaden zur EU-AI-Act-Compliance für KI-Agenten beschreibt diese Prüfung.

Deutsch und Englisch sind die einzigen unterstützten Sprachen. Damit ist Kolibri-1 ein Kandidat für deutschsprachige Workloads in Deutschland, Österreich und der Schweiz sowie für europäische Unternehmen mit deutschsprachigen Kunden, nicht aber für Produkte, die weitere EU-Sprachen brauchen. Als Zielbranchen nennt Aleph Alpha öffentliche Verwaltung, Luft- und Raumfahrt, Fertigung, Automobilindustrie und Halbleiterindustrie.

Kolibri-1 mit Connic nutzen

Connic betreibt KI-Agenten im Produktivbetrieb, mit Deployments, Verbindungen, Guardrails, Approvals, Judges und Traces. Kolibri-1 gehört nicht zum Katalog der von Connic verwalteten KI-Modelle, ein selbst betriebener Kolibri-1-Endpoint lässt sich aber als eigener OpenAI-kompatibler Provider anbinden und nutzt dann all diese Funktionen wie jedes andere KI-Modell. Die Einrichtung umfasst fünf Schritte.

1. Modell bereitstellen

Führe den offiziellen vLLM-Befehl aus dem vorigen Abschnitt auf einem GPU-Server aus, der die Hardwareanforderungen erfüllt. Ist der Endpoint von außerhalb seines Netzwerks erreichbar, starte vLLM mit --api-key, damit nur Clients mit diesem Schlüssel ihn aufrufen können.

2. Eigenen Provider anlegen

Öffne in Connic die Projekt-Settings, gehe zu LLM Provider und wähle Add Custom Provider. Trage einen Anzeigenamen, ein kleingeschriebenes Modell-Präfix wie vllm, die Basis-URL des Endpoints mit der Endung /v1 und, falls der Server einen verlangt, den API-Schlüssel ein. Die Dokumentation zu eigenen Providern beschreibt die Einrichtung.

3. Private Endpoints privat halten

Läuft der GPU-Server in einem privaten Netzwerk, starte dort die Connic Bridge und wähle sie im Dropdown Route via Bridge des Providers aus. Connic tunnelt dann jede Modellanfrage durch die Bridge, ohne eingehende Firewall-Regeln und ohne öffentlichen Endpoint. Die Bridge-Dokumentation und der Bridge-Überblick beschreiben die Einrichtung.

4. Kolibri-1 im Agenten referenzieren

Die Modell-ID setzt sich aus dem Provider-Präfix und dem Modellnamen zusammen, den vLLM bereitstellt. Standardmäßig ist das der Name des Hugging-Face-Repositorys:

agents/support-agent-de.yaml
version: "1.0"

name: support-agent-de
model: vllm/Aleph-Alpha/Kolibri-1
description: "Beantwortet deutschsprachige Supportanfragen"
fallback_model: connic/qwen3.6-35b-a3b
reasoning_effort: low
context_compression:
  enabled: true
  max_prompt_tokens: 200000
system_prompt: |
  Du beantwortest Supportanfragen unserer Kunden auf Deutsch...

Connic reicht reasoning_effort an das Chat-Template von Kolibri-1 weiter. Ohne diese Angabe läuft jeder Modellaufruf mit hohem Aufwand. Für Routineschritte passen low oder medium, high für mehrstufiges Reasoning. Mit fallback_model wechselt eine fehlgeschlagene Anfrage oder eine Anfrage mit Timeout zu einem von Connic verwalteten KI-Modell, sodass ein GPU-Ausfall den Agenten nicht stoppt. Die Kontextkomprimierung hilft, Prompts unter dem empfohlenen Fenster von 262.144 Tokens zu halten.

Eine Zeile für den Modellwechsel
Das Präfix vllm/ ist ein im Projekt festgelegter Provider-Alias, keine offizielle Modell-ID von Aleph Alpha. Ein Wechsel zwischen Kolibri-1 und einem verwalteten KI-Modell wie connic/qwen3.6-35b-a3b ändert nur die Zeile model.

5. Vor dem Rollout testen

Benchmarks zeigen nicht, wie Kolibri-1 mit den Tools und Dokumenten eines bestimmten Agenten umgeht. Ein A/B-Test in Connic zeigt es: Der bestehende Agent bleibt der Basisagent (Control), eine Variantendatei namens support-agent-de-test-kolibri.yaml ändert das Modell, und ein Teil des Live-Traffics geht an die Variante. Judges bewerten beide Versionen nach denselben Kriterien, und der Test pausiert eine Variante, die ihre Grenzen für Fehlerrate oder Qualität verletzt. Für Tool Calls mit echten Folgen sorgen Approvals für die menschliche Prüfung, die die Model Card empfiehlt.

Betreibe Kolibri-1 hinter Agenten im Produktivbetrieb

Binde deinen Kolibri-1-Endpoint als eigenen Provider an und teste ihn mit A/B-Tests, Judges und Traces gegen verwaltete KI-Modelle, die in der EU laufen.

Kostenlos starten

Kolibri-1 selbst betreiben oder ein verwaltetes KI-Modell nutzen?

Kolibri-1 selbst zu betreiben lohnt sich, wenn deine deutschsprachigen Daten auf Infrastruktur bleiben müssen, die du selbst kontrollierst, und dein Team bereits GPUs der H100- oder H200-Klasse betreibt. Kapazitätsplanung, Updates, Monitoring und Bereitschaftsdienst für den Inference-Server liegen dann bei dir.

Ohne eigene GPUs starten
Alle vier Vergleichsmodelle aus der Benchmark-Tabelle laufen als von Connic verwaltete KI-Modelle mit Inferenz ausschließlich in der EU, ohne Provider-Konto und mit Token-Abrechnung über das Projektguthaben: connic/qwen3.6-35b-a3b, connic/gemma-4-26b-a4b-it, connic/mistral-small-2603 und connic/qwen3.8-27b. Der Modellkatalog nennt aktuelle Preise und Kontextgrenzen.

Da das Modell nur eine Zeile im Agent-YAML ist, kannst du heute mit einem verwalteten KI-Modell starten und einen selbst betriebenen Kolibri-1-Endpoint per A/B-Test vergleichen, sobald deine Hardware bereitsteht. Judges und Traces zeigen dann, ob die Ergebnisse von Kolibri-1 bei deinen deutschsprachigen Aufgaben den Betrieb des Inference-Servers rechtfertigen.

Häufig gestellte Fragen

Kolibri-1 ist ein Open-Weight-Sprachmodell mit Mixture-of-Experts-Architektur von Aleph Alpha, veröffentlicht am 3. Oktober 2026. Es hat 78,1 Milliarden Parameter, aktiviert 3,46 Milliarden pro Token, unterstützt Deutsch und Englisch, bietet einstellbares Reasoning und Tool Calling und ist für Kontexte bis 1.048.576 Tokens validiert. Die Gewichte stehen unter Apache 2.0 auf Hugging Face.

Kolibri-1 ist ein Open-Weight-Modell. Aleph Alpha veröffentlicht FP8- und BF16-Gewichte unter Apache 2.0, was kommerzielle Nutzung, Veränderung und Weitergabe erlaubt. Laut Model Card umfasst die Lizenz die Gewichte und Konfigurationsdateien im Repository, nicht aber Code, Modellarchitektur, Parametereinstellungen oder Trainingsmethoden.

Die FP8-Gewichte brauchen rund 78 GB GPU-Speicher. Aleph Alpha nennt 2× A100 80 GB, 2× H100 SXM5, 1× H200, 1× B200 oder 1× B300 als Mindestkonfigurationen. Die BF16-Gewichte brauchen rund 156 GB. KV-Cache und Laufzeit-Overhead kommen hinzu.

Der native Kontext von Kolibri-1 umfasst 262.144 Tokens, validiert hat Aleph Alpha bis 1.048.576 Tokens. Für latenz- oder durchsatzkritische Deployments und komplexe Aufgaben empfiehlt die Model Card höchstens 262.144 Tokens. Mehr als 262.144 Tokens erfordern zusätzliche vLLM-Flags.

Stand 4. Oktober 2026 nicht mit unveränderten Tools. Die GGUF-Dateien der Community brauchen ein gepatchtes llama.cpp, Ollama und LM Studio können sie noch nicht laden. MLX-Konvertierungen der Community laufen auf Apple-Silicon-Macs über geforkte Laufzeitumgebungen oder einen mitgelieferten Launcher und brauchen mindestens 36 GB Unified Memory, bei höheren Bitbreiten mehr. Keine dieser Konvertierungen ist offiziell.

In der Evaluation von Aleph Alpha erreicht Kolibri-1 gesamt 75,5 im Englischen und 70,8 im Deutschen, vor Qwen3.6 35B-A3B (71,4 und 67,3) und Gemma 4 26B-A4B (71,9 und 66,3). Qwen3.8 27B, ein Modell ohne Mixture-of-Experts-Architektur, liegt mit 80,2 und 79,9 vorn, aktiviert pro Token aber fast achtmal so viele Parameter. Alle Ergebnisse stammen von Aleph Alpha selbst.

Ja. Das offizielle vLLM-Setup aktiviert Tool Calling im Hermes-Format über den Parser kolibri1, und Tool Calls funktionieren zusammen mit Reasoning. In den Benchmarks von Aleph Alpha ist Kolibri-1 stark bei simulierten Kundenservice-Aufgaben wie Tau3-Bench Banking, aber schwächer beim Function Calling über mehrere Gesprächsrunden in BFCL v4.

Laut Model Card hat Aleph Alpha den EU-Verhaltenskodex für KI-Modelle mit allgemeinem Verwendungszweck unterzeichnet, und die Hinweise zur verantwortungsvollen Nutzung fordern dazu auf, Kolibri-1 nicht für Praktiken einzusetzen, die nach Artikel 5 des EU AI Act verboten sind. Wird das Modell selbst betrieben, bleiben die Daten auf Infrastruktur, die der Betreiber kontrolliert. Die Pflichten für einen bereitgestellten Agenten hängen trotzdem vom Einsatzzweck ab und müssen für jedes System geprüft werden.

Ja. Kolibri-1 wird mit vLLM bereitgestellt, der Endpoint in den Projekt-Settings als eigener OpenAI-kompatibler Provider angelegt und im Agent-YAML referenziert, zum Beispiel als vllm/Aleph-Alpha/Kolibri-1. Private Endpoints werden über die Connic Bridge angebunden. Kolibri-1 gehört nicht zum Katalog der von Connic verwalteten KI-Modelle.

Mehr aus dem Blog

Branchen-Insights

EU AI Act: Wer ist zuständig? Daten von 2.390 Datenschutzbeauftragten

Laut einer Befragung von 2.390 DSB aus 2025 landet die AI-Act-Arbeit bei ihnen; so können Produkt, Engineering, Recht und IT-Sicherheit sie mittragen.

28. September 202610 Min. Lesezeit
Branchen-Insights

SLA-Checkliste für KI-Agenten-Plattformen: Was Enterprise-Käufer prüfen sollten

Das SLA einer KI-Agenten-Plattform lässt sich anhand von Uptime-Abdeckung, Abhängigkeiten, Incident Response, Recovery, Security-Nachweisen, Abhilfen und Exit-Bedingungen bewerten.

29. August 202612 Min. Lesezeit
Branchen-Insights

EU-gehostete KI-Modelle 2026: Provider, Abhängigkeit und Optionen

EU-gehostete KI-Modelle im Vergleich: Standort, Aufbewahrung, Betreiber, Portabilität und Betriebsmodell unter Berücksichtigung einer 2026 von der EU-Kommission beauftragten Studie.

18. August 202611 Min. Lesezeit
Branchen-Insights

EU AI Gigafactories: Was der 30-Milliarden-Euro-Plan bedeutet

Der 30-Milliarden-Euro-Plan soll AI Gigafactories schaffen; förderfähige KI-KMU können heute über Playground, Fast Lane oder Large Scale Rechenzeit beantragen.

14. August 202615 Min. Lesezeit
Branchen-Insights

Der OpenAI-Hugging-Face-Hack: Was der Vorfall für KI-Agenten bedeutet

OpenAI-KI-Modelle entkamen im Juli 2026 aus einer Test-Sandbox und kompromittierten Hugging Face. Der Vorfall zeigt, welche Guardrails KI-Agenten im Produktivbetrieb benötigen.

24. Juli 20269 Min. Lesezeit
Branchen-Insights

KI-Agenten-Plattformen mit EU-Datenresidenz: Auswahl 2026

KI-Agenten-Plattformen nach EU-Datenresidenz vergleichen: Traces, Speicher, Modellaufrufe, Backups, Unterauftragsverarbeiter und Support-Zugriffe.

6. Juli 202612 Min. Lesezeit
Branchen-Insights

KI-Agenten in der EU ohne US-Hyperscaler betreiben

Produktive KI-Agenten in der EU ohne US-Hyperscaler betreiben: Was EU-gehostet wirklich bedeuten muss, wo der US CLOUD Act Risiken schafft und welche Souveränitätskriterien zählen.

4. Juni 20269 Min. Lesezeit
Branchen-Insights

Die besten KI-Agenten-Plattformen für EU-Unternehmen 2026

Vergleich von KI-Agenten-Plattformen nach EU-Datenresidenz, Self-Hosting, Unterstützung für MCP-Tools, BYOK, Vorbereitung auf den EU AI Act und SLA-Bedingungen. Aktualisiert im September 2026.

19. Mai 202616 Min. Lesezeit
Branchen-Insights

Deployment-Plattformen für KI-Agenten: 16 Anbieter im Vergleich (2026)

16 Deployment-Plattformen für KI-Agenten im Vergleich nach Betriebsumfang, Sprache, Hosting-Modell, Verantwortung für Verbindungen, Datenresidenz und Preismodell.

19. April 202615 Min. Lesezeit