Aleph Alpha Kolibri: Was der Betrieb des deutschen KI-Modells kostet und wann er sich lohnt
Aleph Alpha hat am 03.10.2026 Kolibri veröffentlicht, ein deutsch-englisches KI-Modell, das Unternehmen unter Apache-2.0-Lizenz kostenlos herunterladen und kommerziell nutzen dürfen. Der Betrieb braucht Rechenzentrums-GPUs, etwa zwei mit je 80 GB, bei OVHcloud ab 2.618 Euro im Monat gemietet. Das lohnt sich, wenn Daten nicht zu einem externen KI-Dienst dürfen; bei üblichen Mittelstandsmengen ist eine KI-API weit günstiger.
Was ist Kolibri?
Kolibri ist ein Sprachmodell mit offenen Gewichten: Du lädst es herunter und betreibst es auf eigener oder gemieteter Hardware, statt Texte an einen fremden Dienst zu schicken. Aleph Alpha hat es zum Tag der Deutschen Einheit am 3. Oktober 2026 auf Hugging Face veröffentlicht. Die Apache-2.0-Lizenz erlaubt Nutzung und Veränderung ohne Lizenzgebühr, auch kommerziell, und sie ist unwiderruflich.
Die Eckdaten laut Aleph Alpha und Modellkarte:
- 78,1 Milliarden Parameter, von denen pro Token, also pro Wortteil, nur 3,46 Milliarden rechnen (Mixture-of-Experts)
- Deutsch und Englisch, mehr als ein Fünftel der Trainingsdaten ist deutsch
- trainiert auf 262.144 Tokens Kontext, laut Hersteller nutzbar bis gut eine Million Tokens
- Denkmodus in vier Stufen, dazu Werkzeugaufrufe für Agenten-Abläufe
- entwickelt in Deutschland, trainiert in Deutschland und Finnland
- gedacht für regulierte Bereiche wie Verwaltung, Industrie sowie Luft- und Raumfahrt
Wie gut ist Kolibri auf Deutsch?
Gut, aber nicht das stärkste offene Modell. In Aleph Alphas eigener Übersicht erreicht Kolibri auf Deutsch einen Gesamtwert von 70,8. Das ist knapp der beste Wert unter den Mixture-of-Experts-Modellen im Vergleich. Klar vorn liegt das dichte Qwen3.8 27B von Alibaba Cloud, bei dem alle Parameter mitrechnen. Aleph Alpha graut es deshalb in der Tabelle aus.
| Modell | Aktive Parameter (Klasse laut Aleph Alpha) | Gesamtwert Deutsch | Gesamtwert Englisch |
|---|---|---|---|
| Kolibri | 3 Mrd. | 70,8 | 75,5 |
| GPT-OSS 120B | 4 bis 6 Mrd. | 70,2 | 72,3 |
| Nemotron 3 Super | 12 Mrd. | 67,9 | 73,0 |
| Mistral Small 4 | 4 bis 6 Mrd. | 61,4 | 63,1 |
| Qwen3.8 27B (dicht) | 27 Mrd. | 79,9 | 80,2 |
Ein Ausreißer nach oben ist ein Agenten-Test aus dem Bankumfeld (Tau3-Bench): Kolibri holt 38,1 Punkte, das zweitbeste Mixture-of-Experts-Modell 16,0. Claude, ChatGPT oder Gemini fehlen im Vergleich, alle Werte stammen vom Hersteller.
Unsere Einschätzung: Kolibris Argument ist Leistung pro Rechenaufwand, nicht Spitzenleistung. Auf zwei H100-Karten haben laut Aleph Alpha rechnerisch 18 gleichzeitige Anfragen mit 256.000 Tokens Kontext Platz, bei einer größeren 123B-Variante nur drei. Ganz ohne China geht es aber nicht: Laut technischem Bericht stammen mehrere der Lehrer-Modelle, die Trainingsdaten erzeugt haben, aus China. Aleph Alpha filtert nach eigenen Angaben Inhalte heraus, die Narrative der Kommunistischen Partei Chinas übernehmen.
Welche Hardware braucht Kolibri?
Rechenzentrums-GPUs, kein Büro-PC. Die Gewichte belegen im FP8-Format rund 78 GB. Die Modellkarte nennt als Minimum zwei A100 mit je 80 GB, zwei H100 SXM5 oder eine einzelne H200, B200 oder B300.
Betrieben wird Kolibri mit der Software vLLM plus Zusatzpaket von Aleph Alpha. vLLM bietet eine OpenAI-kompatible Schnittstelle, bestehende Anwendungen und Automatisierungen lassen sich also grundsätzlich umstellen.
Einen fertigen Dienst mit Abrechnung pro Anfrage gibt es noch nicht: Auf Hugging Face ist Stand 5. Oktober kein Inferenz-Anbieter eingetragen.
Was kostet der Betrieb im Vergleich zu einer KI-API?
Bei üblichen Mittelstandsmengen ein Vielfaches. Die Preisliste des französischen Anbieters OVHcloud führt zwei passende Server, Preise inklusive Mehrwertsteuer: zwei A100 mit je 80 GB, also das offizielle Minimum, für rund 6,55 Euro pro Stunde oder 2.618 Euro im Monatstarif, und zwei H100 mit je 80 GB für rund 6,66 Euro pro Stunde oder 4.617 Euro im Monat. Die H100 ist die neuere Generation, OVH bietet sie aber als PCIe-Variante an, die Modellkarte nennt die SXM5.
Wichtig: Das ist Hosting bei einem europäischen Anbieter, deine Daten liegen dann bei OVHcloud. Wer sie im eigenen Rechenzentrum halten muss, kauft die Hardware selbst; deren Preis ist hier nicht eingerechnet.
Zum Vergleich ein Rechenbeispiel mit Claude Sonnet 5.5, das Anthropic am 28. September vorgestellt hat. Laut Preisliste von Anthropic kostet es 2 US-Dollar pro Million Eingabe-Tokens und 10 Dollar pro Million Ausgabe-Tokens.
- Annahme: 500 E-Mails pro Tag, je 3.000 Tokens Eingabe und 800 Tokens Ausgabe inklusive Denkschritten, 30 Tage
- API: 45 Millionen Eingabe-Tokens (90 Dollar) plus 12 Millionen Ausgabe-Tokens (120 Dollar), zusammen 210 Dollar im Monat
- GPU-Server: netto 2.200 bis 3.880 Euro im Monat, selbst bei einem Kurs von eins zu eins gut das 10- bis 18-Fache
Rechnerisch kippt das Verhältnis erst bei rund 5.200 bis 9.200 solcher E-Mails pro Tag, vorausgesetzt, der Server schafft die Menge. Wer nicht sofort eine Antwort braucht, zahlt bei Anthropic über die Batch-Schnittstelle sogar nur die Hälfte. Beim Selbstbetrieb kommt Arbeitszeit für Updates und Überwachung dazu. Ein Testtag mit acht Stunden kostet 52 bis 53 Euro: Ausprobieren ist billig, Dauerbetrieb nicht.
Wann lohnt sich Kolibri für dein Unternehmen?
Wenn Datenhoheit mehr zählt als der Preis. Unsere Entscheidungshilfe:
| Situation | Unsere Empfehlung |
|---|---|
| Daten dürfen nicht zu einem KI-Anbieter, ein Server bei einem europäischen Hoster ist erlaubt | Kolibri auf gemietetem Server testen |
| Daten dürfen das eigene Rechenzentrum gar nicht verlassen | Kolibri auf eigener Hardware durchrechnen, Kaufpreis der GPUs inklusive |
| Tausende gleichartige Vorgänge pro Tag, rund um die Uhr | Kolibri gegen API durchrechnen |
| Einige hundert Vorgänge pro Tag, keine GPU-Erfahrung im Haus | bei einer KI-API bleiben |
| Anspruchsvolle Texte, Qualität geht vor | Spitzenmodell per API, Kolibri beobachten |
Im Blick behalten solltest du auch den Hersteller: Aleph Alpha hat laut eigener Mitteilung vom 5. Oktober eine Vereinbarung mit Cohere angekündigt, die noch behördlich genehmigt werden muss; bis zum Abschluss arbeitet das Unternehmen eigenständig. Die veröffentlichten Gewichte bleiben dank Apache-Lizenz nutzbar; wie es mit weiteren Versionen und Support weitergeht, ist offen.
Unsere Einschätzung: Für die meisten Automatisierungen im Mittelstand bleibt eine API vorerst günstiger und einfacher. Interessant wird Kolibri für sie, sobald ein europäischer Anbieter es mit Abrechnung pro Anfrage anbietet, denn dann fällt der Fixkostenblock weg.
Was heißt das für dich?
Ob Kolibri zu deinen Daten passt, klärst du mit einem kleinen Test statt mit einer Grundsatzdebatte:
- Wähle einen Prozess, bei dem Datenschutzbedenken den KI-Einsatz bisher bremsen, zum Beispiel Verträge, Personalunterlagen oder technische Spezifikationen.
- Sammle 30 echte, anonymisierte Beispiele samt richtiger Antwort.
- Miete einen GPU-Server für einen Tag, starte Kolibri per vLLM und lass alle Beispiele durchlaufen.
- Teste dieselben Beispiele mit einem API-Modell und, falls europäische Herkunft keine Pflicht ist, mit Qwen3.8 27B. Vergleiche Trefferquote, Antwortzeit und Kosten pro Fall.
- Entscheide erst dann: selbst betreiben, abwarten oder bei der API bleiben.
Wie automatisierte Abläufe mit KI in der Praxis aussehen, zeigen unsere Anwendungsfälle. Wenn du den Vergleich nicht selbst aufsetzen willst, unterstützen wir dich im Rahmen unserer KI-Automatisierung: Sprich uns an.
Häufige Fragen
Warum braucht Kolibri so viel Speicher, wenn pro Token nur 3,46 Milliarden Parameter rechnen?
Kolibri ist ein Mixture-of-Experts-Modell: Pro Schicht wählt es für jedes Token 6 von 384 spezialisierten Teilnetzen aus. Das spart Rechenzeit, doch alle 78 Milliarden Parameter müssen trotzdem im Speicher liegen, weil je nach Token andere Experten gefragt sind. Aleph Alpha beschreibt den Speicherbedarf selbst als Kehrseite der Architektur.
Darf ich Kolibri verändern und in eigene Produkte einbauen?
Die Apache-2.0-Lizenz erlaubt das, auch kommerziell und ohne Gebühr. Wer das Modell oder eine veränderte Fassung weitergibt, muss den Lizenztext beilegen, Urheberhinweise erhalten und geänderte Dateien kenntlich machen. Für den konkreten Fall lohnt trotzdem ein Blick der Rechtsabteilung.
Kennt Kolibri aktuelle Ereignisse?
Nein, sein eingebautes Wissen endet am 18. Juni 2026. Neuere oder firmeninterne Informationen bekommt es nur über Werkzeuge wie eine Suche oder angebundene Dokumente. Aleph Alpha sieht Kolibri zudem in Abläufen, in denen ein Mensch die Ergebnisse prüft, bevor gehandelt wird.
Ist ein selbst betriebenes KI-Modell automatisch DSGVO-konform?
Nein. Ob der Einsatz datenschutzkonform ist, hängt vom Betrieb ab: wo die Daten verarbeitet werden, wer Zugriff hat, was protokolliert wird. Aleph Alpha schreibt, man habe DSGVO und AI Act von Anfang an mitgedacht, und hat den EU-Verhaltenskodex für KI-Modelle mit allgemeinem Verwendungszweck unterzeichnet. Die Prüfung mit deinem Datenschutzbeauftragten ersetzt das nicht.
Läuft Kolibri auch auf kleinerer Hardware?
Offiziell nicht. Auf Hugging Face stehen zwar schon mehr als ein Dutzend quantisierte, also komprimierte Varianten aus der Community, die mit weniger Speicher auskommen sollen (Stand 5. Oktober). Weil Komprimierung Qualität kosten kann, würden wir sie nur nach einem direkten Vergleich mit der offiziellen Fassung produktiv einsetzen.
Quellen
Schreib mir, was du vorhast. Innerhalb von 24 Stunden bekommst du eine ehrliche Einschätzung.
Weitere Artikel