Im Quellenvergleich
Worin die Quellen übereinstimmen
Aleph Alpha hat das Sprachmodell Kolibri veröffentlicht. Es nutzt eine Mixture-of-Experts-Architektur mit rund 78 Milliarden Parametern, von denen pro Token etwa 3 bis 3,5 Milliarden aktiv sind. Das Modell versteht Deutsch und Englisch und verarbeitet Kontexte bis zu einer Million Tokens. Die Gewichte stehen auf Hugging Face unter der Apache-2.0-Lizenz bereit. Trainiert wurde auf 768 Nvidia B200-GPUs in Deutschland und Finnland. Aleph Alpha positioniert Kolibri für Unternehmen, Behörden und regulierte Bereiche mit Betrieb auf eigener Infrastruktur. Für synthetische Trainingsdaten kamen auch externe Modelle zum Einsatz. Die Quellen berichten weitgehend übereinstimmend.
Worin sie sich unterscheidenAnteil der deutschsprachigen Trainingsdaten·Leistungsvergleich mit anderen Modellen·Umfang der Apache-2.0-Lizenz+6 weitere
Anteil der deutschsprachigen Trainingsdaten- 21,3 Prozent der Trainingsdaten sind Deutsch.1
- Rund 23 Prozent der Pretraining-Tokens sind deutschsprachig.2
- Der Blog nennt 21,3 Prozent Deutsch nach Überabtastung.3
Leistungsvergleich mit anderen Modellen- Kolibri liegt in beiden Sprachen auf der Pareto-Front von Qualität und Betriebskosten; kein vergleichbares Modell liefere bei gleichen Kosten mehr Qualität oder gleiche Qualität günstiger.1
- Die Architektur erreicht eine mit größeren Modellen vergleichbare Leistung bei geringerem Rechenaufwand; eine unabhängige Bestätigung fehlt bislang.2
- Kolibri erreicht 75,5 auf Englisch und 70,8 auf Deutsch, liegt aber bei SWE-Bench Verified mit 66,4 hinter Qwen3.6 35B-A3B (73,8) und bei der Faktenkorrektur mit 34,0 weit hinter Nemotron 3 Super (90,0).3
Umfang der Apache-2.0-Lizenz- Die Lizenz gilt nicht für den zugrunde liegenden Code, die Modellarchitektur und die Trainingsmethoden.2
- Apache 2.0 gewährt unwiderrufliche Rechte an den Gewichten, aber keine Garantie für Folgeversionen, Wartung oder Support; die Rechte gelten nur für Gewichte und Konfigurationsdateien, nicht für Architektur, Trainingsmethoden oder Code.3
Empfohlene Kontextlänge- Aleph Alpha gibt an, die Qualität bis 1.048.576 Token validiert zu haben, empfiehlt aber höchstens 262.144 Token für latenz- oder durchsatzempfindliche Einsätze.3
Trainingsdauer und Rechenaufwand- Trainiert wurde auf 768 Nvidia B200 über 21 Tage und 392.000 GPU-Stunden; der Stromverbrauch wird auf 950 MWh geschätzt.3
Eingesetzte externe Modelle für synthetische Daten- Für synthetische Trainingsdaten nutzte Aleph Alpha auch externe Modelle, im technischen Bericht genannt: GLM-5.2 und GLM-5.3 von Z.ai sowie Qwen3.8-27B.2
Datenfilterung- Alle Trainingsdaten seien mit einer Sperrliste von mehr als 4,5 Millionen URLs abgeglichen worden, die unter anderem auf der Piracy Watch List der Europäischen Kommission basiert.2
Zusammenschluss mit Cohere- Im September 2026 vereinbarte Aleph Alpha einen Zusammenschluss mit dem kanadischen KI-Unternehmen Cohere; das gemeinsame Unternehmen soll weltweit als Cohere auftreten.2
- Der Artikel ordnet die Veröffentlichung vor dem Hintergrund eines am 16. September unterzeichneten Zusammenschlusses mit dem kanadischen Unternehmen Cohere ein; das Gemeinschaftsunternehmen soll unter dem Namen Cohere mit Doppelsitz in Berlin und Toronto firmieren.3
Erwähnung von Cohere im Blogbeitrag- Der Blogbeitrag erwähnt Cohere nicht und betont, das Modell sei in Deutschland gebaut und unter europäischem Recht ohne ausländische Kontrolle trainiert worden.3