Chinesisches GLM-5-Modell von Zhipu AI fordert westliche Giganten heraus

Chinesisches GLM-5-Modell von Zhipu AI fordert westliche Giganten heraus

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
11. 2. 2026
5 Minuten Lesezeit
Chinesisches GLM-5-Modell von Zhipu AI fordert westliche Giganten heraus

Auf der Plattform OpenRouter tauchte ein Modell auf, über das niemand etwas wusste. Keine offizielle Ankündigung, kein Blogbeitrag, nur ein stiller Eintrag namens Pony Alpha. Das Modell konnte kostenlos genutzt werden und bot ein Kontextfenster von 200.000 Token mit einem maximalen Ausgabefenster von 131.000 Token, was selbst nach den Maßstäben des Jahres 2026 eine absurde Zahl war.

Innerhalb von vier Tagen verbrauchten die Nutzer 25 Milliarden Prompt-Token. Der Durchsatz lag bei etwa 17 bis 19 Token pro Sekunde. Die drei meistgenutzten Anwendungen waren Kilo Code (10 Milliarden Token), OpenClaw (8,59 Milliarden) und SillyTavern (2,83 Milliarden). Die Menschen nutzten das Modell für alles, vom Programmieren bis hin zu Rollenspielen.

Niemand wusste, wer es entwickelt hatte. Die Community begann nachzuforschen und deckte schließlich die Wahrheit auf: Pony Alpha war in Wirklichkeit GLM-5 des chinesischen Unternehmens Zhipu AI.

Zhipu AI und das Modell GLM-5

Das Unternehmen Zhipu AI (auch bekannt als Knowledge Atlas Technology JSC Ltd.) stellte sein Modell GLM-5 offiziell vor dem chinesischen Neujahrsfest 2026 vor. Es handelt sich um die fünfte Generation seiner GLM-Modellreihe, die an die erfolgreichen Modelle GLM-3 und GLM-4 anknüpft.

GLM-5 nutzt eine Mixture-of-Experts-Architektur (MoE) mit insgesamt 745 Milliarden Parametern, wobei für jedes Token nur etwa 44 Milliarden Parameter aktiviert werden. Diese Struktur bietet zwei wesentliche Vorteile: Die Latenz bis zum ersten Token ist mit Modellen mit 30–70 Milliarden Parametern vergleichbar, während das Modell zugleich bei langen Ausgaben stabil bleibt.

GLM-5 bringt deutliche Verbesserungen in mehreren Bereichen:

Logisches Denken: Das Modell verwendet häufiger eine Chain-of-Thought-Struktur (Gedankenkette), selbst wenn der Nutzer nicht ausdrücklich darum bittet. Wird es aufgefordert, seinen eigenen Plan zu kritisieren, kann es sich anpassen, ohne sich zu wiederholen oder in Schleifen zu geraten.

Programmierung: Das Modell bewältigt schrittweise Codeänderungen besser als vollständige Neufassungen. Wird es um eine Änderung im Diff-Stil gebeten, behält es den Kontext bei, anstatt den gesamten Code erneut auszugeben.

Agentisches Verhalten: Aufgaben nach Art von Tool-Aufrufen (Beschreibung der Schritte, Identifizierung fehlender Eingaben, Vorschlag von Wiederholungen) werden klarer und strukturierter ausgeführt.

Kreatives Schreiben: Die Kontrolle über die sprachliche Stimme wurde verbessert. Wenn der Nutzer einen Ton für den Text vorgibt, kann das Modell ihn über mehrere Seiten hinweg beibehalten.

Leistung und Geschwindigkeit

Das Modell GLM-5 zeigt bei unterschiedlichen Aufgaben eine stabile Leistung. Die Latenz bis zum ersten Token liegt bei kurzen Prompts unter einer Sekunde und bei komplexeren Anfragen mit mehrteiligen Anweisungen bei 1–2 Sekunden. Der anhaltende Durchsatz erreicht bei langen Antworten 30–60 Token pro Sekunde. Das Modell bricht nicht mitten in einem Absatz ab, wie es bei einigen MoE-Modellen unter Last vorkommt. Bei einem Kontext von etwa 8.000–16.000 Token bleiben die Ausgaben kohärent. Die MoE-Architektur stellt einen Kompromiss zwischen der Einfachheit dichter Modelle und einer Routing-Schicht dar, der sich im Idealfall bei gleicher Qualität durch höhere Geschwindigkeit und geringere Kosten auszahlt.

Zugriff über die API

Das Modell GLM-5 ist über die Plattform von Zhipu AI und einige Aggregatoren wie WaveSpeed verfügbar, das eine mit OpenAI kompatible Schnittstelle bereitstellt. Die Integration ist einfach – es müssen lediglich die Basis-URL und die Modellbezeichnung geändert werden.

Die Modell-ID ist im Modellkatalog als "glm-5" aufgeführt. Die Authentifizierung erfolgt mithilfe eines einzigen API-Schlüssels im standardmäßigen Authorization-Header. Die Ratenlimits werden in den Headern angezeigt, was bei der Abstimmung paralleler Anfragen hilfreich ist.

Für eine bessere Stabilität bei komplexen Prompts wird empfohlen, die Temperatur auf 0,5–0,7 zu senken. Dadurch werden Abschweifungen reduziert, ohne den Ton zu verflachen. Das standardmäßige Limit für Ausgabe-Token ist konservativ eingestellt. Wenn Antworten daher verkürzt werden, muss es erhöht werden.

Vergleich mit der Konkurrenz

Im Vergleich zur GPT-Reihe hält GLM-5 beim Schreiben und beim schrittweisen Schlussfolgern mit. Es macht in langen Gliederungen weniger Formatierungsfehler und bewältigt schrittweise Codeänderungen mit weniger unerwünschten Auswirkungen.

GLM-5 vs. GPT-5
GLM-5 vs. GPT-5

Gegenüber den Claude-Modellen ist GLM-5 bei faktenbasierten Überarbeitungen ähnlich vorsichtig und etwas eher bereit, unaufgefordert weitere Schritte vorzuschlagen. Nutzer, die Claude wegen seines Tons und seiner Sicherheitsstruktur bevorzugen, könnten es für sensible Inhalte weiterhin vorziehen.

Im Vergleich zu DeepSeek wirkt GLM-5 bei einzelnen Aufrufen ressourcenintensiver, ist jedoch bei mehrschichtigen Analysen stabiler. DeepSeek kann bei großen Mengen kleiner Anfragen Vorteile hinsichtlich der Kosteneffizienz haben, während GLM-5 für weniger, aber dafür tiefgehendere Aufrufe sinnvoll ist.

Einheimische Chips und Unabhängigkeit

Das Unternehmen Zhipu AI gab bekannt, dass sein Open-Source-Modell zur Bilderzeugung GLM-Image das erste hochmoderne multimodale Modell ist, dessen Training mithilfe von Ascend-Chips von Huawei Technologies abgeschlossen wurde. Das Modell basierte auf dem Server Huawei Ascend Atlas 800T A2 und dem Framework MindSpore. Diese Ankündigung stellt einen bedeutenden Meilenstein für Huawei dar, da kein anderes großes KI-Unternehmen in China öffentlich über einen erfolgreichen Trainingsprozess seiner Modelle auf einheimischen Chips berichtet hat. Nach der Aufnahme in die US-amerikanische schwarze Liste im Jahr 2025 intensivierte Zhipu AI seine Bemühungen um eine Zusammenarbeit mit einheimischen Chipherstellern, darunter Cambricon Technologies.

Der Schritt von Zhipu AI steht im Einklang mit Pekings Politik, die Abhängigkeit von ausländischem Fachwissen angesichts der mehrjährigen Kampagne der USA und ihrer Verbündeten zur Einschränkung des chinesischen Zugangs zu fortschrittlichen Technologien aus dem Westen zu verringern.

Einsatzmöglichkeiten des Modells GLM-5

Das Modell GLM-5 eignet sich für Nutzer, die bei Planung, Analyse und überarbeitungsintensivem Schreiben weniger Modelle und stabilere Ausgaben benötigen. Wer hingegen auf extrem günstige und extrem schnelle Mikroaufgaben optimiert, ist mit einem kleineren dichten Modell oder einer Option nach Art von DeepSeek möglicherweise besser bedient.

Verfügbarkeit: GLM-5 wird schrittweise eingeführt und ist über die Plattform von Zhipu sowie einige Aggregatoren zugänglich. Außerhalb Chinas können Latenz und Zugang je nach Anbieter variieren.

Kontextfenster: Arbeitsbereiche von etwa 8.000–16.000 Token erwiesen sich als stabil. Bei Arbeitsabläufen, die auf sehr lange Kontexte angewiesen sind, müssen die festen Limits in der Dokumentation geprüft werden.

Was besonders hervorstach, war nicht die rohe Leistung, sondern die Tatsache, dass das Modell keine ständige Überwachung erfordert. Das ist keine sensationelle Nachricht, sondern jene Art stiller Verbesserung, deren Vorteile sich im Laufe einer Woche summieren.

Quellen: wavespeed.ai und finance.yahoo.com

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

Altman verkündete die Singularität – wenige Tage, nachdem seine Modelle selbst aus dem Labor entkamenAltman verkündete die Singularität – wenige Tage, nachdem seine Modelle selbst aus dem Labor entkamen
OpenAI-Chef Sam Altman erklärte in einer Folge des Podcasts Relentless, die Menschheit sei bereits in die Singularität eingetreten. „Wir sind jetzt gewissermaßen in der Singularität“, sagte er wörtlich. Ein Begriff, der jahrzehntelang eher zur Science-Fiction gehörte
6 Min. Lesezeit
28. 7. 2026
KI remixte Madonnas Song – jetzt führt er Australiens Charts an. Musiker sind empört.KI remixte Madonnas Song – jetzt führt er Australiens Charts an. Musiker sind empört.
Australische Radios spielen seit April Madonnas Dance-Version von Like a Prayer in Dauerschleife. Veröffentlicht vom Queensland-DJ Josh Fawaz, führt sie die Radiocharts an und hat auf Spotify 35 Millionen Streams.
5 Min. Lesezeit
28. 7. 2026
Claude Opus 5 hat einen Shooter von Grund auf programmiert. Was kann Claude of Duty?Claude Opus 5 hat einen Shooter von Grund auf programmiert. Was kann Claude of Duty?
Der Ego-Shooter läuft direkt im Browser, bietet eine eigene Physik und elf separate Codebereiche. Insgesamt rund 55.000 Zeilen, verteilt auf elf Subsysteme und aufgebaut auf Thr
4 Min. Lesezeit
28. 7. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok