Project Maya ermöglicht GLM-5.3-Flash (321B) auf Consumer-Hardware
Warum es zählt
Nutzer berichten von 30+ tok/s auf einer RTX 5090 und bis zu 118 tok/s auf vier RTX 4090s – damit wird ein Frontier-Scale-MoE-Modell erstmals praktisch lokal nutzbar. Die OpenAI- und Anthropic-kompatible API macht es direkt für Coding-Agents einsetzbar.
— Lumeric Redaktion
118 tok/s
auf vier RTX 4090s (GLM-5.3-Flash, 321B)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Project Maya ermöglicht GLM-5.3-Flash (321B) auf Consumer-Hardware
Warum es zählt
Nutzer berichten von 30+ tok/s auf einer RTX 5090 und bis zu 118 tok/s auf vier RTX 4090s – damit wird ein Frontier-Scale-MoE-Modell erstmals praktisch lokal nutzbar. Die OpenAI- und Anthropic-kompatible API macht es direkt für Coding-Agents einsetzbar.
— Lumeric Redaktion
118 tok/s
auf vier RTX 4090s (GLM-5.3-Flash, 321B)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.