Qwen3.8-27B (HauhauCS) auf RTX 4090: 262K Kontext bei ~130 tok/s
CompaniesPerplexity
Warum es zählt
Der Konverter zeigt, dass GGUF-Only-Modelle mit minimalem Qualitätsverlust in alternative Inference-Engines portiert werden können. Für Entwickler bedeutet das: volles natives Kontextfenster und deutlich höherer Durchsatz (130 vs. 91,6 tok/s) auf Consumer-Hardware ohne Cloud-Abhängigkeit.
— Lumeric Redaktion
~130 tok/s
Decode-Speed auf RTX 4090 bei 262K Kontext
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.8-27B (HauhauCS) auf RTX 4090: 262K Kontext bei ~130 tok/s
CompaniesPerplexity
Warum es zählt
Der Konverter zeigt, dass GGUF-Only-Modelle mit minimalem Qualitätsverlust in alternative Inference-Engines portiert werden können. Für Entwickler bedeutet das: volles natives Kontextfenster und deutlich höherer Durchsatz (130 vs. 91,6 tok/s) auf Consumer-Hardware ohne Cloud-Abhängigkeit.
— Lumeric Redaktion
~130 tok/s
Decode-Speed auf RTX 4090 bei 262K Kontext
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.