JetBrains Mellum 2: 12B-MoE-Modell erreicht 111 t/s auf Consumer-GPU
Warum es zählt
Das Modell übertrifft in diesem informellen Test Qwen 3.5-9B bei der Inferenzgeschwindigkeit (~30 t/s) deutlich und besteht Tool-Call-Aufgaben, an denen größere Modelle (gemma4-12b, gpt-oss-20b) scheitern – relevant für lokale Coding-Assistenten auf Mid-Range-Hardware.
— Lumeric Redaktion
111 t/s
Token-Generierung auf AMD RX 7900 XT
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com0mo
Ling 3.0 Tiny 8B: 36 Token/s auf Low-End-PC mit nur 4 GB VRAM
- FORSCHUNGreddit.com8h
CPU-native LLM-Architektur erreicht 100+ tok/s bei 10B Parametern ohne GPU
- LAUNCHreddit.com2d
Aurora 1.0-150M: Kleines Open-Source-Sprachmodell auf GPT-2-Small-Niveau
- MEINUNGreddit.com1w
ExLlamaV3: Community lobt unterschätzte Inferenz-Engine für NVIDIA
JetBrains Mellum 2: 12B-MoE-Modell erreicht 111 t/s auf Consumer-GPU
Warum es zählt
Das Modell übertrifft in diesem informellen Test Qwen 3.5-9B bei der Inferenzgeschwindigkeit (~30 t/s) deutlich und besteht Tool-Call-Aufgaben, an denen größere Modelle (gemma4-12b, gpt-oss-20b) scheitern – relevant für lokale Coding-Assistenten auf Mid-Range-Hardware.
— Lumeric Redaktion
111 t/s
Token-Generierung auf AMD RX 7900 XT
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com0mo
Ling 3.0 Tiny 8B: 36 Token/s auf Low-End-PC mit nur 4 GB VRAM
- FORSCHUNGreddit.com8h
CPU-native LLM-Architektur erreicht 100+ tok/s bei 10B Parametern ohne GPU
- LAUNCHreddit.com2d
Aurora 1.0-150M: Kleines Open-Source-Sprachmodell auf GPT-2-Small-Niveau
- MEINUNGreddit.com1w
ExLlamaV3: Community lobt unterschätzte Inferenz-Engine für NVIDIA