Ornith-1.5-35B-A3B MoE läuft mit 60 t/s auf RTX 4070 Ti
Reddit-Nutzer Seraphym87 hat eine detaillierte Konfiguration veröffentlicht, mit der das Mixture-of-Experts-Modell Ornith-1.5-35B-A3B in der Q4_K_M-Quantisierung auf einer RTX 4070 Ti mit 12 GB VRAM alltagstauglich betrieben wird. Das Modell basiert auf der qwen3_5_moe-Architektur mit rund 36 Milliarden Gesamtparametern, von denen jeweils nur etwa 3 Milliarden aktiv sind – ein entscheidender Vorteil für Consumer-Hardware. Die Gewichte umfassen insgesamt ~20 GB, weshalb die GPU allein nicht ausreicht: Der Trick liegt im llama.cpp-Flag --n-cpu-moe 28, das 28 MoE-Schichten in den Systemarbeitsspeicher auslagert und so die 12-GB-VRAM-Grenze umgeht. Mit 27 ins GPU-VRAM geladenen Experten verbleiben laut dem Post etwa 1 GB Overhead für den KV-Cache, der seinerseits mit q8_0 komprimiert wird. Als Reasoning-Modell gibt Ornith-1.5-35B-A3B sogenannte <think>-Blöcke aus, ähnlich wie DeepSeek-R1-Varianten, und unterstützt nativ 256K Kontext – durch YaRN sogar erweiterbar. Für beschleunigtes Decoding setzt der Nutzer MTP-Spekulation (--spec-type draft-mtp) mit maximal 2 Draft-Tokens ein, was eine Akzeptanzrate von 42–48 % und eine mittlere Draft-Länge von ~1,9 ergibt. Das Setup läuft unter Windows 11 mit llama.cpp Build b10470 und CUDA 12.4.
- CPU: Intel i9-13900KF (8 P-Cores + 16 E-Cores, 24C/32T), RAM 32 GB DDR5-6000 — System-RAM ist Flaschenhals für die ausgelagerten MoE-Schichten.
- llama-bench-Messung: Bei n_cpu_moe=26 erreicht das Modell 64,9 ± 0,2 t/s (tg128) und 571 ± 23 t/s Prefill (pp2048) — mehr VRAM-Nutzung steigert Generation, senkt Prefill.
- Effektiver Kontext im Praxisbetrieb auf 32.768 Token begrenzt (statt nativer 256K), da der KV-Cache sonst den verbleibenden VRAM-Overhead aufbraucht.
- MTP-Spekulation liefert im Aquarium-Prompt-Test 50–56 t/s sustained Generation, während Prefill mit 650–700 t/s deutlich schneller läuft.
- Modell ist als multimodal deklariert, wird im Post jedoch mit --no-mmproj ohne Bildprojektionsmodul gestartet, um VRAM zu sparen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Ornith-1.5-35B-A3B MoE läuft mit 60 t/s auf RTX 4070 Ti
Reddit-Nutzer Seraphym87 hat eine detaillierte Konfiguration veröffentlicht, mit der das Mixture-of-Experts-Modell Ornith-1.5-35B-A3B in der Q4_K_M-Quantisierung auf einer RTX 4070 Ti mit 12 GB VRAM alltagstauglich betrieben wird. Das Modell basiert auf der qwen3_5_moe-Architektur mit rund 36 Milliarden Gesamtparametern, von denen jeweils nur etwa 3 Milliarden aktiv sind – ein entscheidender Vorteil für Consumer-Hardware. Die Gewichte umfassen insgesamt ~20 GB, weshalb die GPU allein nicht ausreicht: Der Trick liegt im llama.cpp-Flag --n-cpu-moe 28, das 28 MoE-Schichten in den Systemarbeitsspeicher auslagert und so die 12-GB-VRAM-Grenze umgeht. Mit 27 ins GPU-VRAM geladenen Experten verbleiben laut dem Post etwa 1 GB Overhead für den KV-Cache, der seinerseits mit q8_0 komprimiert wird. Als Reasoning-Modell gibt Ornith-1.5-35B-A3B sogenannte <think>-Blöcke aus, ähnlich wie DeepSeek-R1-Varianten, und unterstützt nativ 256K Kontext – durch YaRN sogar erweiterbar. Für beschleunigtes Decoding setzt der Nutzer MTP-Spekulation (--spec-type draft-mtp) mit maximal 2 Draft-Tokens ein, was eine Akzeptanzrate von 42–48 % und eine mittlere Draft-Länge von ~1,9 ergibt. Das Setup läuft unter Windows 11 mit llama.cpp Build b10470 und CUDA 12.4.
- CPU: Intel i9-13900KF (8 P-Cores + 16 E-Cores, 24C/32T), RAM 32 GB DDR5-6000 — System-RAM ist Flaschenhals für die ausgelagerten MoE-Schichten.
- llama-bench-Messung: Bei n_cpu_moe=26 erreicht das Modell 64,9 ± 0,2 t/s (tg128) und 571 ± 23 t/s Prefill (pp2048) — mehr VRAM-Nutzung steigert Generation, senkt Prefill.
- Effektiver Kontext im Praxisbetrieb auf 32.768 Token begrenzt (statt nativer 256K), da der KV-Cache sonst den verbleibenden VRAM-Overhead aufbraucht.
- MTP-Spekulation liefert im Aquarium-Prompt-Test 50–56 t/s sustained Generation, während Prefill mit 650–700 t/s deutlich schneller läuft.
- Modell ist als multimodal deklariert, wird im Post jedoch mit --no-mmproj ohne Bildprojektionsmodul gestartet, um VRAM zu sparen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.