Ornith-1.5-35B-A3B: MoE-Modell als Sweet Spot für 8 GB VRAM
Der Reddit-Nutzer Elemental_Particle hatte wenige Tage zuvor in r/LocalLLaMA nach dem besten lokalen Modell für 8 GB VRAM gefragt und war damals mit Qwen3.6-35B-A3B auf Pi.dev zufrieden. Aufgrund von Community-Hinweisen wechselte er zu Ornith-1.5-35B-A3B in der Quantisierung Q4_K_M, die er über Unsloth Studio auf seinem System betreibt. Hardware-seitig setzt er auf einen Intel Core i7-11800H, 32 GB DDR4-RAM und eine NVIDIA RTX 3070 Laptop-GPU mit 8 GB VRAM unter openSUSE Tumbleweed mit KDE-Desktop. Ornith-1.5-35B-A3B ist ein Mixture-of-Experts-Modell mit 35 Milliarden Gesamtparametern, von denen bei jedem Token nur rund 3 Milliarden aktiv sind – das erlaubt den geringen VRAM-Bedarf trotz hoher Parameteranzahl. Bei einem komplexen Code-Analyse-Auftrag erreichte das Modell im Schnitt rund 32 Tokens pro Sekunde und lieferte laut Bericht nahezu fehlerfreie Ergebnisse. Gegenüber dem vorherigen Favoriten Qwen3.6-35B-A3B sieht der Nutzer nicht nur einen Geschwindigkeitsvorteil, sondern vor allem eine bessere Handhabung mehrstufiger agentischer Workflows. Das 128K-Kontextfenster bleibt dabei vollständig erhalten, was für längere Codebasen-Analysen entscheidend ist.
- System-Stack: Unsloth Studio als Inference-Backend, Pi.dev als agentisches Coding-Interface auf openSUSE Tumbleweed / KDE.
- Quantisierung Q4_K_M: Ermöglicht das vollständige Laden des Modells in 8 GB VRAM durch reduzierten Speicherbedarf bei moderatem Qualitätsverlust.
- Vergleichsbasis: Nutzer hat nach eigenen Angaben Dutzende Modelle verschiedener Parametergrößen, Architekturen (MoE und Dense) sowie Coding-Fine-Tunes getestet.
- Agentische Workflow-Qualität wird als entscheidenderer Faktor gegenüber roher Tokengeschwindigkeit hervorgehoben — nicht nur Speed-Vorteil gegenüber Qwen3.6.
- Nutzer schränkt explizit ein, dass die Einschätzung hardware- und use-case-spezifisch ist und angesichts des schnellen Modell-Release-Rhythmus kurzfristig überholt sein kann.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Ornith-1.5-35B-A3B: MoE-Modell als Sweet Spot für 8 GB VRAM
Der Reddit-Nutzer Elemental_Particle hatte wenige Tage zuvor in r/LocalLLaMA nach dem besten lokalen Modell für 8 GB VRAM gefragt und war damals mit Qwen3.6-35B-A3B auf Pi.dev zufrieden. Aufgrund von Community-Hinweisen wechselte er zu Ornith-1.5-35B-A3B in der Quantisierung Q4_K_M, die er über Unsloth Studio auf seinem System betreibt. Hardware-seitig setzt er auf einen Intel Core i7-11800H, 32 GB DDR4-RAM und eine NVIDIA RTX 3070 Laptop-GPU mit 8 GB VRAM unter openSUSE Tumbleweed mit KDE-Desktop. Ornith-1.5-35B-A3B ist ein Mixture-of-Experts-Modell mit 35 Milliarden Gesamtparametern, von denen bei jedem Token nur rund 3 Milliarden aktiv sind – das erlaubt den geringen VRAM-Bedarf trotz hoher Parameteranzahl. Bei einem komplexen Code-Analyse-Auftrag erreichte das Modell im Schnitt rund 32 Tokens pro Sekunde und lieferte laut Bericht nahezu fehlerfreie Ergebnisse. Gegenüber dem vorherigen Favoriten Qwen3.6-35B-A3B sieht der Nutzer nicht nur einen Geschwindigkeitsvorteil, sondern vor allem eine bessere Handhabung mehrstufiger agentischer Workflows. Das 128K-Kontextfenster bleibt dabei vollständig erhalten, was für längere Codebasen-Analysen entscheidend ist.
- System-Stack: Unsloth Studio als Inference-Backend, Pi.dev als agentisches Coding-Interface auf openSUSE Tumbleweed / KDE.
- Quantisierung Q4_K_M: Ermöglicht das vollständige Laden des Modells in 8 GB VRAM durch reduzierten Speicherbedarf bei moderatem Qualitätsverlust.
- Vergleichsbasis: Nutzer hat nach eigenen Angaben Dutzende Modelle verschiedener Parametergrößen, Architekturen (MoE und Dense) sowie Coding-Fine-Tunes getestet.
- Agentische Workflow-Qualität wird als entscheidenderer Faktor gegenüber roher Tokengeschwindigkeit hervorgehoben — nicht nur Speed-Vorteil gegenüber Qwen3.6.
- Nutzer schränkt explizit ein, dass die Einschätzung hardware- und use-case-spezifisch ist und angesichts des schnellen Modell-Release-Rhythmus kurzfristig überholt sein kann.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.