Community-Benchmark: Qwen3.6 27b vs. Ornith 35b vs. Gemma4 26b auf RTX 3090
Der Reddit-Nutzer nutzte das Framework inspect-ai mit dem inspect-evals-Paket, um reproduzierbare, standardisierte Benchmarks lokal durchzuführen – ein Ansatz, der im LocalLLaMA-Umfeld selten systematisch umgesetzt wird. Getestet wurden jeweils nur 100 Samples pro Benchmark mit aggressiven Token-Limits, um die Laufzeit auf Consumer-Hardware realistisch zu halten. Die Modelle liefen alle über LM Studio: Qwen3.6 27b und Gemma4 26b als lmstudio-community-Builds (Q4_K_M bzw. Q4_0 QAT), Ornith 1.0 35b MoE (Q4_K_M) vom deepreinforce-ai-Account auf Hugging Face. Im Bereich Allgemeinwissen und Reasoning gewinnt Qwen3.6 27b in 4 von 6 Kategorien, darunter klar bei MMLU 0-Shot (0.88 vs. 0.91 für Ornith) – wobei Ornith hier sogar knapp besser abschneidet. Bei Grounding und Recall (DROP, NIAH) liegt Ornith vorne, allerdings wurde NIAH auf 100.000 Token Max-Kontext gedeckelt, weil Qwens Prompt-Processing bei höheren Kontexten zu langsam war. Im Coding-Bereich dominiert Qwen durchgehend: Bei DS-1000 erzielt Qwen 0.66, Ornith 0.48, Gemma 0.34. Gemma4 26b fiel durch häufige Infinite-Loop-Probleme bei scicode und MMLU auf, was seine Ergebnisse in diesen Kategorien unzuverlässig macht. Agentic Benchmarks – Ornith 35bs erklärte Stärke laut Modellkarte – konnte der Tester bisher nicht erfolgreich zum Laufen bringen.
- Alle drei Modelle liefen in Q4-Quantisierung auf einer RTX 3090; Ornith 35b als MoE-Architektur passt trotz nominell größerer Parameterzahl auf die GPU.
- Gemma4 26b erzielte bei mmlu_0_shot nur 0.54 gegenüber 0.88/0.91 für Qwen/Ornith – vermutlich wegen Timeout-/Loop-Problemen, nicht echter Schwäche.
- Bei arc_challenge lagen alle drei Modelle innerhalb von 0.01 Punkten (0.97–0.98), was auf Sättigung bei diesem Benchmark hindeutet.
- Der NIAH-Test (Needle in a Haystack) wurde auf 100.000 Token Kontext begrenzt, weil Qwens Prefill-Geschwindigkeit bei größeren Kontexten einen fairen Vergleich verhinderte.
- Ornith wird von seinen Entwicklern als besonders stark in Agentic Tasks vermarktet, doch der Tester konnte die entsprechenden inspect-evals-Benchmarks bislang nicht erfolgreich ausführen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Community-Benchmark: Qwen3.6 27b vs. Ornith 35b vs. Gemma4 26b auf RTX 3090
Der Reddit-Nutzer nutzte das Framework inspect-ai mit dem inspect-evals-Paket, um reproduzierbare, standardisierte Benchmarks lokal durchzuführen – ein Ansatz, der im LocalLLaMA-Umfeld selten systematisch umgesetzt wird. Getestet wurden jeweils nur 100 Samples pro Benchmark mit aggressiven Token-Limits, um die Laufzeit auf Consumer-Hardware realistisch zu halten. Die Modelle liefen alle über LM Studio: Qwen3.6 27b und Gemma4 26b als lmstudio-community-Builds (Q4_K_M bzw. Q4_0 QAT), Ornith 1.0 35b MoE (Q4_K_M) vom deepreinforce-ai-Account auf Hugging Face. Im Bereich Allgemeinwissen und Reasoning gewinnt Qwen3.6 27b in 4 von 6 Kategorien, darunter klar bei MMLU 0-Shot (0.88 vs. 0.91 für Ornith) – wobei Ornith hier sogar knapp besser abschneidet. Bei Grounding und Recall (DROP, NIAH) liegt Ornith vorne, allerdings wurde NIAH auf 100.000 Token Max-Kontext gedeckelt, weil Qwens Prompt-Processing bei höheren Kontexten zu langsam war. Im Coding-Bereich dominiert Qwen durchgehend: Bei DS-1000 erzielt Qwen 0.66, Ornith 0.48, Gemma 0.34. Gemma4 26b fiel durch häufige Infinite-Loop-Probleme bei scicode und MMLU auf, was seine Ergebnisse in diesen Kategorien unzuverlässig macht. Agentic Benchmarks – Ornith 35bs erklärte Stärke laut Modellkarte – konnte der Tester bisher nicht erfolgreich zum Laufen bringen.
- Alle drei Modelle liefen in Q4-Quantisierung auf einer RTX 3090; Ornith 35b als MoE-Architektur passt trotz nominell größerer Parameterzahl auf die GPU.
- Gemma4 26b erzielte bei mmlu_0_shot nur 0.54 gegenüber 0.88/0.91 für Qwen/Ornith – vermutlich wegen Timeout-/Loop-Problemen, nicht echter Schwäche.
- Bei arc_challenge lagen alle drei Modelle innerhalb von 0.01 Punkten (0.97–0.98), was auf Sättigung bei diesem Benchmark hindeutet.
- Der NIAH-Test (Needle in a Haystack) wurde auf 100.000 Token Kontext begrenzt, weil Qwens Prefill-Geschwindigkeit bei größeren Kontexten einen fairen Vergleich verhinderte.
- Ornith wird von seinen Entwicklern als besonders stark in Agentic Tasks vermarktet, doch der Tester konnte die entsprechenden inspect-evals-Benchmarks bislang nicht erfolgreich ausführen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.