Ornith-1.5 9B überzeugt bei Coding-Aufgaben auf Low-End-Hardware
Der Reddit-Nutzer /u/zippydazoop betreibt einen Mid-Range-Gaming-Laptop aus 2024 mit lediglich 4 GB VRAM und 16 GB RAM – ein Setup, das die Auswahl lauffähiger lokaler Modelle stark einschränkt. Sein selbst zusammengestellter Benchmark umfasst 6 praxisnahe Scripting-Aufgaben aus dem Bereich medizinische Physik-Forschung, die er regelmäßig zur Evaluierung neuer Modelle nutzt. Im direkten Vergleich schnitt Ornith-1.5 9B mit 5 von 6 gelösten Aufgaben im ersten Versuch deutlich besser ab als alle zuvor getesteten Modelle. Besonders hervorgehoben wird, dass das Modell bei der einzigen nicht sofort gelösten Aufgabe konstruktives Feedback annahm und den Code daraufhin eigenständig verbesserte – ein Verhalten, das keines der anderen getesteten Modelle zeigte. Konkret verglichen wurden Ling-3.0 Tiny, Qwen 3.5 4B sowie Emperos 2B- und 4B-Distill-Varianten, die alle nur 3/6 oder schlechter erreichten. Erwähnt wird auch eine „Car-Wash-Frage", die Ornith-1.5 9B als einziges Modell korrekt beantwortete – vermutlich ein Reasoning- oder Logik-Test aus dem Benchmark-Set. Der Post spiegelt eine wachsende Community-Praxis wider, Modelle nicht anhand standardisierter Leaderboard-Benchmarks, sondern anhand eigener, domänenspezifischer Alltagsaufgaben zu bewerten.
- Testgerät: Mid-Range-Gaming-Laptop aus 2024, 4 GB VRAM, 16 GB RAM – läuft nur kleine Modelle mit niedrigem Token/s-Durchsatz.
- Einsatzgebiet der Benchmarks: Skript-Generierung für medizinische Physik-Forschung, Ergebnisse werden vor Nutzung manuell verifiziert.
- Ornith-1.5 9B ist das einzige getestete Modell, das bei einer fehlgeschlagenen Aufgabe Feedback aufnahm und den Code gezielt verbesserte.
- Die sogenannte 'Car-Wash-Frage' wurde nur von Ornith-1.5 9B korrekt beantwortet – alle anderen Modelle scheiterten daran.
- Empero-Distills wurden in zwei Größen getestet (2B und 4B), beide erreichten lediglich 3/6 Aufgaben.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Ornith-1.5 9B überzeugt bei Coding-Aufgaben auf Low-End-Hardware
Der Reddit-Nutzer /u/zippydazoop betreibt einen Mid-Range-Gaming-Laptop aus 2024 mit lediglich 4 GB VRAM und 16 GB RAM – ein Setup, das die Auswahl lauffähiger lokaler Modelle stark einschränkt. Sein selbst zusammengestellter Benchmark umfasst 6 praxisnahe Scripting-Aufgaben aus dem Bereich medizinische Physik-Forschung, die er regelmäßig zur Evaluierung neuer Modelle nutzt. Im direkten Vergleich schnitt Ornith-1.5 9B mit 5 von 6 gelösten Aufgaben im ersten Versuch deutlich besser ab als alle zuvor getesteten Modelle. Besonders hervorgehoben wird, dass das Modell bei der einzigen nicht sofort gelösten Aufgabe konstruktives Feedback annahm und den Code daraufhin eigenständig verbesserte – ein Verhalten, das keines der anderen getesteten Modelle zeigte. Konkret verglichen wurden Ling-3.0 Tiny, Qwen 3.5 4B sowie Emperos 2B- und 4B-Distill-Varianten, die alle nur 3/6 oder schlechter erreichten. Erwähnt wird auch eine „Car-Wash-Frage", die Ornith-1.5 9B als einziges Modell korrekt beantwortete – vermutlich ein Reasoning- oder Logik-Test aus dem Benchmark-Set. Der Post spiegelt eine wachsende Community-Praxis wider, Modelle nicht anhand standardisierter Leaderboard-Benchmarks, sondern anhand eigener, domänenspezifischer Alltagsaufgaben zu bewerten.
- Testgerät: Mid-Range-Gaming-Laptop aus 2024, 4 GB VRAM, 16 GB RAM – läuft nur kleine Modelle mit niedrigem Token/s-Durchsatz.
- Einsatzgebiet der Benchmarks: Skript-Generierung für medizinische Physik-Forschung, Ergebnisse werden vor Nutzung manuell verifiziert.
- Ornith-1.5 9B ist das einzige getestete Modell, das bei einer fehlgeschlagenen Aufgabe Feedback aufnahm und den Code gezielt verbesserte.
- Die sogenannte 'Car-Wash-Frage' wurde nur von Ornith-1.5 9B korrekt beantwortet – alle anderen Modelle scheiterten daran.
- Empero-Distills wurden in zwei Größen getestet (2B und 4B), beide erreichten lediglich 3/6 Aufgaben.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.