FlightSimulatorBench: Small-MoE-Modelle im HTML-Codegen-Vergleich
Der Reddit-User /u/JLeonsarmiento hat einen selbst entwickelten Benchmark namens FlightSimulatorBench in einer überarbeiteten Version vorgestellt, die sich auf kleine MoE- (Mixture-of-Experts) und Dense-Modelle konzentriert. Die Aufgabe ist bewusst anspruchsvoll: Jedes Modell soll auf einen einzigen Prompt hin einen vollständigen, lauffähigen Flugsimulator als eine einzige HTML-Datei generieren – mit prozeduralem Terrain, Bergen und Wolken. Als Testinfrastruktur kommt der Harness „Pi" zum Einsatz, während die Inferenz über oMLX auf Apple-Silicon-Macs mit 48 GB Unified Memory läuft. Die genutzten Modell-Quantisierungen stammen aus einer eigens kuratierten HuggingFace-Collection des Autors für 48-GB-Macs. Die Testmethodik ist streng: Produziert ein Modell eine nicht funktionierende HTML-Datei, wird die Sitzung vollständig zurückgesetzt und das Modell muss von vorne beginnen – maximal drei Versuche sind erlaubt. Die Inferenzparameter unterscheiden sich je nach Modell-Familie merklich: Qwen3.6- und HuiHui-Varianten laufen mit niedrigerer Temperatur (0,6), während Ornith-35B und Gemma-4-26B mit Temperatur 1,0 und unterschiedlichen Top-K-Werten betrieben werden. Agents-A1 verwendet eine mittlere Temperatur von 0,85. Insgesamt werden sieben Konfigurationen verglichen, darunter Qwen3.6-MoE in zwei Quantisierungsstufen (4-bit und 6-bit) sowie der Fine-Tune HuiHui-Qwen3.6-MoE.
- Sieben Modell-Konfigurationen getestet: Qwen3.6-27B (4-bit), Qwen3.6-MoE (6-bit & 4-bit), Ornith-35B (6-bit), Gemma-4-26B (6-bit), HuiHui-Qwen3.6-MoE (6-bit), Agents-A1 (6-bit).
- Strenge Pass/Fail-Methodik: Bei nicht funktionierender HTML-Datei kompletter Session-Reset, maximal 3 Versuche pro Modell.
- Repeat-Penalty variiert je Modellfamilie: Gemma-4 erhält mit 1,1 den höchsten Wert, alle anderen liegen bei 1,05.
- Alle Quants stammen aus der HuggingFace-Collection leonsarmiento/local-sota-for-48gb-macs, die explizit für 48-GB-Apple-Silicon optimiert ist.
- Inferenz läuft über das Framework oMLX, Testergebnisse werden als animierte GIFs dokumentiert.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com0mo
Mimir: Dänisches 1,7B-Modell schlägt Qwen und Gemma auf Benchmarks
- MEINUNGreddit.com6d
Diskussion: Kleine smarte Modelle vs. große effiziente Modelle für lokale LLMs
- BENCHMARKreddit.com3w
Ornith-1.5 9B überzeugt bei Coding-Aufgaben auf Low-End-Hardware
- MEINUNGreddit.com1w
Community-Diskussion: IFM K2-Horizon-MoVA-36B-A4B im Praxistest
FlightSimulatorBench: Small-MoE-Modelle im HTML-Codegen-Vergleich
Der Reddit-User /u/JLeonsarmiento hat einen selbst entwickelten Benchmark namens FlightSimulatorBench in einer überarbeiteten Version vorgestellt, die sich auf kleine MoE- (Mixture-of-Experts) und Dense-Modelle konzentriert. Die Aufgabe ist bewusst anspruchsvoll: Jedes Modell soll auf einen einzigen Prompt hin einen vollständigen, lauffähigen Flugsimulator als eine einzige HTML-Datei generieren – mit prozeduralem Terrain, Bergen und Wolken. Als Testinfrastruktur kommt der Harness „Pi" zum Einsatz, während die Inferenz über oMLX auf Apple-Silicon-Macs mit 48 GB Unified Memory läuft. Die genutzten Modell-Quantisierungen stammen aus einer eigens kuratierten HuggingFace-Collection des Autors für 48-GB-Macs. Die Testmethodik ist streng: Produziert ein Modell eine nicht funktionierende HTML-Datei, wird die Sitzung vollständig zurückgesetzt und das Modell muss von vorne beginnen – maximal drei Versuche sind erlaubt. Die Inferenzparameter unterscheiden sich je nach Modell-Familie merklich: Qwen3.6- und HuiHui-Varianten laufen mit niedrigerer Temperatur (0,6), während Ornith-35B und Gemma-4-26B mit Temperatur 1,0 und unterschiedlichen Top-K-Werten betrieben werden. Agents-A1 verwendet eine mittlere Temperatur von 0,85. Insgesamt werden sieben Konfigurationen verglichen, darunter Qwen3.6-MoE in zwei Quantisierungsstufen (4-bit und 6-bit) sowie der Fine-Tune HuiHui-Qwen3.6-MoE.
- Sieben Modell-Konfigurationen getestet: Qwen3.6-27B (4-bit), Qwen3.6-MoE (6-bit & 4-bit), Ornith-35B (6-bit), Gemma-4-26B (6-bit), HuiHui-Qwen3.6-MoE (6-bit), Agents-A1 (6-bit).
- Strenge Pass/Fail-Methodik: Bei nicht funktionierender HTML-Datei kompletter Session-Reset, maximal 3 Versuche pro Modell.
- Repeat-Penalty variiert je Modellfamilie: Gemma-4 erhält mit 1,1 den höchsten Wert, alle anderen liegen bei 1,05.
- Alle Quants stammen aus der HuggingFace-Collection leonsarmiento/local-sota-for-48gb-macs, die explizit für 48-GB-Apple-Silicon optimiert ist.
- Inferenz läuft über das Framework oMLX, Testergebnisse werden als animierte GIFs dokumentiert.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com0mo
Mimir: Dänisches 1,7B-Modell schlägt Qwen und Gemma auf Benchmarks
- MEINUNGreddit.com6d
Diskussion: Kleine smarte Modelle vs. große effiziente Modelle für lokale LLMs
- BENCHMARKreddit.com3w
Ornith-1.5 9B überzeugt bei Coding-Aufgaben auf Low-End-Hardware
- MEINUNGreddit.com1w
Community-Diskussion: IFM K2-Horizon-MoVA-36B-A4B im Praxistest