Community-Benchmark für Qwen3.8-27B Quants & KV-Cache geplant
Der Reddit-Nutzer plant ein strukturiertes Benchmark-Projekt für Qwen3.8-27B, das über typische Perplexity- oder KLD-Vergleiche hinausgeht und reale Coding- und Agentic-Workloads in den Mittelpunkt stellt. Als primäre Hardware-Zielplattform dient sein eigenes System aus einer RTX 3090 und einer RTX 3060 (12 GB), was zusammen 36 GB VRAM ergibt – genug für Q6-Quants mit Kontextlängen von 150.000 bis 180.000 Tokens. Die Ergebnisse sollen jedoch drei Klassen abdecken: 24 GB (einzelne 3090/4090), 32–36 GB (z. B. RTX 5090 oder Dual-16-GB-Setup) und 48 GB (Dual-3090 oder Karten mit 48 GB). Als Benchmarks sind Terminal-Bench 2.1 und DeepSWE vorgesehen, die längere agentenbasierte Aufgaben und Coding-Szenarien abbilden – im Gegensatz zu MMLU-Stil-Multiple-Choice-Tests. Neben der reinen Pass-Rate sollen Token-Zahl, Tool-Use-Count, maximale erreichte Kontextlänge und Kontext-Kompressionen erfasst werden, um Token-Effizienz messbar zu machen. Die Infrastruktur soll per Skript automatisiert auf Cloud-Plattformen wie RunPod oder Vast.ai aufgebaut werden: Instanz starten, llama.cpp bzw. TabbyAPI/ExLlamaV3 bauen, Quant herunterladen, Benchmark ausführen, Ergebnisse sichern, Instanz beenden. Mehrere Durchläufe pro Konfiguration sind für die wichtigsten Vergleiche geplant, sofern das Budget es erlaubt.
- Ziel-Hardware: RTX 3090 + RTX 3060 (12 GB) = 36 GB VRAM; Q6-Quants laufen dort mit ~150k–180k Kontext-Tokens.
- Getestete Backends: GGUF/llama.cpp vs. EXL3/ExLlamaV3 + TabbyAPI bei vergleichbarem Speicherverbrauch.
- Benchmark-Auswahl: Terminal-Bench 2.1 und DeepSWE – explizit wegen Coding- und Agentic-Fokus statt MMLU-Style.
- Gemessene Metriken über Pass-Rate hinaus: generierte Tokens, Agent/Tool-Use-Count, maximale Kontexttiefe, Kontext-Kompressionen.
- Cloud-Infrastruktur: RunPod / Vast.ai, vollständig skriptgesteuert; Instanzen werden nach jedem Lauf automatisch beendet, um Kosten zu kontrollieren.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Community-Benchmark für Qwen3.8-27B Quants & KV-Cache geplant
Der Reddit-Nutzer plant ein strukturiertes Benchmark-Projekt für Qwen3.8-27B, das über typische Perplexity- oder KLD-Vergleiche hinausgeht und reale Coding- und Agentic-Workloads in den Mittelpunkt stellt. Als primäre Hardware-Zielplattform dient sein eigenes System aus einer RTX 3090 und einer RTX 3060 (12 GB), was zusammen 36 GB VRAM ergibt – genug für Q6-Quants mit Kontextlängen von 150.000 bis 180.000 Tokens. Die Ergebnisse sollen jedoch drei Klassen abdecken: 24 GB (einzelne 3090/4090), 32–36 GB (z. B. RTX 5090 oder Dual-16-GB-Setup) und 48 GB (Dual-3090 oder Karten mit 48 GB). Als Benchmarks sind Terminal-Bench 2.1 und DeepSWE vorgesehen, die längere agentenbasierte Aufgaben und Coding-Szenarien abbilden – im Gegensatz zu MMLU-Stil-Multiple-Choice-Tests. Neben der reinen Pass-Rate sollen Token-Zahl, Tool-Use-Count, maximale erreichte Kontextlänge und Kontext-Kompressionen erfasst werden, um Token-Effizienz messbar zu machen. Die Infrastruktur soll per Skript automatisiert auf Cloud-Plattformen wie RunPod oder Vast.ai aufgebaut werden: Instanz starten, llama.cpp bzw. TabbyAPI/ExLlamaV3 bauen, Quant herunterladen, Benchmark ausführen, Ergebnisse sichern, Instanz beenden. Mehrere Durchläufe pro Konfiguration sind für die wichtigsten Vergleiche geplant, sofern das Budget es erlaubt.
- Ziel-Hardware: RTX 3090 + RTX 3060 (12 GB) = 36 GB VRAM; Q6-Quants laufen dort mit ~150k–180k Kontext-Tokens.
- Getestete Backends: GGUF/llama.cpp vs. EXL3/ExLlamaV3 + TabbyAPI bei vergleichbarem Speicherverbrauch.
- Benchmark-Auswahl: Terminal-Bench 2.1 und DeepSWE – explizit wegen Coding- und Agentic-Fokus statt MMLU-Style.
- Gemessene Metriken über Pass-Rate hinaus: generierte Tokens, Agent/Tool-Use-Count, maximale Kontexttiefe, Kontext-Kompressionen.
- Cloud-Infrastruktur: RunPod / Vast.ai, vollständig skriptgesteuert; Instanzen werden nach jedem Lauf automatisch beendet, um Kosten zu kontrollieren.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.