Qwen3.8-27B lokal: 131M Tokens, null Ausfälle, 650 $ API-Kosten gespart
Der Reddit-Nutzer /u/illgettheownerforyou nutzte das Framework DeepSeek Harness auf seinem Windows-PC, das per LAN mit einem separaten Inferenz-Server auf Basis einer RTX PRO 6000 kommunizierte – ein Setup, bei dem der Server ausschließlich für die Inferenz zuständig war, während alle Shell-Befehle und Dateioperationen lokal auf dem Client-PC abliefen. Als Quantisierungsformat kam NInfers eigenes „groupwise-int artifact" zum Einsatz, das eine gemischte Q4/Q5/Q6-Zuweisung verwendet; ein Test mit dem NVFP4-Profil ist als nächster Schritt geplant. Der Lauf war als Agentenaufgabe mit langen Kontextfenstern konzipiert: Zwei Agenten konkurrierten gleichzeitig um denselben Inferenz-Endpunkt, was zu erheblicher Warteschlangen- und Prefill-Konkurrenz führte. Das erklärt das ausgeprägte Gefälle zwischen medianem (0,8 s) und p95-Time-to-First-Token (136 s) am Root-Agenten. Die 1.421 lokalen Tool-Operationen setzten sich aus 576 PowerShell-Aufrufen, 259 Lesevorgängen, 221 Edits, 161 Schreibvorgängen und 114 Suchanfragen zusammen; nur 30 davon schlugen fehl (2,11 % Fehlerrate). Besonders auffällig ist das Input/Output-Verhältnis von rund 160:1 – wiederholte Sechsstellige-Token-Kontexte dominierten die Gesamtlast, während die Generierung selbst mit ~105 tok/s vergleichsweise schnell blieb. Der Vergleich mit aktuellen API-Preisen ohne Cache-Rabatte zeigt eine Spanne von 18,61 $ (DeepSeek V4 Flash) bis 677,32 $ (Claude Opus 4.6) für dasselbe Workload-Volumen.
- Quantisierung: NInfers groupwise-int artifact mit gemischter Q4/Q5/Q6-Zuweisung; NVFP4-Profil ist als nächster Test geplant.
- Kontext-Verteilung: Medianer Root-Request 136,6K Tokens, p95 bei 205,9K, Maximum bei 231,2K Tokens.
- Time-to-First-Token am Subagenten: Median 151 Sekunden Wartezeit, aber nur 5,3 Sekunden reine Decode-Phase — Flaschenhals war Prefill-Konkurrenz, nicht Generierung.
- 31 automatische Kompaktierungsversuche (Compaction) wurden vom Harness ausgelöst, um den wachsenden Kontext zu verwalten.
- Input/Output-Verhältnis lag bei ~160:1 — wiederholte Langkontexte, nicht die Ausgabe, bildeten den Hauptteil der GPU-Last.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Qwen3.8-27B lokal: 131M Tokens, null Ausfälle, 650 $ API-Kosten gespart
Der Reddit-Nutzer /u/illgettheownerforyou nutzte das Framework DeepSeek Harness auf seinem Windows-PC, das per LAN mit einem separaten Inferenz-Server auf Basis einer RTX PRO 6000 kommunizierte – ein Setup, bei dem der Server ausschließlich für die Inferenz zuständig war, während alle Shell-Befehle und Dateioperationen lokal auf dem Client-PC abliefen. Als Quantisierungsformat kam NInfers eigenes „groupwise-int artifact" zum Einsatz, das eine gemischte Q4/Q5/Q6-Zuweisung verwendet; ein Test mit dem NVFP4-Profil ist als nächster Schritt geplant. Der Lauf war als Agentenaufgabe mit langen Kontextfenstern konzipiert: Zwei Agenten konkurrierten gleichzeitig um denselben Inferenz-Endpunkt, was zu erheblicher Warteschlangen- und Prefill-Konkurrenz führte. Das erklärt das ausgeprägte Gefälle zwischen medianem (0,8 s) und p95-Time-to-First-Token (136 s) am Root-Agenten. Die 1.421 lokalen Tool-Operationen setzten sich aus 576 PowerShell-Aufrufen, 259 Lesevorgängen, 221 Edits, 161 Schreibvorgängen und 114 Suchanfragen zusammen; nur 30 davon schlugen fehl (2,11 % Fehlerrate). Besonders auffällig ist das Input/Output-Verhältnis von rund 160:1 – wiederholte Sechsstellige-Token-Kontexte dominierten die Gesamtlast, während die Generierung selbst mit ~105 tok/s vergleichsweise schnell blieb. Der Vergleich mit aktuellen API-Preisen ohne Cache-Rabatte zeigt eine Spanne von 18,61 $ (DeepSeek V4 Flash) bis 677,32 $ (Claude Opus 4.6) für dasselbe Workload-Volumen.
- Quantisierung: NInfers groupwise-int artifact mit gemischter Q4/Q5/Q6-Zuweisung; NVFP4-Profil ist als nächster Test geplant.
- Kontext-Verteilung: Medianer Root-Request 136,6K Tokens, p95 bei 205,9K, Maximum bei 231,2K Tokens.
- Time-to-First-Token am Subagenten: Median 151 Sekunden Wartezeit, aber nur 5,3 Sekunden reine Decode-Phase — Flaschenhals war Prefill-Konkurrenz, nicht Generierung.
- 31 automatische Kompaktierungsversuche (Compaction) wurden vom Harness ausgelöst, um den wachsenden Kontext zu verwalten.
- Input/Output-Verhältnis lag bei ~160:1 — wiederholte Langkontexte, nicht die Ausgabe, bildeten den Hauptteil der GPU-Last.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.