Qwen 3.8 27B läuft mit 150k Kontext auf einer RTX 3090
Der Reddit-Nutzer /u/politefella0 berichtet über einen praktischen Einsatz des GitHub-Projekts syv-ai/qwen38-27b-rtx3090, das speziell auf die Ausführung von Qwen 3.8 27B mit Vision auf einer einzelnen NVIDIA RTX 3090 (24 GB VRAM) optimiert ist. Die Session-Statistiken aus dem Post sind ungewöhnlich detailliert: 26 Gesprächsrunden, 489 Schritte, eine LLM-Laufzeit von 161 Minuten und 44 Sekunden sowie eine Tool-Call-Zeit von 10 Minuten und 47 Sekunden – was auf eine ausgedehnte, agentenbasierte Nutzung hindeutet. Der Input umfasste 35,7 Millionen Token, der Output 586.000 Token, bei einer durchschnittlichen Time-to-First-Token (TTFT) von 5,9 Sekunden. DeepSeek Harness (dsh) fungierte dabei als Agentenframework, in das der Nutzer eigene Plugins integriert hat – darunter ein selbst geschriebenes Gmail-Plugin. Ein Versuch, zusätzlich ein Suchmaschinen-Plugin zu schreiben, führte jedoch zu einem Absturz von DeepSeek Harness, der das Tool seither nicht mehr startbar macht. Der Cache-Hit-Wert lag bei 0 %, was darauf hindeutet, dass keine Prompt-Caching-Mechanismen aktiv waren. Bemerkenswert ist, dass 150k Kontext mit aktivierter Vision-Funktion auf dieser Consumer-GPU überhaupt stabil betrieben werden konnte – ein Ergebnis, das maßgeblich der Konfiguration im syv-ai-Repo zuzuschreiben sein dürfte.
- Session-Stats: 26 Turns, 489 Steps, LLM-Laufzeit 161m44s, Tool-Calls 10m47s – deutet auf intensiven Agenten-Betrieb hin.
- Input-Volumen: 35,7 Millionen Token Input und 586K Token Output in einer einzigen Session.
- TTFT-Durchschnitt lag bei 5,9 Sekunden bei 0 % Cache-Hit-Rate – kein Prompt-Caching aktiv.
- Gmail-Plugin für DeepSeek Harness wurde erfolgreich mit lokal gehostetem Qwen 3.8 27B geschrieben; ein Suchmaschinen-Plugin crashte das Framework.
- Das zugrunde liegende GitHub-Repo stammt vom Account syv-ai und richtet sich explizit auf die RTX-3090-Hardwarekonfiguration aus.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen 3.8 27B läuft mit 150k Kontext auf einer RTX 3090
Der Reddit-Nutzer /u/politefella0 berichtet über einen praktischen Einsatz des GitHub-Projekts syv-ai/qwen38-27b-rtx3090, das speziell auf die Ausführung von Qwen 3.8 27B mit Vision auf einer einzelnen NVIDIA RTX 3090 (24 GB VRAM) optimiert ist. Die Session-Statistiken aus dem Post sind ungewöhnlich detailliert: 26 Gesprächsrunden, 489 Schritte, eine LLM-Laufzeit von 161 Minuten und 44 Sekunden sowie eine Tool-Call-Zeit von 10 Minuten und 47 Sekunden – was auf eine ausgedehnte, agentenbasierte Nutzung hindeutet. Der Input umfasste 35,7 Millionen Token, der Output 586.000 Token, bei einer durchschnittlichen Time-to-First-Token (TTFT) von 5,9 Sekunden. DeepSeek Harness (dsh) fungierte dabei als Agentenframework, in das der Nutzer eigene Plugins integriert hat – darunter ein selbst geschriebenes Gmail-Plugin. Ein Versuch, zusätzlich ein Suchmaschinen-Plugin zu schreiben, führte jedoch zu einem Absturz von DeepSeek Harness, der das Tool seither nicht mehr startbar macht. Der Cache-Hit-Wert lag bei 0 %, was darauf hindeutet, dass keine Prompt-Caching-Mechanismen aktiv waren. Bemerkenswert ist, dass 150k Kontext mit aktivierter Vision-Funktion auf dieser Consumer-GPU überhaupt stabil betrieben werden konnte – ein Ergebnis, das maßgeblich der Konfiguration im syv-ai-Repo zuzuschreiben sein dürfte.
- Session-Stats: 26 Turns, 489 Steps, LLM-Laufzeit 161m44s, Tool-Calls 10m47s – deutet auf intensiven Agenten-Betrieb hin.
- Input-Volumen: 35,7 Millionen Token Input und 586K Token Output in einer einzigen Session.
- TTFT-Durchschnitt lag bei 5,9 Sekunden bei 0 % Cache-Hit-Rate – kein Prompt-Caching aktiv.
- Gmail-Plugin für DeepSeek Harness wurde erfolgreich mit lokal gehostetem Qwen 3.8 27B geschrieben; ein Suchmaschinen-Plugin crashte das Framework.
- Das zugrunde liegende GitHub-Repo stammt vom Account syv-ai und richtet sich explizit auf die RTX-3090-Hardwarekonfiguration aus.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.