Mistral-Medium-3.5-128B läuft lokal auf 3× RTX 3090 mit Q3_K_M
Reddit-Nutzer jacek2023 hat Mistral Medium 3.5 mit 128 Milliarden Parametern in der Q3_K_M-Quantisierung auf einem Drei-GPU-System aus RTX-3090-Karten (insgesamt 72 GB VRAM) zum Laufen gebracht und die realen Inferenzgeschwindigkeiten dokumentiert. Q3_K_M bezeichnet eine 3-Bit-Quantisierungsstufe im GGUF-Format, die den Speicherbedarf gegenüber dem vollen FP16-Modell drastisch reduziert – bei einem 128B-Modell ist das eine Voraussetzung, um überhaupt auf Consumer-Hardware zu passen. Drei RTX 3090 mit je 24 GB VRAM bilden ein Multi-GPU-Setup, das über Tensor-Parallelismus oder Layer-Splitting (etwa via llama.cpp oder LM Studio) angebunden werden kann. Die gezeigten Screenshots decken drei verschiedene Code-Generierungs-Szenarien ab: Python-Code, SVG-Generierung und HTML – was eine breitere Einschätzung der praktischen Ausgabequalität ermöglicht als ein einzelner Benchmark. Das Setup ist für Entwickler relevant, die ein leistungsfähiges 128B-Modell ohne Cloud-Anbindung und ohne teure Profi-Hardware (z. B. A100/H100) lokal betreiben wollen. Mistral Medium 3.5 positioniert sich laut Mistral AI als Modell der mittleren Klasse mit starker Coding-Fähigkeit; die 128B-Variante ist damit eines der größten Modelle, das noch realistisch auf Consumer-Tier-Hardware läuft. Der Post liefert keine exakten Token-pro-Sekunde-Zahlen im Textteil, die Geschwindigkeit ist jedoch anhand der Screenshot-Sequenzen visuell nachvollziehbar.
- Getestete Aufgabentypen: Python-Code, SVG-Generierung und HTML – jeweils mit mehreren Screenshots dokumentiert.
- Quantisierungsstufe Q3_K_M reduziert den VRAM-Bedarf des 128B-Modells so weit, dass es in 72 GB (3× 24 GB) passt.
- Hardware: drei NVIDIA RTX 3090 (Consumer-Klasse, je 24 GB GDDR6X), kein Profi-Beschleuniger notwendig.
- Autor des Posts ist Reddit-Nutzer jacek2023; der Beitrag erschien im Subreddit r/LocalLLaMA.
- Konkrete Token/s-Zahlen werden im Textauszug nicht genannt – Geschwindigkeit ist nur über die Screenshots ersichtlich.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Mistral-Medium-3.5-128B läuft lokal auf 3× RTX 3090 mit Q3_K_M
Reddit-Nutzer jacek2023 hat Mistral Medium 3.5 mit 128 Milliarden Parametern in der Q3_K_M-Quantisierung auf einem Drei-GPU-System aus RTX-3090-Karten (insgesamt 72 GB VRAM) zum Laufen gebracht und die realen Inferenzgeschwindigkeiten dokumentiert. Q3_K_M bezeichnet eine 3-Bit-Quantisierungsstufe im GGUF-Format, die den Speicherbedarf gegenüber dem vollen FP16-Modell drastisch reduziert – bei einem 128B-Modell ist das eine Voraussetzung, um überhaupt auf Consumer-Hardware zu passen. Drei RTX 3090 mit je 24 GB VRAM bilden ein Multi-GPU-Setup, das über Tensor-Parallelismus oder Layer-Splitting (etwa via llama.cpp oder LM Studio) angebunden werden kann. Die gezeigten Screenshots decken drei verschiedene Code-Generierungs-Szenarien ab: Python-Code, SVG-Generierung und HTML – was eine breitere Einschätzung der praktischen Ausgabequalität ermöglicht als ein einzelner Benchmark. Das Setup ist für Entwickler relevant, die ein leistungsfähiges 128B-Modell ohne Cloud-Anbindung und ohne teure Profi-Hardware (z. B. A100/H100) lokal betreiben wollen. Mistral Medium 3.5 positioniert sich laut Mistral AI als Modell der mittleren Klasse mit starker Coding-Fähigkeit; die 128B-Variante ist damit eines der größten Modelle, das noch realistisch auf Consumer-Tier-Hardware läuft. Der Post liefert keine exakten Token-pro-Sekunde-Zahlen im Textteil, die Geschwindigkeit ist jedoch anhand der Screenshot-Sequenzen visuell nachvollziehbar.
- Getestete Aufgabentypen: Python-Code, SVG-Generierung und HTML – jeweils mit mehreren Screenshots dokumentiert.
- Quantisierungsstufe Q3_K_M reduziert den VRAM-Bedarf des 128B-Modells so weit, dass es in 72 GB (3× 24 GB) passt.
- Hardware: drei NVIDIA RTX 3090 (Consumer-Klasse, je 24 GB GDDR6X), kein Profi-Beschleuniger notwendig.
- Autor des Posts ist Reddit-Nutzer jacek2023; der Beitrag erschien im Subreddit r/LocalLLaMA.
- Konkrete Token/s-Zahlen werden im Textauszug nicht genannt – Geschwindigkeit ist nur über die Screenshots ersichtlich.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.