ExLlamav3 mit CPU-Offload für MoE-Experten und neuen Modellen
ExLlamav3, der aktiv von Entwickler turboderp weiterentwickelte Inference-Stack für quantisierte Large Language Models, hat binnen kurzer Zeit mehrere substanzielle Erweiterungen erhalten. Besonders hervorzuheben ist das CPU-Offloading für MoE-Experten (Mixture-of-Experts): Dabei werden inaktive Experten-Gewichte auf den Hauptspeicher ausgelagert, sodass auch Modelle mit sehr vielen Parametern auf Consumer-GPUs mit begrenztem VRAM lauffähig werden. Ergänzend dazu gibt es nun ein Disk-Offload speziell für Qwen-3.8-Flash-Next, bei dem Modellteile direkt von der Festplatte nachgeladen werden – ein Ansatz, der ngram-basierte Vorhersagen nutzt, um den Nachladeaufwand zu minimieren. Neu unterstützt wird außerdem GLM-5.3-Flash, ein weiteres kompaktes Flash-Modell im ExLlamav3-Ökosystem. Die sogenannten SC Quants (Self-Calibrated Quantization) stellen eine neue Optimierungsmethode dar, die Quantisierungsfehler durch modellinternes Kalibrieren reduzieren soll – ohne externes Kalibrierungsdataset. Als praktische Demonstration wurde mit Qwen-3.8-Flash-Next in einer 3,05-bpw-ExL3-Quantisierung ein SVG-Bild einer Katze auf einer Schildkröte im Weltall generiert, was die Multimodal- bzw. Code-Fähigkeiten des Modells illustriert. Die Community rund um ExLlamav3 ist über den exllama-Discord sowie ein eigenes Subreddit aktiv.
- CPU-Offload lagert inaktive MoE-Experten-Gewichte in den RAM aus, um große Sparse-Modelle auf VRAM-limitierten NVIDIA-GPUs zu ermöglichen.
- Disk-Offload für Qwen-3.8-Flash-Next nutzt ngram-basiertes Prefetching, um Latenzen beim Nachladen von der Festplatte zu reduzieren.
- SC Quants (Self-Calibrated Quantization) ist eine neue Technik zur Verbesserung der Modellqualität bei niedrigen Bits-per-Weight ohne externes Kalibrierungsdataset.
- Demonstriert wurde Qwen-3.8-Flash-Next mit einer 3,05-bpw-ExL3-Quantisierung – per Prompt wurde ein SVG-Bild generiert.
- Entwickler turboderp koordiniert Updates über einen dedizierten exllama-Discord und das Subreddit r/exllama.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
ExLlamav3 mit CPU-Offload für MoE-Experten und neuen Modellen
ExLlamav3, der aktiv von Entwickler turboderp weiterentwickelte Inference-Stack für quantisierte Large Language Models, hat binnen kurzer Zeit mehrere substanzielle Erweiterungen erhalten. Besonders hervorzuheben ist das CPU-Offloading für MoE-Experten (Mixture-of-Experts): Dabei werden inaktive Experten-Gewichte auf den Hauptspeicher ausgelagert, sodass auch Modelle mit sehr vielen Parametern auf Consumer-GPUs mit begrenztem VRAM lauffähig werden. Ergänzend dazu gibt es nun ein Disk-Offload speziell für Qwen-3.8-Flash-Next, bei dem Modellteile direkt von der Festplatte nachgeladen werden – ein Ansatz, der ngram-basierte Vorhersagen nutzt, um den Nachladeaufwand zu minimieren. Neu unterstützt wird außerdem GLM-5.3-Flash, ein weiteres kompaktes Flash-Modell im ExLlamav3-Ökosystem. Die sogenannten SC Quants (Self-Calibrated Quantization) stellen eine neue Optimierungsmethode dar, die Quantisierungsfehler durch modellinternes Kalibrieren reduzieren soll – ohne externes Kalibrierungsdataset. Als praktische Demonstration wurde mit Qwen-3.8-Flash-Next in einer 3,05-bpw-ExL3-Quantisierung ein SVG-Bild einer Katze auf einer Schildkröte im Weltall generiert, was die Multimodal- bzw. Code-Fähigkeiten des Modells illustriert. Die Community rund um ExLlamav3 ist über den exllama-Discord sowie ein eigenes Subreddit aktiv.
- CPU-Offload lagert inaktive MoE-Experten-Gewichte in den RAM aus, um große Sparse-Modelle auf VRAM-limitierten NVIDIA-GPUs zu ermöglichen.
- Disk-Offload für Qwen-3.8-Flash-Next nutzt ngram-basiertes Prefetching, um Latenzen beim Nachladen von der Festplatte zu reduzieren.
- SC Quants (Self-Calibrated Quantization) ist eine neue Technik zur Verbesserung der Modellqualität bei niedrigen Bits-per-Weight ohne externes Kalibrierungsdataset.
- Demonstriert wurde Qwen-3.8-Flash-Next mit einer 3,05-bpw-ExL3-Quantisierung – per Prompt wurde ein SVG-Bild generiert.
- Entwickler turboderp koordiniert Updates über einen dedizierten exllama-Discord und das Subreddit r/exllama.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.