Audit: 64 von 443 GGUF-Quants sind nicht das, was ihr Dateiname verspricht
CompaniesHugging Face
Warum es zählt
Wer GGUF-Quants nach Dateiname oder Modellkarte auswählt, kann auf Modellen sitzen, die de facto deutlich größer sind als erwartet — bei Nemotron-3.5-Lightning z.B. 4,58 statt 2,06 bpw. Ein Python-Tool (stdlib only) ermöglicht lokale und remote Überprüfung ohne vollständigen Download.
— Lumeric Redaktion
GGUF bpw Claimed vs. Measured (Nemotron-3.5-Lightning IQ2-Rungs) · Spitzenwert
2.06%
IQ2_XXS (claimed 2.06 bpw)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- GERÜCHTreddit.com1w
Verdacht: AtomicChat tarnt IQ2_S-Quant als Q4_K_M für Qwen3.8-Flash-Next
- MEINUNGreddit.com1w
Quantisierungschaos: Q4KM-Quants von Qwen3.8-Flash-Next variieren um 150%
- FORSCHUNGarxiv.org4d
Studie: 1,6% der Ollama-Modellartefakte sind still defekt
- MEINUNGreddit.com3w
Community-Diskussion: Eigene GGUF-Quantisierung mit llama.cpp sinnvoll?
Audit: 64 von 443 GGUF-Quants sind nicht das, was ihr Dateiname verspricht
CompaniesHugging Face
Warum es zählt
Wer GGUF-Quants nach Dateiname oder Modellkarte auswählt, kann auf Modellen sitzen, die de facto deutlich größer sind als erwartet — bei Nemotron-3.5-Lightning z.B. 4,58 statt 2,06 bpw. Ein Python-Tool (stdlib only) ermöglicht lokale und remote Überprüfung ohne vollständigen Download.
— Lumeric Redaktion
GGUF bpw Claimed vs. Measured (Nemotron-3.5-Lightning IQ2-Rungs) · Spitzenwert
2.06%
IQ2_XXS (claimed 2.06 bpw)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- GERÜCHTreddit.com1w
Verdacht: AtomicChat tarnt IQ2_S-Quant als Q4_K_M für Qwen3.8-Flash-Next
- MEINUNGreddit.com1w
Quantisierungschaos: Q4KM-Quants von Qwen3.8-Flash-Next variieren um 150%
- FORSCHUNGarxiv.org4d
Studie: 1,6% der Ollama-Modellartefakte sind still defekt
- MEINUNGreddit.com3w
Community-Diskussion: Eigene GGUF-Quantisierung mit llama.cpp sinnvoll?