Community-Release: Uncensored GGUFs für LongCat-Flash-Lite-Sparse, Qwen3 und Laguna
Der Reddit-Nutzer LLMFan46 hat nach eigenen Angaben rund einen Monat intensiver Entwicklungsarbeit mehrere „Heretic"-Uncensored-Varianten populärer Sprachmodelle als GGUF veröffentlicht. Den größten Aufwand verursachte LongCat-Flash-Lite-Sparse (69B-A3B): Da das Modell weder auf mainline llama.cpp noch auf anderen gängigen Inference-Backends läuft, musste LLMFan46 sowohl den Heretic-Uncensoring-Support als auch einen eigenen llama.cpp-Fork von Grund auf neu entwickeln. Das Modell erweitert den bereits früher veröffentlichten LongCat-Flash-Lite um Sparse Attention und einen auf 1 Million Token vervierfachten Kontextfenster (vorher 256k). Für LongCat stehen zwei Uncensoring-Stufen bereit: „Uncensored Heretic" mit 9 von 100 Refusals (KLD 0,0157) und die stärker modifizierte „Ultra Uncensored"-Variante mit 4 von 100 Refusals (KLD 0,0779). Qwen3.8-27B wird als Ultra Uncensored Heretic mit nur 3/100 Refusals (KLD 0,0244) in mehreren Formaten geliefert – GGUF, Safetensors, NVFP4 und GPTQ-Int4. Qwen3.5-122B-A10B erscheint als Uncensored Heretic mit 8/100 Refusals (KLD 0,0856). Ergänzend wurden Qwen3-Coder-Next auf Nutzerwunsch sowie Laguna-S2.1 mit experimenteller Vision-Unterstützung (via optionale mmproj-Dateien) veröffentlicht. Parallel hat LLMFan46 seinen J-Wash-Enhanced-Fork aktualisiert und um Unterstützung für MoE-Qwen3.5/3.6/3.8-Modelle sowie UI-Verbesserungen ergänzt.
- LongCat-Flash-Lite-Sparse erfordert zwingend LLMFan46s eigenen llama.cpp-Fork (Branch: claude/longcat-win11); Nutzung läuft über llama-server.exe + llama-ui.
- Alle LongCat-Varianten enthalten sowohl MTPs (Multi-Token Predictions) als auch LSAs (Latent Sparse Attentions), die im GGUF erhalten bleiben.
- Qwen3.8-27B ist zusätzlich in NVFP4- und GPTQ-Int4-Quantisierungen verfügbar – ein ungewöhnlich breites Formatangebot für Community-Releases.
- Laguna-S2.1 Vision: Die mmproj-Dateien für Vision sind optional – wer sie nicht herunterlädt, erhält ein rein text-basiertes Modell ohne Einschränkungen.
- J-Wash Enhanced (GitHub: erm14254/J-Wash-Enhanced) wurde um MoE-Qwen3.5/3.6/3.8-Support sowie Bug-Fixes und UI-Verbesserungen erweitert.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com0mo
Qwen3.8-27B Uncensored Aggressive mit FastMTP – bis zu 3,02× Token-Generierung
- LAUNCHreddit.com3w
Liquid AI veröffentlicht LFM 2.5 QAD mit 2,6B Parametern
- LAUNCHreddit.com0mo
Huihui-ai veröffentlicht Qwen 3.8 Ablit – zensurfreies Modell auf HuggingFace
- GERÜCHTreddit.com3w
G9v3-39A5B: Neues MoE-Modell übertrifft laut Community Qwen 3.6 27B
Community-Release: Uncensored GGUFs für LongCat-Flash-Lite-Sparse, Qwen3 und Laguna
Der Reddit-Nutzer LLMFan46 hat nach eigenen Angaben rund einen Monat intensiver Entwicklungsarbeit mehrere „Heretic"-Uncensored-Varianten populärer Sprachmodelle als GGUF veröffentlicht. Den größten Aufwand verursachte LongCat-Flash-Lite-Sparse (69B-A3B): Da das Modell weder auf mainline llama.cpp noch auf anderen gängigen Inference-Backends läuft, musste LLMFan46 sowohl den Heretic-Uncensoring-Support als auch einen eigenen llama.cpp-Fork von Grund auf neu entwickeln. Das Modell erweitert den bereits früher veröffentlichten LongCat-Flash-Lite um Sparse Attention und einen auf 1 Million Token vervierfachten Kontextfenster (vorher 256k). Für LongCat stehen zwei Uncensoring-Stufen bereit: „Uncensored Heretic" mit 9 von 100 Refusals (KLD 0,0157) und die stärker modifizierte „Ultra Uncensored"-Variante mit 4 von 100 Refusals (KLD 0,0779). Qwen3.8-27B wird als Ultra Uncensored Heretic mit nur 3/100 Refusals (KLD 0,0244) in mehreren Formaten geliefert – GGUF, Safetensors, NVFP4 und GPTQ-Int4. Qwen3.5-122B-A10B erscheint als Uncensored Heretic mit 8/100 Refusals (KLD 0,0856). Ergänzend wurden Qwen3-Coder-Next auf Nutzerwunsch sowie Laguna-S2.1 mit experimenteller Vision-Unterstützung (via optionale mmproj-Dateien) veröffentlicht. Parallel hat LLMFan46 seinen J-Wash-Enhanced-Fork aktualisiert und um Unterstützung für MoE-Qwen3.5/3.6/3.8-Modelle sowie UI-Verbesserungen ergänzt.
- LongCat-Flash-Lite-Sparse erfordert zwingend LLMFan46s eigenen llama.cpp-Fork (Branch: claude/longcat-win11); Nutzung läuft über llama-server.exe + llama-ui.
- Alle LongCat-Varianten enthalten sowohl MTPs (Multi-Token Predictions) als auch LSAs (Latent Sparse Attentions), die im GGUF erhalten bleiben.
- Qwen3.8-27B ist zusätzlich in NVFP4- und GPTQ-Int4-Quantisierungen verfügbar – ein ungewöhnlich breites Formatangebot für Community-Releases.
- Laguna-S2.1 Vision: Die mmproj-Dateien für Vision sind optional – wer sie nicht herunterlädt, erhält ein rein text-basiertes Modell ohne Einschränkungen.
- J-Wash Enhanced (GitHub: erm14254/J-Wash-Enhanced) wurde um MoE-Qwen3.5/3.6/3.8-Support sowie Bug-Fixes und UI-Verbesserungen erweitert.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com0mo
Qwen3.8-27B Uncensored Aggressive mit FastMTP – bis zu 3,02× Token-Generierung
- LAUNCHreddit.com3w
Liquid AI veröffentlicht LFM 2.5 QAD mit 2,6B Parametern
- LAUNCHreddit.com0mo
Huihui-ai veröffentlicht Qwen 3.8 Ablit – zensurfreies Modell auf HuggingFace
- GERÜCHTreddit.com3w
G9v3-39A5B: Neues MoE-Modell übertrifft laut Community Qwen 3.6 27B