inclusionAI Ling-3.0-flash: 127,5B MoE-Modell unter MIT-Lizenz auf Hugging Face
CompaniesHugging Face
Warum es zählt
Das offizielle FP8-Gewicht (~128 GB) ist direkt nutzbar für Multi-GPU-Rigs oder große Unified-Memory-Systeme ohne Community-Quantisierung. Unklar ist aktuell, ob llama.cpp den Architekturtyp bailing_hybrid unterstützt oder ob vLLM/SGLang erforderlich sind.
— Lumeric Redaktion
5,1B aktive Parameter (von 127,5B)
MoE: 512 Experten, 8 aktiv pro Token
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
inclusionAI Ling-3.0-flash: 127,5B MoE-Modell unter MIT-Lizenz auf Hugging Face
CompaniesHugging Face
Warum es zählt
Das offizielle FP8-Gewicht (~128 GB) ist direkt nutzbar für Multi-GPU-Rigs oder große Unified-Memory-Systeme ohne Community-Quantisierung. Unklar ist aktuell, ob llama.cpp den Architekturtyp bailing_hybrid unterstützt oder ob vLLM/SGLang erforderlich sind.
— Lumeric Redaktion
5,1B aktive Parameter (von 127,5B)
MoE: 512 Experten, 8 aktiv pro Token
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.