Ling-3.0-tiny läuft mit 128K-Kontext auf 249-Dollar-Jetson-Board
Ling-3.0-tiny stammt von inclusionAI und ist ein hybrides MoE-Modell der BailingMoE-V3-Architektur mit 128 Experten, von denen pro Token 8 geroutete plus 1 geteilter Experte aktiv sind. Der entscheidende Grund für das geringe Speicherprofil liegt im hybriden KDA+MLA-Design: Nur die 6 MLA-Schichten halten einen kontextproportionalen KV-Cache, während die 18 KDA-Schichten einen fest dimensionierten rekurrenten Zustand nutzen – dadurch passt das volle 131.072-Token-Fenster trotz 8-GB-RAM. Die verwendete IQ4_NL-Quantisierung (4,5 bpw, imatrix-kalibriert) belegt 4,40 GB auf Disk und ist bewusst gewählt: Größere Quants (Q5/Q6) würden nur bis ca. 64K Kontext reichen. Vorkompilierte Releases von llama.cpp unterstützen das Modell nicht; BailingMoE-V3-Support landete erst am 17. August 2026 über PR #26608 im Master-Branch. Das Board selbst – das Jetson Orin Nano Super Developer Kit – wurde zum Launch für 249 US-Dollar verkauft und liegt mittlerweile laut SparkFun bei 399 US-Dollar; es liefert 67 TOPS und läuft unter JetPack R39.2 mit CUDA 13.2. Der Autor ließ die Einrichtung und Basistests von seinem eigenen Hermes-Agenten durchführen, was den Anwendungsfall eines autonomen Edge-Agenten direkt illustriert.
- IQ4_NL-Quant belegt 4,40 GB; Q5/Q6-Varianten scheitern ab ~64K Kontext an der 8-GB-RAM-Grenze des Orin Nano Super.
- BailingMoE-V3-Architektur-Support kam via llama.cpp PR #26608 (gemergt 17. Aug. 2026) inkl. spekulativer MTP-Unterstützung — ältere Release-Tarballs laden das Modell nicht.
- Build-Flags für das Board: CUDA sm_87 (-DCMAKE_CUDA_ARCHITECTURES=87), alle 24 Layer per -ngl 99 auf GPU offloaded.
- Needle-in-Haystack mit 128 eingebetteten Passkeys: 92 % Trefferquote bei 96K (118/128), 88 % bei 128K (113/128); die letzten 32K zeigen einen deutlichen Einbruch auf 67 %.
- Prompt-Eval-Speed sinkt von 450–760 tok/s bei kurzen Kontexten auf 220–264 tok/s beim vollen 125K-Prefill; Decode fällt von 33 tok/s bei kurzem Kontext auf 15–17 tok/s bei 96–128K Tiefe.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Ling-3.0-tiny läuft mit 128K-Kontext auf 249-Dollar-Jetson-Board
Ling-3.0-tiny stammt von inclusionAI und ist ein hybrides MoE-Modell der BailingMoE-V3-Architektur mit 128 Experten, von denen pro Token 8 geroutete plus 1 geteilter Experte aktiv sind. Der entscheidende Grund für das geringe Speicherprofil liegt im hybriden KDA+MLA-Design: Nur die 6 MLA-Schichten halten einen kontextproportionalen KV-Cache, während die 18 KDA-Schichten einen fest dimensionierten rekurrenten Zustand nutzen – dadurch passt das volle 131.072-Token-Fenster trotz 8-GB-RAM. Die verwendete IQ4_NL-Quantisierung (4,5 bpw, imatrix-kalibriert) belegt 4,40 GB auf Disk und ist bewusst gewählt: Größere Quants (Q5/Q6) würden nur bis ca. 64K Kontext reichen. Vorkompilierte Releases von llama.cpp unterstützen das Modell nicht; BailingMoE-V3-Support landete erst am 17. August 2026 über PR #26608 im Master-Branch. Das Board selbst – das Jetson Orin Nano Super Developer Kit – wurde zum Launch für 249 US-Dollar verkauft und liegt mittlerweile laut SparkFun bei 399 US-Dollar; es liefert 67 TOPS und läuft unter JetPack R39.2 mit CUDA 13.2. Der Autor ließ die Einrichtung und Basistests von seinem eigenen Hermes-Agenten durchführen, was den Anwendungsfall eines autonomen Edge-Agenten direkt illustriert.
- IQ4_NL-Quant belegt 4,40 GB; Q5/Q6-Varianten scheitern ab ~64K Kontext an der 8-GB-RAM-Grenze des Orin Nano Super.
- BailingMoE-V3-Architektur-Support kam via llama.cpp PR #26608 (gemergt 17. Aug. 2026) inkl. spekulativer MTP-Unterstützung — ältere Release-Tarballs laden das Modell nicht.
- Build-Flags für das Board: CUDA sm_87 (-DCMAKE_CUDA_ARCHITECTURES=87), alle 24 Layer per -ngl 99 auf GPU offloaded.
- Needle-in-Haystack mit 128 eingebetteten Passkeys: 92 % Trefferquote bei 96K (118/128), 88 % bei 128K (113/128); die letzten 32K zeigen einen deutlichen Einbruch auf 67 %.
- Prompt-Eval-Speed sinkt von 450–760 tok/s bei kurzen Kontexten auf 220–264 tok/s beim vollen 125K-Prefill; Decode fällt von 33 tok/s bei kurzem Kontext auf 15–17 tok/s bei 96–128K Tiefe.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.