DynamicTune 0.8B übertrifft 2B-Modell auf ARC-Challenge ohne Backpropagation
Warum es zählt
Weight Surgery ohne Training schlägt sowohl klassisches SFT (25k Claude-Pairs, 38.10%) als auch größere Modelle. Für Edge-Deployments relevant: der Prozess läuft in ~12 Minuten auf 8GB Consumer-GPU. Gewichte und Code sind open source verfügbar.
— Lumeric Redaktion
ARC-Challenge · Spitzenwert
37.5%
Qwen3.5-0.8B Base
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGreddit.com3h
Closed-form Weight Surgery überträgt Qwen 4B-Fähigkeiten in 0.8B ohne Training
- FORSCHUNGarxiv.org4d
Hypernetwork generiert Modellgewichte on-the-fly aus wenigen Beispielen
- LAUNCHreddit.com2w
Jev-Style LoRA-Finetuning auf Qwen3.5 4B – Open Source
- FORSCHUNGreddit.com15h
FFT statt AdamW-Optimizer: VRAM-Bedarf beim Fine-Tuning halbiert
DynamicTune 0.8B übertrifft 2B-Modell auf ARC-Challenge ohne Backpropagation
Warum es zählt
Weight Surgery ohne Training schlägt sowohl klassisches SFT (25k Claude-Pairs, 38.10%) als auch größere Modelle. Für Edge-Deployments relevant: der Prozess läuft in ~12 Minuten auf 8GB Consumer-GPU. Gewichte und Code sind open source verfügbar.
— Lumeric Redaktion
ARC-Challenge · Spitzenwert
37.5%
Qwen3.5-0.8B Base
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGreddit.com3h
Closed-form Weight Surgery überträgt Qwen 4B-Fähigkeiten in 0.8B ohne Training
- FORSCHUNGarxiv.org4d
Hypernetwork generiert Modellgewichte on-the-fly aus wenigen Beispielen
- LAUNCHreddit.com2w
Jev-Style LoRA-Finetuning auf Qwen3.5 4B – Open Source
- FORSCHUNGreddit.com15h
FFT statt AdamW-Optimizer: VRAM-Bedarf beim Fine-Tuning halbiert