Qwen3.5-9B mit Triple-Loop-Architektur nach Nanbeige-4.5-Design
Der Autor, Reddit-Nutzer Lordnyx, begann das Experiment mit einem Qwen3-0.6B-Prototyp, der eine Dual-Loop-Struktur in den mittleren Schichten nutzte – angelehnt an die Nanbeige-4.2-Architektur. Den entscheidenden Impuls gab das veröffentlichte Paper des Nanbeige-Teams zu ihrer 4.5-Architektur, die einen Triple Loop in den mittleren Lagen beschreibt. Ein erster Ansatz mit DeltaNet als Basis für die Loop-Schichten scheiterte: Das Modell vergaß durch die geringe Hidden-Size wesentliche Kontextinformationen und halluzinierte, weshalb DeltaNet durch Standard-Softmax-Attention ersetzt wurde. Ein weiteres zentrales Problem war das Trainings-Setup – erst mit einer dedizierten, niedrigeren Lernrate für den Loop begann dieser eigenständig zu Antworten beizutragen statt sie nur zu verfeinern. Das Training des 9B-Modells lief auf gemieteten GPUs via Modal für rund 30 US-Dollar Free Credit; es wurde durch ein Wall-Clock-Zeitlimit abgebrochen, nicht durch ein festes Token-Ziel. Die KL-Divergenz-Tabelle über 1.129 Schritte zeigt deutlich, dass das Modell im ersten Drittel des Trainings (~Steps 10–370, KL-Mittelwert 0,572) den Großteil seiner Fortschritte erzielte und danach in eine flache, rauschende Oszillation überging – ein klassisches Symptom eines fehlenden LR-Decay-Schedules. Ein Kosinus-LR-Decay ist laut Autor bereits implementiert und soll beim nächsten verfügbaren Free-Credit-Kontingent eingesetzt werden.
- Destillationsquelle war Qwen3.8-27B, dessen Logits auf einem heuristisch kuratierten Agentic/Reasoning-Datensatz genutzt wurden.
- Der KL-Mittelwert stieg von 0,572 (Steps 10–370) auf 0,650 (Steps 760–1120) — der Gesamt-Slope über den kompletten Run betrug rechnerisch nur +0,000075, also praktisch null.
- Robustheit gegenüber paraphrasierten Fragen verbesserte sich laut privater Evaluation um +62 % gegenüber dem Basismodell.
- Der Rückgang bei Reasoning (−10 %) wird auf zwei konkrete Einzelfälle zurückgeführt: einen übersprungenen Schritt-für-Schritt-Rechenweg und eine Repetitionsschleife, die das gesamte Generierungsbudget verbrauchte.
- Das Modell ist unter Lordnyx/qwen3.5-9b-triple-loop-fase1 auf Hugging Face öffentlich zugänglich.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.5-9B mit Triple-Loop-Architektur nach Nanbeige-4.5-Design
Der Autor, Reddit-Nutzer Lordnyx, begann das Experiment mit einem Qwen3-0.6B-Prototyp, der eine Dual-Loop-Struktur in den mittleren Schichten nutzte – angelehnt an die Nanbeige-4.2-Architektur. Den entscheidenden Impuls gab das veröffentlichte Paper des Nanbeige-Teams zu ihrer 4.5-Architektur, die einen Triple Loop in den mittleren Lagen beschreibt. Ein erster Ansatz mit DeltaNet als Basis für die Loop-Schichten scheiterte: Das Modell vergaß durch die geringe Hidden-Size wesentliche Kontextinformationen und halluzinierte, weshalb DeltaNet durch Standard-Softmax-Attention ersetzt wurde. Ein weiteres zentrales Problem war das Trainings-Setup – erst mit einer dedizierten, niedrigeren Lernrate für den Loop begann dieser eigenständig zu Antworten beizutragen statt sie nur zu verfeinern. Das Training des 9B-Modells lief auf gemieteten GPUs via Modal für rund 30 US-Dollar Free Credit; es wurde durch ein Wall-Clock-Zeitlimit abgebrochen, nicht durch ein festes Token-Ziel. Die KL-Divergenz-Tabelle über 1.129 Schritte zeigt deutlich, dass das Modell im ersten Drittel des Trainings (~Steps 10–370, KL-Mittelwert 0,572) den Großteil seiner Fortschritte erzielte und danach in eine flache, rauschende Oszillation überging – ein klassisches Symptom eines fehlenden LR-Decay-Schedules. Ein Kosinus-LR-Decay ist laut Autor bereits implementiert und soll beim nächsten verfügbaren Free-Credit-Kontingent eingesetzt werden.
- Destillationsquelle war Qwen3.8-27B, dessen Logits auf einem heuristisch kuratierten Agentic/Reasoning-Datensatz genutzt wurden.
- Der KL-Mittelwert stieg von 0,572 (Steps 10–370) auf 0,650 (Steps 760–1120) — der Gesamt-Slope über den kompletten Run betrug rechnerisch nur +0,000075, also praktisch null.
- Robustheit gegenüber paraphrasierten Fragen verbesserte sich laut privater Evaluation um +62 % gegenüber dem Basismodell.
- Der Rückgang bei Reasoning (−10 %) wird auf zwei konkrete Einzelfälle zurückgeführt: einen übersprungenen Schritt-für-Schritt-Rechenweg und eine Repetitionsschleife, die das gesamte Generierungsbudget verbrauchte.
- Das Modell ist unter Lordnyx/qwen3.5-9b-triple-loop-fase1 auf Hugging Face öffentlich zugänglich.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.