ThinkingCap LoRA für Qwen 3.6 auf Qwen 3.8 getestet – weniger Tokens, ähnliche Qualität
Der Reddit-Nutzer CapsAdmin hat zwei ThinkingCap-LoRAs, die ursprünglich für Qwen 3.6 (27B) entwickelt wurden, auf dem Qwen-3.8-Modell getestet – konkret die Varianten von „signsur4739379373" (Rank-64-LoRA) und „hotdogs" auf HuggingFace. Grundlage des Transfers ist die gemeinsame Architektur von Qwen 3.6 und 3.8, die eine direkte LoRA-Anwendung über Modellgrenzen hinweg erlaubt. Als Testprompt diente der klassische Benchmark-Satz „Generate an SVG of a pelican riding a bicycle", wobei alle Varianten mit identischem Seed, empfohlenem Sampling-Profil und dem integrierten Chat-Template liefen. Der Vergleich umfasst vier Konfigurationen: Standard-xhigh, xhigh mit ThinkingCap-LoRA von signsur4739379373 (Skala 30), xhigh mit ThinkingCap-LoRA von hotdogs (Skala 1) sowie den Standard-medium-Modus. Beim Einsatz der LoRAs sank die Token-Zahl von rund 33.000 auf etwa 20.000, während die Ausgabequalität subjektiv vergleichbar blieb, jedoch etwas weniger detailliert wirkte. Der medium-Modus erzeugte nur rund 3.500 Tokens, zeigte aber einen deutlich spürbaren Qualitätseinbruch. CapsAdmin entwickelte für den Test ein Python-Skript, das llama-cli startet und die Ausgaben inklusive Logs, Chat-Turn-Protokoll und Startparameter in einer einzigen HTML-Datei archiviert – zum Zweck der vollständigen Reproduzierbarkeit. Der Autor selbst ist unsicher, ob der Qualitätseindruck tatsächlich einer verbesserten Effizienz entspricht oder ob das Modell durch die fremde LoRA lediglich in seiner Denktiefe degradiert wird, und lädt die Community zur weiteren Untersuchung ein.
- Die ThinkingCap-LoRAs stammen von zwei HuggingFace-Repos: signsur4739379373/Qwen3.6-27B-ThinkingCap-LoRA (Rank 64) und hotdogs/Qwen3.6_thinkingcap_lora.
- Die LoRA wird per llama-cli-Flag --lora-scaled eingebunden; getestete Skalierungswerte waren 30 (signsur-Variante) und 1 (hotdogs-Variante).
- Erhöht man die LoRA-Stärke über die getesteten Werte hinaus, sinkt die Token-Zahl weiter, aber die Ausgabequalität verschlechtert sich spürbar.
- Das Test-Python-Skript speichert llama-cli-Log, Chat-Turn-Log, Startparameter und den Skriptcode selbst in einer einzigen HTML-Datei für vollständige Reproduzierbarkeit.
- CapsAdmin erwägt als nächsten Schritt das Mergen der LoRA-Gewichte, hält das Experiment aber ausdrücklich für vorläufig und bittet um Community-Feedback.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
ThinkingCap LoRA für Qwen 3.6 auf Qwen 3.8 getestet – weniger Tokens, ähnliche Qualität
Der Reddit-Nutzer CapsAdmin hat zwei ThinkingCap-LoRAs, die ursprünglich für Qwen 3.6 (27B) entwickelt wurden, auf dem Qwen-3.8-Modell getestet – konkret die Varianten von „signsur4739379373" (Rank-64-LoRA) und „hotdogs" auf HuggingFace. Grundlage des Transfers ist die gemeinsame Architektur von Qwen 3.6 und 3.8, die eine direkte LoRA-Anwendung über Modellgrenzen hinweg erlaubt. Als Testprompt diente der klassische Benchmark-Satz „Generate an SVG of a pelican riding a bicycle", wobei alle Varianten mit identischem Seed, empfohlenem Sampling-Profil und dem integrierten Chat-Template liefen. Der Vergleich umfasst vier Konfigurationen: Standard-xhigh, xhigh mit ThinkingCap-LoRA von signsur4739379373 (Skala 30), xhigh mit ThinkingCap-LoRA von hotdogs (Skala 1) sowie den Standard-medium-Modus. Beim Einsatz der LoRAs sank die Token-Zahl von rund 33.000 auf etwa 20.000, während die Ausgabequalität subjektiv vergleichbar blieb, jedoch etwas weniger detailliert wirkte. Der medium-Modus erzeugte nur rund 3.500 Tokens, zeigte aber einen deutlich spürbaren Qualitätseinbruch. CapsAdmin entwickelte für den Test ein Python-Skript, das llama-cli startet und die Ausgaben inklusive Logs, Chat-Turn-Protokoll und Startparameter in einer einzigen HTML-Datei archiviert – zum Zweck der vollständigen Reproduzierbarkeit. Der Autor selbst ist unsicher, ob der Qualitätseindruck tatsächlich einer verbesserten Effizienz entspricht oder ob das Modell durch die fremde LoRA lediglich in seiner Denktiefe degradiert wird, und lädt die Community zur weiteren Untersuchung ein.
- Die ThinkingCap-LoRAs stammen von zwei HuggingFace-Repos: signsur4739379373/Qwen3.6-27B-ThinkingCap-LoRA (Rank 64) und hotdogs/Qwen3.6_thinkingcap_lora.
- Die LoRA wird per llama-cli-Flag --lora-scaled eingebunden; getestete Skalierungswerte waren 30 (signsur-Variante) und 1 (hotdogs-Variante).
- Erhöht man die LoRA-Stärke über die getesteten Werte hinaus, sinkt die Token-Zahl weiter, aber die Ausgabequalität verschlechtert sich spürbar.
- Das Test-Python-Skript speichert llama-cli-Log, Chat-Turn-Log, Startparameter und den Skriptcode selbst in einer einzigen HTML-Datei für vollständige Reproduzierbarkeit.
- CapsAdmin erwägt als nächsten Schritt das Mergen der LoRA-Gewichte, hält das Experiment aber ausdrücklich für vorläufig und bittet um Community-Feedback.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.