SIQ-1: Qwen-35B mit PPO für autonome Agenten und Autoresearch
SIQ-1 ist ein Fine-Tune des Qwen-35B-A3-Modells (ein Mixture-of-Experts-Modell mit 35 Milliarden Parametern, davon 3 Milliarden aktiv), das vom Community-Nutzer /u/Mysterious_Hearing14 bzw. HuggingFace-Account AlexWortega mit PPO (Proximal Policy Optimization) und verifizierbarem Reward trainiert wurde. PPO ist ein Reinforcement-Learning-Verfahren, das im Bereich der Sprachmodelle zuletzt vor allem durch RLHF bekannt wurde, aber laut Autor hier erstmals bei ihm spürbare Qualitätssteigerungen gegenüber dem Basismodell gezeigt hat. Als Evaluierungsrahmen dienen zum einen karpathy/autoresearch, ein Benchmark für sogenanntes „Parameter-Golf" im Bereich autonomer Forschungsagenten, sowie „bullshit-bench", ein offenbar auf Resistenz gegenüber unsinnigen oder irreführenden Prompts ausgerichteter Test. Auf karpathy/autoresearch soll SIQ-1 sowohl GLM-5.2 als auch das deutlich größere Qwen-350B übertreffen, wobei der Autor die Qualität der generierten Ideen mit Opus4.8 vergleicht. Auf bullshit-bench werden NEX und GPT-5.5 als übertroffen genannt. Modell und quantisiertes GGUF-Format sind auf HuggingFace unter AlexWortega/SIQ-1-35B öffentlich verfügbar. Zum Ausprobieren steht zudem ein Agent-Demo auf ZeroGPU (HuggingFace Spaces) bereit, was einen niedrigschwelligen Einstieg ohne lokale Hardware ermöglicht.
- Basismodell ist Qwen-35B-A3 (MoE, 35B Parameter gesamt, ~3B aktiv) – kein vollparametrisches 35B-Modell.
- Training erfolgte mit PPO und verifizierbarem Reward, nicht mit SFT oder DPO allein.
- Modell und GGUF sind öffentlich auf HuggingFace unter AlexWortega/SIQ-1-35B abrufbar.
- Interaktive Demo läuft als Hermes-Agent auf HuggingFace Spaces (ZeroGPU), d. h. ohne lokale GPU nutzbar.
- Vergleichsmodelle auf karpathy/autoresearch: GLM-5.2 und Qwen-350B; auf bullshit-bench: NEX und GPT-5.5.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org3w
SRPO: Self-Reflective Policy Optimization für effizienteres LLM-Training
- FORSCHUNGarxiv.org1w
APEx: Hierarchisches Framework für Deep Research Agents übertrifft GPT-5.4 um 14,7 Punkte
- FORSCHUNGarxiv.org3w
OPDSearch+: Suche-augmentiertes Reasoning für 3B-Modelle ohne Teacher-Finetuning
SIQ-1: Qwen-35B mit PPO für autonome Agenten und Autoresearch
SIQ-1 ist ein Fine-Tune des Qwen-35B-A3-Modells (ein Mixture-of-Experts-Modell mit 35 Milliarden Parametern, davon 3 Milliarden aktiv), das vom Community-Nutzer /u/Mysterious_Hearing14 bzw. HuggingFace-Account AlexWortega mit PPO (Proximal Policy Optimization) und verifizierbarem Reward trainiert wurde. PPO ist ein Reinforcement-Learning-Verfahren, das im Bereich der Sprachmodelle zuletzt vor allem durch RLHF bekannt wurde, aber laut Autor hier erstmals bei ihm spürbare Qualitätssteigerungen gegenüber dem Basismodell gezeigt hat. Als Evaluierungsrahmen dienen zum einen karpathy/autoresearch, ein Benchmark für sogenanntes „Parameter-Golf" im Bereich autonomer Forschungsagenten, sowie „bullshit-bench", ein offenbar auf Resistenz gegenüber unsinnigen oder irreführenden Prompts ausgerichteter Test. Auf karpathy/autoresearch soll SIQ-1 sowohl GLM-5.2 als auch das deutlich größere Qwen-350B übertreffen, wobei der Autor die Qualität der generierten Ideen mit Opus4.8 vergleicht. Auf bullshit-bench werden NEX und GPT-5.5 als übertroffen genannt. Modell und quantisiertes GGUF-Format sind auf HuggingFace unter AlexWortega/SIQ-1-35B öffentlich verfügbar. Zum Ausprobieren steht zudem ein Agent-Demo auf ZeroGPU (HuggingFace Spaces) bereit, was einen niedrigschwelligen Einstieg ohne lokale Hardware ermöglicht.
- Basismodell ist Qwen-35B-A3 (MoE, 35B Parameter gesamt, ~3B aktiv) – kein vollparametrisches 35B-Modell.
- Training erfolgte mit PPO und verifizierbarem Reward, nicht mit SFT oder DPO allein.
- Modell und GGUF sind öffentlich auf HuggingFace unter AlexWortega/SIQ-1-35B abrufbar.
- Interaktive Demo läuft als Hermes-Agent auf HuggingFace Spaces (ZeroGPU), d. h. ohne lokale GPU nutzbar.
- Vergleichsmodelle auf karpathy/autoresearch: GLM-5.2 und Qwen-350B; auf bullshit-bench: NEX und GPT-5.5.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org3w
SRPO: Self-Reflective Policy Optimization für effizienteres LLM-Training
- FORSCHUNGarxiv.org1w
APEx: Hierarchisches Framework für Deep Research Agents übertrifft GPT-5.4 um 14,7 Punkte
- FORSCHUNGarxiv.org3w
OPDSearch+: Suche-augmentiertes Reasoning für 3B-Modelle ohne Teacher-Finetuning