Budget-KI-Rig aus Serverabfall: Xeon E5 + RTX 3090 für unter 800€
Der niederländische Hobbyist schildert einen monatelangen Beschaffungsmarathon voller Rückschläge: Ein eGPU-Dock scheiterte an mangelnder USB4-Praxiskonformität des Laptops, ein Fujitsu-Celsius-Server wurde vom Kurierdienst DPD zerstört, zwei Motherboards aus China kamen defekt an, ein Netzteil musste zurückgeschickt werden – erst das Supermicro X9DR3-F lief am Ende zumindest teilweise an. Das Mainboard hat nur 6 der 16 Speicherslots intakt, weshalb statt der theoretisch möglichen 8 DDR3-Kanäle mit 256 GB nur eine unklare Anzahl Kanäle mit 192 GB tatsächlich genutzt werden kann. Die RTX 3090 war günstig, weil ihre Kühlung defekt war; der Nutzer entfernte das Shroud und befestigte drei 90-mm-Statikdruck-Lüfter mit Kabelbindern – seitdem funktioniert sie. Als Betriebssystem läuft Ubuntu 26.04 LTS mit Kernel 7.0.0-27 auf dem Dual-Socket-System mit insgesamt 40 logischen CPU-Kernen. Für DeepSeek V4 Flash nutzt er llama-server mit NUMA-Verteilung über beide Xeon-Sockets sowie cpu-moe=true, um die MoE-Experten explizit auf den CPUs zu halten und VRAM zu schonen. Cydonia v4.3 – ein Finetune auf Basis von Mistral Small 3.2 – läuft fast vollständig auf der GPU und erzielt mit 308,92 t/s Prompt-Processing-Geschwindigkeit einen deutlich höheren PP-Wert, die Token-Generierung bleibt mit 7,8 t/s aber ebenfalls hinter den Erwartungen des Nutzers.
- Supermicro X9DR3-F: nur 6 von 16 RAM-Slots funktionieren – statt 8×32 GB in 8 Kanälen laufen 6×32 GB in unklar vielen Kanälen.
- llama-server-Config für DeepSeek V4 Flash: ctx-size=32768, ngl=auto, cpu-moe=true, numa=distribute, mmap=false – Kontext praktisch auf 8k limitiert.
- Beide Xeon E5-2660 v2 kosten je 20€ (40€ gesamt); je 10 Kerne / 20 Threads bei 95W TDP.
- Corsair RM1000x (1000W) als Netzteil für 95€ – ein früheres Netzteil war defekt und wurde zurückgeschickt.
- Cydonia v4.3 setzt 'auto' auf 16k Kontext und offloaded kaum auf die GPU, läuft damit fast vollständig im VRAM der RTX 3090.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Budget-KI-Rig aus Serverabfall: Xeon E5 + RTX 3090 für unter 800€
Der niederländische Hobbyist schildert einen monatelangen Beschaffungsmarathon voller Rückschläge: Ein eGPU-Dock scheiterte an mangelnder USB4-Praxiskonformität des Laptops, ein Fujitsu-Celsius-Server wurde vom Kurierdienst DPD zerstört, zwei Motherboards aus China kamen defekt an, ein Netzteil musste zurückgeschickt werden – erst das Supermicro X9DR3-F lief am Ende zumindest teilweise an. Das Mainboard hat nur 6 der 16 Speicherslots intakt, weshalb statt der theoretisch möglichen 8 DDR3-Kanäle mit 256 GB nur eine unklare Anzahl Kanäle mit 192 GB tatsächlich genutzt werden kann. Die RTX 3090 war günstig, weil ihre Kühlung defekt war; der Nutzer entfernte das Shroud und befestigte drei 90-mm-Statikdruck-Lüfter mit Kabelbindern – seitdem funktioniert sie. Als Betriebssystem läuft Ubuntu 26.04 LTS mit Kernel 7.0.0-27 auf dem Dual-Socket-System mit insgesamt 40 logischen CPU-Kernen. Für DeepSeek V4 Flash nutzt er llama-server mit NUMA-Verteilung über beide Xeon-Sockets sowie cpu-moe=true, um die MoE-Experten explizit auf den CPUs zu halten und VRAM zu schonen. Cydonia v4.3 – ein Finetune auf Basis von Mistral Small 3.2 – läuft fast vollständig auf der GPU und erzielt mit 308,92 t/s Prompt-Processing-Geschwindigkeit einen deutlich höheren PP-Wert, die Token-Generierung bleibt mit 7,8 t/s aber ebenfalls hinter den Erwartungen des Nutzers.
- Supermicro X9DR3-F: nur 6 von 16 RAM-Slots funktionieren – statt 8×32 GB in 8 Kanälen laufen 6×32 GB in unklar vielen Kanälen.
- llama-server-Config für DeepSeek V4 Flash: ctx-size=32768, ngl=auto, cpu-moe=true, numa=distribute, mmap=false – Kontext praktisch auf 8k limitiert.
- Beide Xeon E5-2660 v2 kosten je 20€ (40€ gesamt); je 10 Kerne / 20 Threads bei 95W TDP.
- Corsair RM1000x (1000W) als Netzteil für 95€ – ein früheres Netzteil war defekt und wurde zurückgeschickt.
- Cydonia v4.3 setzt 'auto' auf 16k Kontext und offloaded kaum auf die GPU, läuft damit fast vollständig im VRAM der RTX 3090.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.