CPU-only LLM-Inference auf 100-Dollar-SBC: 6 Modelle von 0.6B bis 8B getestet
Warum es zählt
Für Background-Tasks wie Klassifikation, Routing oder Summarization sind 0.6B-Modelle auf Sub-15W-x86-Hardware praktikabel – ein möglicher Ersatz für API-Calls. Das 8B-Limit liegt am Speicherbandbreitendurchsatz, nicht am RAM.
— Lumeric Redaktion
CPU-only Inference Speed (tok/s, Celeron N5095) · Spitzenwert
6.788%
Qwen3 0.6B
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
CPU-only LLM-Inference auf 100-Dollar-SBC: 6 Modelle von 0.6B bis 8B getestet
Warum es zählt
Für Background-Tasks wie Klassifikation, Routing oder Summarization sind 0.6B-Modelle auf Sub-15W-x86-Hardware praktikabel – ein möglicher Ersatz für API-Calls. Das 8B-Limit liegt am Speicherbandbreitendurchsatz, nicht am RAM.
— Lumeric Redaktion
CPU-only Inference Speed (tok/s, Celeron N5095) · Spitzenwert
6.788%
Qwen3 0.6B
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.