
Hetzner testet LLM-Inference-API mit Qwen3-Modell und 262K Kontext
CompaniesOpenAI
Warum es zählt
Eine Hetzner-Inference-API mit 153 ms medianem Time-to-First-Token und 224 Output-Tokens/Sek. könnte europäische GPU-Kapazität kostengünstig für Entwickler erschließen. Limitierung: Aktuell nur ein Modell, Workstation-GPUs ohne Multi-GPU-Unterstützung für sehr große Modelle.
— Lumeric Redaktion
224 Tokens/Sek.
Output-Durchsatz im Experiment
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHtogether.ai2w
Together AI startet Provisioned Throughput für Open-Source-Modelle
- LAUNCHiroh.computer1w
Mesh LLM: Verteiltes KI-Computing über iroh-Netzwerk
- FORSCHUNGarxiv.org3w
WattGPU: LLM-Inferenzleistung auf unbekannten GPUs ohne Profiling vorhersagen
- LAUNCHpytorch.org0mo
PyTorch TokenSpeed-Kernel: Portable API für Multi-Silicon LLM-Inferenz

Hetzner testet LLM-Inference-API mit Qwen3-Modell und 262K Kontext
CompaniesOpenAI
Warum es zählt
Eine Hetzner-Inference-API mit 153 ms medianem Time-to-First-Token und 224 Output-Tokens/Sek. könnte europäische GPU-Kapazität kostengünstig für Entwickler erschließen. Limitierung: Aktuell nur ein Modell, Workstation-GPUs ohne Multi-GPU-Unterstützung für sehr große Modelle.
— Lumeric Redaktion
224 Tokens/Sek.
Output-Durchsatz im Experiment
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHtogether.ai2w
Together AI startet Provisioned Throughput für Open-Source-Modelle
- LAUNCHiroh.computer1w
Mesh LLM: Verteiltes KI-Computing über iroh-Netzwerk
- FORSCHUNGarxiv.org3w
WattGPU: LLM-Inferenzleistung auf unbekannten GPUs ohne Profiling vorhersagen
- LAUNCHpytorch.org0mo
PyTorch TokenSpeed-Kernel: Portable API für Multi-Silicon LLM-Inferenz