Paddock: Open-Source-Inferenz-Engine in Rust/C++ mit eigenen CUDA-Kernels
Warum es zählt
Paddock überbietet vLLM in 13/13 und SGLang in 10/13 Benchmark-Zellen auf Qwen3.8-27B FP8; bei 32 Clients erreicht es 1062 tok/s vs. 958 (vLLM) und 844 (SGLang). Für Teams mit NVIDIA-GPUs (Blackwell/Ampere) ist es eine produktionserprobte Alternative mit ~300 Mrd. Tokens/Jahr Praxiserfahrung.
— Lumeric Redaktion
Throughput Qwen3.8-27B FP8 – 32 Clients, 1024in/1024out · Spitzenwert
1062%
Paddock
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Paddock: Open-Source-Inferenz-Engine in Rust/C++ mit eigenen CUDA-Kernels
Warum es zählt
Paddock überbietet vLLM in 13/13 und SGLang in 10/13 Benchmark-Zellen auf Qwen3.8-27B FP8; bei 32 Clients erreicht es 1062 tok/s vs. 958 (vLLM) und 844 (SGLang). Für Teams mit NVIDIA-GPUs (Blackwell/Ampere) ist es eine produktionserprobte Alternative mit ~300 Mrd. Tokens/Jahr Praxiserfahrung.
— Lumeric Redaktion
Throughput Qwen3.8-27B FP8 – 32 Clients, 1024in/1024out · Spitzenwert
1062%
Paddock
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.