vllm.cpp: vLLMs Serving-Stack als 66-MiB-C++20-Binary ohne Python
Warum es zählt
Inference lässt sich damit direkt in andere Software einbetten – ohne 9 GiB Python-Virtualenv, mit geringerem Supply-Chain-Risiko. Throughput liegt auf Augenhöhe mit vLLM, Peak-GPU-Memory ist deutlich niedriger (41 vs. 71 GiB). Unterstützt CUDA, Metal, Vulkan, CPU (AVX-512/ARM); Multi-GPU und ROCm fehlen noch.
— Lumeric Redaktion
Throughput tok/s – Qwen3.6-27B NVFP4, 1024in/128out, DGX Spark (GB10) · Spitzenwert
86.05%
vllm.cpp (c1)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com1w
TensorSharp vs. llama.cpp: Benchmark-Vergleich auf CUDA und Vulkan
- LAUNCHreddit.com3w
LFM 2.5-350M läuft per reinem WASM ohne GPU im Browser
- LAUNCHreddit.com6d
Tritium: Open-Source Ternary-LLM-Engine in Rust/CUDA für Consumer-GPUs
- BENCHMARKreddit.com1w
LFM 2.5 230M läuft mit 1440 tok/s im Browser via WebGPU
vllm.cpp: vLLMs Serving-Stack als 66-MiB-C++20-Binary ohne Python
Warum es zählt
Inference lässt sich damit direkt in andere Software einbetten – ohne 9 GiB Python-Virtualenv, mit geringerem Supply-Chain-Risiko. Throughput liegt auf Augenhöhe mit vLLM, Peak-GPU-Memory ist deutlich niedriger (41 vs. 71 GiB). Unterstützt CUDA, Metal, Vulkan, CPU (AVX-512/ARM); Multi-GPU und ROCm fehlen noch.
— Lumeric Redaktion
Throughput tok/s – Qwen3.6-27B NVFP4, 1024in/128out, DGX Spark (GB10) · Spitzenwert
86.05%
vllm.cpp (c1)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com1w
TensorSharp vs. llama.cpp: Benchmark-Vergleich auf CUDA und Vulkan
- LAUNCHreddit.com3w
LFM 2.5-350M läuft per reinem WASM ohne GPU im Browser
- LAUNCHreddit.com6d
Tritium: Open-Source Ternary-LLM-Engine in Rust/CUDA für Consumer-GPUs
- BENCHMARKreddit.com1w
LFM 2.5 230M läuft mit 1440 tok/s im Browser via WebGPU