★ Begriff· Training & Inferenz
Throughput
Tokens-pro-Sekunde, die ein Inference-Endpoint unter Last produziert. Wichtig für Batch-Workloads (Embeddings, Document-Processing). Trade-off mit Latency: Batch-Mode = höherer Throughput, aber höhere TTFT pro Request.
Verwandte Tools
Auch bekannt als
tokens per second · tok/s
Aktivität
37
Mentions in den letzten 7 Tagen
4 Wochen
⚡neu · 37×
Zuletzt erwähnt in
- Robion: VLA-Serving-System für Multi-Roboter-Betrieb auf Edge-GPUs2026-09-14
- AsyncFlow: Asynchrones Streaming-RL-Framework für effizientes LLM Post-Training2026-09-14
- Bianchi-Schätzer für Kommunikationszeit in Federated Learning über 802.112026-09-14
- Block-Diffusion mit O(1)-Cache: Mamba liefert 14× höheren Durchsatz bei 256k Token2026-09-14
- Quality-Constrained Routing für quantisierte MoE-Modelle aus fixem Instanz-Pool2026-09-14