★ Begriff· Training & Inferenz
Throughput
Tokens-pro-Sekunde, die ein Inference-Endpoint unter Last produziert. Wichtig für Batch-Workloads (Embeddings, Document-Processing). Trade-off mit Latency: Batch-Mode = höherer Throughput, aber höhere TTFT pro Request.
Verwandte Tools
Auch bekannt als
tokens per second · tok/s
Aktivität
33
Mentions in den letzten 7 Tagen
4 Wochen
⚡neu · 33×
Zuletzt erwähnt in
- MAPS: Memory-bewusstes Scheduling reduziert LLM-Latenz um bis zu 84,8 %2026-09-15
- GGUF-Metadaten sagen llama.cpp-Durchsatz über drei Systeme voraus2026-09-15
- El Agente Potente: Agentisches System für hochdurchsatz-Atomsimulationen mit MLIPs2026-09-15
- ReWAM: 5× schnellere multimodale Embeddings durch retrieval-gesteuertes Reasoning2026-09-15
- Naive Bayes schlägt LLMs bei Textklassifikation mit gelabelten Daten2026-09-15