★ Begriff· Infrastruktur
Cold Start
Verzögerung beim ersten Request nach Idle — Container muss hochgefahren, Modell-Gewichte ins GPU-Memory geladen werden. Bei 70B-Modellen 30-90s. Mitigated durch Warm-Pools.
Verwandte Tools
Auch bekannt als
cold-start · kaltstart
Aktivität
5
Mentions in den letzten 7 Tagen
4 Wochen
⚡neu · 5×
Zuletzt erwähnt in
- GUIDE: LLM-Architektur inferiert Nutzerpräferenzen per Bayes'schem adaptivem Sampling2026-09-14
- TensorSharp: DeepSeek V4.1 Flash auf 8× A40 mit bis zu 40 tok/s2026-09-12
- Helion-Kernels jetzt über Hugging Face Kernels Hub verteilbar2026-09-11
- MADS: Multi-Agenten-Framework generiert Überzeugungsdialoge ohne menschliche Annotation2026-09-11
- Ensemble-Ansatz für Ferienwohnung-Empfehlungen verbessert Recall@300 um 14,8 %2026-09-10