★ Begriff· Multimodal
VLM — Vision Language Model
Multimodal-Modell-Klasse mit Schwerpunkt Bild + Text. Beispiele: Llama 3.2 Vision, Qwen2-VL, InternVL. Anwendungen: OCR, Bildbeschreibung, UI-Verständnis für Computer-Use-Agents.
Verwandte Tools
Auch bekannt als
vlm · vision language model · vision-language model
Aktivität
14
Mentions in den letzten 7 Tagen
4 Wochen
⚡neu · 14×
Zuletzt erwähnt in
- Robion: VLA-Serving-System für Multi-Roboter-Betrieb auf Edge-GPUs2026-09-14
- Edge-VLMs bei Artenidentifikation: BioCLIP schlägt Allzweckmodelle deutlich2026-09-12
- VWG-Bench: Neuer Benchmark testet logisches Denken von Videogeneratoren2026-09-12
- Trajectory-Aware Decoding für Diffusion Vision-Language Models ohne Training2026-09-12
- VLMs zur automatischen Erkennung systematischer Klassifikationsfehler2026-09-12