DeepSeek stellt „Thinking with Visual Primitives"-Framework vor
ToolsDeepSeek
CompaniesDeepSeek
Warum es zählt
Das Framework ermöglicht es Modellen, während des Denkens auf spezifische Bildregionen zu „zeigen", was multimodale Reasoning-Fähigkeiten verbessert. Dies könnte visuell-räumliche Aufgaben präziser machen, besonders für visuelle Verständnisaufgaben und komplexe räumliche Analysen.
— Lumeric Redaktion
Was wir noch wissen
- Kooperation mit Peking University und Tsinghua University an der Entwicklung beteiligt
- Räumliche Tokens (Koordinaten, Bounding Boxes) als minimale Gedankeneinheiten im Reasoning-Prozess
- Framework ermöglicht dem Modell, während des Denkens auf spezifische Bildpositionen zu verweisen
- Open-Source-Repository wurde kurz nach Veröffentlichung von DeepSeek entfernt
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org2w
SSV-CoT: Strukturiertes sequenzielles visuelles Chain-of-Thought für multimodale LLMs
- FORSCHUNGarxiv.org0mo
MetaReason: Multimodales Reasoning für Geometrie via Meta-Information
- FORSCHUNGarxiv.org5d
MV-STRIDE: Neuer Datensatz für 3D-Spatial-Reasoning in MLLMs
- FORSCHUNGarxiv.org3w
Scaffolding Minds verbessert multimodales Reasoning um bis zu +19%
DeepSeek stellt „Thinking with Visual Primitives"-Framework vor
ToolsDeepSeek
CompaniesDeepSeek
Warum es zählt
Das Framework ermöglicht es Modellen, während des Denkens auf spezifische Bildregionen zu „zeigen", was multimodale Reasoning-Fähigkeiten verbessert. Dies könnte visuell-räumliche Aufgaben präziser machen, besonders für visuelle Verständnisaufgaben und komplexe räumliche Analysen.
— Lumeric Redaktion
Was wir noch wissen
- Kooperation mit Peking University und Tsinghua University an der Entwicklung beteiligt
- Räumliche Tokens (Koordinaten, Bounding Boxes) als minimale Gedankeneinheiten im Reasoning-Prozess
- Framework ermöglicht dem Modell, während des Denkens auf spezifische Bildpositionen zu verweisen
- Open-Source-Repository wurde kurz nach Veröffentlichung von DeepSeek entfernt
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org2w
SSV-CoT: Strukturiertes sequenzielles visuelles Chain-of-Thought für multimodale LLMs
- FORSCHUNGarxiv.org0mo
MetaReason: Multimodales Reasoning für Geometrie via Meta-Information
- FORSCHUNGarxiv.org5d
MV-STRIDE: Neuer Datensatz für 3D-Spatial-Reasoning in MLLMs
- FORSCHUNGarxiv.org3w
Scaffolding Minds verbessert multimodales Reasoning um bis zu +19%