ASCIITermDraw-Bench bewertet VLMs bei ASCII-Diagramm-Generierung
ASCIITermDraw-Bench adressiert eine Lücke in der Benchmark-Landschaft: Während gängige Evaluierungen sich auf Coding, Mathematik und Reasoning konzentrieren, bleibt die Fähigkeit von Modellen, präzise ASCII-Diagramme zu erzeugen, bislang kaum standardisiert gemessen. Der Benchmark umfasst 80 Aufgaben in vier Kategorien: einfache Box-Layouts, Netzwerktopologien, Software-Architekturdiagramme sowie bildkonditioniertes Diagramm-Editing – bei letzterem muss ein Modell gezielt Teile eines bestehenden Diagramms verändern, ohne den Rest zu beschädigen. Die Bewertung erfolgt zweistufig: Ein struktureller Score prüft, ob geforderte Labels, Kanten und Entitäten vorhanden sind; ein semantischer Score wird von einem LLM-Judge erzeugt, der jede Aufgabe fünfmal bewertet, um Urteilsvarianz zu reduzieren. Die Ergebnisse werden mit einem 95-%-Konfidenzintervall ausgewiesen, was die Aussagekraft gegenüber rein visuellen Plausibilitätschecks erhöht. Das aktuelle Leaderboard führt Gemma-4-31B-IT mit 73,8 % (±4,1) an, gefolgt von Qwen3.7-Plus mit 70,2 % (±4,6); das kleinste gelistete Modell, Qwen3.5-9B mit 9 Milliarden Parametern, erreicht noch 47,0 % (±6,4). Zwölf Beispielaufgaben sowie die vollständige Methodik sind auf Hugging Face öffentlich zugänglich, sodass Dritte den Benchmark eigenständig nachvollziehen und ausführen können. Der Benchmark wurde von Reddit-Nutzer /u/East-Muffin-6472 vorgestellt und richtet sich explizit an Entwickler, die LLMs für rein textbasierte Darstellungen von Systemarchitekturen oder Infrastrukturtopologien einsetzen wollen.
- 80 Aufgaben in 4 Kategorien: Box-Layouts, Netzwerktopologien, Software-Architektur, bildkonditioniertes Editing.
- Doppelte Bewertung pro Antwort: struktureller Score (Labels, Kanten, Entitäten) + semantischer LLM-Judge-Score (5× pro Task).
- Konfidenzintervalle von ±4,1 bis ±7,1 Prozentpunkten zeigen, dass kleinere Modelle stärker streuen.
- Ternary-Bonsai-27B (45,9 %, ±7,1) ist das einzige nicht-kommerzielle/Community-Modell im aktuellen Leaderboard.
- Zwölf Beispielaufgaben und vollständige Methodik sind öffentlich auf Hugging Face verfügbar – der Benchmark ist selbst ausführbar.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org9h
VLM-basiertes Framework erzeugt semantisch strukturierte, editierbare SVGs
- FORSCHUNGarxiv.org1w
VectorGym: Neuer SVG-Benchmark für Generierung, Skizzierung und Editing
- FORSCHUNGarxiv.org1w
SciGram: 1,4M visuelle Instruktionen für wissenschaftliche Diagramme
- FORSCHUNGhuggingface.co5d
Φ-Bench: Neuer Benchmark testet LLMs bei LLM-Infrastruktur-Engineering
ASCIITermDraw-Bench bewertet VLMs bei ASCII-Diagramm-Generierung
ASCIITermDraw-Bench adressiert eine Lücke in der Benchmark-Landschaft: Während gängige Evaluierungen sich auf Coding, Mathematik und Reasoning konzentrieren, bleibt die Fähigkeit von Modellen, präzise ASCII-Diagramme zu erzeugen, bislang kaum standardisiert gemessen. Der Benchmark umfasst 80 Aufgaben in vier Kategorien: einfache Box-Layouts, Netzwerktopologien, Software-Architekturdiagramme sowie bildkonditioniertes Diagramm-Editing – bei letzterem muss ein Modell gezielt Teile eines bestehenden Diagramms verändern, ohne den Rest zu beschädigen. Die Bewertung erfolgt zweistufig: Ein struktureller Score prüft, ob geforderte Labels, Kanten und Entitäten vorhanden sind; ein semantischer Score wird von einem LLM-Judge erzeugt, der jede Aufgabe fünfmal bewertet, um Urteilsvarianz zu reduzieren. Die Ergebnisse werden mit einem 95-%-Konfidenzintervall ausgewiesen, was die Aussagekraft gegenüber rein visuellen Plausibilitätschecks erhöht. Das aktuelle Leaderboard führt Gemma-4-31B-IT mit 73,8 % (±4,1) an, gefolgt von Qwen3.7-Plus mit 70,2 % (±4,6); das kleinste gelistete Modell, Qwen3.5-9B mit 9 Milliarden Parametern, erreicht noch 47,0 % (±6,4). Zwölf Beispielaufgaben sowie die vollständige Methodik sind auf Hugging Face öffentlich zugänglich, sodass Dritte den Benchmark eigenständig nachvollziehen und ausführen können. Der Benchmark wurde von Reddit-Nutzer /u/East-Muffin-6472 vorgestellt und richtet sich explizit an Entwickler, die LLMs für rein textbasierte Darstellungen von Systemarchitekturen oder Infrastrukturtopologien einsetzen wollen.
- 80 Aufgaben in 4 Kategorien: Box-Layouts, Netzwerktopologien, Software-Architektur, bildkonditioniertes Editing.
- Doppelte Bewertung pro Antwort: struktureller Score (Labels, Kanten, Entitäten) + semantischer LLM-Judge-Score (5× pro Task).
- Konfidenzintervalle von ±4,1 bis ±7,1 Prozentpunkten zeigen, dass kleinere Modelle stärker streuen.
- Ternary-Bonsai-27B (45,9 %, ±7,1) ist das einzige nicht-kommerzielle/Community-Modell im aktuellen Leaderboard.
- Zwölf Beispielaufgaben und vollständige Methodik sind öffentlich auf Hugging Face verfügbar – der Benchmark ist selbst ausführbar.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org9h
VLM-basiertes Framework erzeugt semantisch strukturierte, editierbare SVGs
- FORSCHUNGarxiv.org1w
VectorGym: Neuer SVG-Benchmark für Generierung, Skizzierung und Editing
- FORSCHUNGarxiv.org1w
SciGram: 1,4M visuelle Instruktionen für wissenschaftliche Diagramme
- FORSCHUNGhuggingface.co5d
Φ-Bench: Neuer Benchmark testet LLMs bei LLM-Infrastruktur-Engineering