AndroidLife-Benchmark: Qwen3-28B schafft nur 56,7 % auf echtem Smartphone
Warum es zählt
Selbst das aktuell beste Textmodell scheitert bei 43 % der Alltagsaufgaben – besonders bei Multi-App-Abläufen (nur 23,5 % bei „hard"). Kosten von 0,118 $ und 6 Minuten pro Aufgabe zeigen, dass agentenbasierte Smartphone-Steuerung noch weit von praxistauglicher Effizienz entfernt ist.
— Lumeric Redaktion
AndroidLife (60 Tasks, Real Device) · Spitzenwert
80.8%
Easy Tasks
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
AndroidLife-Benchmark: Qwen3-28B schafft nur 56,7 % auf echtem Smartphone
Warum es zählt
Selbst das aktuell beste Textmodell scheitert bei 43 % der Alltagsaufgaben – besonders bei Multi-App-Abläufen (nur 23,5 % bei „hard"). Kosten von 0,118 $ und 6 Minuten pro Aufgabe zeigen, dass agentenbasierte Smartphone-Steuerung noch weit von praxistauglicher Effizienz entfernt ist.
— Lumeric Redaktion
AndroidLife (60 Tasks, Real Device) · Spitzenwert
80.8%
Easy Tasks
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.