Microsoft veröffentlicht Fara1.5-27B: Multimodaler Browser-Agent für Web-Automatisierung
Fara1.5-27B stammt aus dem Forschungsbereich Microsoft Research AI Frontiers und gehört zu einer dreiteiligen Modellfamilie (4B, 9B, 27B), die alle auf HuggingFace verfügbar sind – wobei das 9B-Modell in der offiziellen Modellkarte zwar erwähnt wird, aber nicht direkt über die Hauptseite auffindbar ist. Das Basismodell ist Qwen3.5-27B, das mittels supervised fine-tuning auf synthetisch erzeugten Trajektorien trainiert wurde. Diese Trainingsdaten stammen aus FaraGen1.5, einer internen Multi-Agenten-Pipeline, die Web-Aufgaben generiert, ausführt und die Ergebnisse vor dem Training verifiziert. Fara1.5-27B gibt Aktionen als strukturierte Tool-Calls aus – darunter Klick, Tippen, Scrollen, URL-Aufruf und Web-Suche –, wobei Koordinaten pixelgenau aus dem Screenshot abgeleitet werden, ohne dass ein DOM- oder Accessibility-Tree-Zugriff erfolgt. Die Inferenz basiert ausschließlich auf visueller Wahrnehmung; internes Reasoning und die Aktionshistorie werden als Text verwaltet. Als primäre Einsatzgebiete nennt Microsoft repetitive Web-Aufgaben wie Formularausfüllung, Online-Shopping und Reisebuchungen sowie die Verwendung als Grounding-Modell in fremden Agenten-Pipelines. Das empfohlene Deployment-Framework ist MagenticLite, das Microsoft sowohl für Forschungs- als auch für Produktionsszenarien vorsieht.
- Trainingsdaten wurden von FaraGen1.5 synthetisch erzeugt: Die Pipeline generiert Web-Aufgaben, führt Lösungstrajektorien aus und verifiziert Ergebnisse vor dem Training.
- Das Modell gibt strukturierte Tool-Calls aus: click, type, scroll, visit_url, web_search — pixelgenaue Koordinaten werden direkt aus dem Screenshot abgeleitet.
- Bekannte Schwäche: Frühzeitige Fehlklicks in mehrstufigen Trajektorien können sich kaskadenartig auf nachfolgende Schritte auswirken (Error Accumulation).
- Explizit ausgeschlossen: Nicht-englische Sprachen (Training nur auf Englisch), Hochrisiko-Domänen (Recht, Gesundheit, Finanzen) und ungesandboxte Deployments mit Zugriff auf sensible Accounts.
- Benchmark-Zahlen basieren auf Durchschnittswerten über mehrere Runs, da die Run-to-Run-Varianz bei Multi-Turn-Aufgaben laut Modellkarte nicht trivial ist.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Microsoft veröffentlicht Fara1.5-27B: Multimodaler Browser-Agent für Web-Automatisierung
Fara1.5-27B stammt aus dem Forschungsbereich Microsoft Research AI Frontiers und gehört zu einer dreiteiligen Modellfamilie (4B, 9B, 27B), die alle auf HuggingFace verfügbar sind – wobei das 9B-Modell in der offiziellen Modellkarte zwar erwähnt wird, aber nicht direkt über die Hauptseite auffindbar ist. Das Basismodell ist Qwen3.5-27B, das mittels supervised fine-tuning auf synthetisch erzeugten Trajektorien trainiert wurde. Diese Trainingsdaten stammen aus FaraGen1.5, einer internen Multi-Agenten-Pipeline, die Web-Aufgaben generiert, ausführt und die Ergebnisse vor dem Training verifiziert. Fara1.5-27B gibt Aktionen als strukturierte Tool-Calls aus – darunter Klick, Tippen, Scrollen, URL-Aufruf und Web-Suche –, wobei Koordinaten pixelgenau aus dem Screenshot abgeleitet werden, ohne dass ein DOM- oder Accessibility-Tree-Zugriff erfolgt. Die Inferenz basiert ausschließlich auf visueller Wahrnehmung; internes Reasoning und die Aktionshistorie werden als Text verwaltet. Als primäre Einsatzgebiete nennt Microsoft repetitive Web-Aufgaben wie Formularausfüllung, Online-Shopping und Reisebuchungen sowie die Verwendung als Grounding-Modell in fremden Agenten-Pipelines. Das empfohlene Deployment-Framework ist MagenticLite, das Microsoft sowohl für Forschungs- als auch für Produktionsszenarien vorsieht.
- Trainingsdaten wurden von FaraGen1.5 synthetisch erzeugt: Die Pipeline generiert Web-Aufgaben, führt Lösungstrajektorien aus und verifiziert Ergebnisse vor dem Training.
- Das Modell gibt strukturierte Tool-Calls aus: click, type, scroll, visit_url, web_search — pixelgenaue Koordinaten werden direkt aus dem Screenshot abgeleitet.
- Bekannte Schwäche: Frühzeitige Fehlklicks in mehrstufigen Trajektorien können sich kaskadenartig auf nachfolgende Schritte auswirken (Error Accumulation).
- Explizit ausgeschlossen: Nicht-englische Sprachen (Training nur auf Englisch), Hochrisiko-Domänen (Recht, Gesundheit, Finanzen) und ungesandboxte Deployments mit Zugriff auf sensible Accounts.
- Benchmark-Zahlen basieren auf Durchschnittswerten über mehrere Runs, da die Run-to-Run-Varianz bei Multi-Turn-Aufgaben laut Modellkarte nicht trivial ist.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.