
Ora benchmarkt alle großen AI-Agents auf Vercel-Infrastruktur
Ora wurde von Assaf Elovic und Liad Yosef gegründet, nachdem Elovics vorheriges Unternehmen Tavily – eine Web-Suchmaschine speziell für KI-Agenten – von Nebius übernommen wurde. Die Kernthese von Ora: 99 % des Webs ist noch nicht agenten-tauglich. Das Unternehmen schickt Agenten auf Live-Websites mit konkreten Aufgaben – Produkt-Registrierung, Integration, Bezahlung – und zeichnet Kosten, Latenz und Schrittanzahl jedes Runs auf. Ein zentrales technisches Problem ist, dass jeder Agent-Harness eine eigene Infrastruktur erwartet und seine Schritte unterschiedlich exponiert; Ora betreibt daher für jeden Harness eine separate Runtime und trackt jeden einzelnen Schritt. Das ermöglicht Kunden, nicht nur einen Gesamtscore zu sehen, sondern exakt den Schritt und die Aktion, bei der ein Agent in einem Signup-Flow hängenbleibt. Besonders relevant ist das Sandbox-Override-Feature von Vercels eve-Framework: Da ein Agent im Standard-Sandbox außerhalb der instrumentierten Ora-Umgebung läuft, braucht Ora die Möglichkeit, die Sandbox zu überschreiben – ein Kriterium, das die Entscheidung für eve als eigenes Build-Framework maßgeblich beeinflusst hat. Das 16-köpfige Engineering-Team unter Ido Finder pusht täglich hunderte Commits, was eine enge Deployment-Integration auf einer einzigen Plattform praktisch voraussetzt.
- Benchmarked wurden Claude Code, ChatGPT, Gemini, Hermes, OpenClaw und Vercels eve – alle unter identischen Bedingungen auf denselben Domains.
- Der initiale eve-vs.-Claude-Code-Test lief über hunderte realer Journeys auf mehreren Domains, beide Harnesses nutzten dieselben Modelle: Claude Fable 5 und Haiku 4.5.
- Ein einzelner Benchmark-Run deckte einen Prompt-Caching-Bug in eve auf; nach dem Fix des eve-Teams sank der Gesamtkostenwert im nächsten Lauf um rund 15 %.
- Ora arbeitet als Design-Partner mit Vercel Engineering zusammen: Engineering-Lead Ido Finder gab dem eve-Team direkten Plattformzugang für die Ergebnisanalyse.
- Frontend, Backend und Agent-Runtime teilen bei Ora denselben Deployment-Pfad, dieselben Logs und dieselbe Authentifizierung – ohne separate Infrastruktur für die Runtime.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org2w
BekchiAI: Benchmark und Plattform zur Messung und Kontrolle von LLM-Agenten
- FORSCHUNGarxiv.org3d
Era by Eon: Neuer Benchmark für LLM-Agenten in Enterprise-Systemen
- FORSCHUNGarxiv.org3w
StartupBench: Neuer Benchmark testet Agenten an realen Startup-Workflows
- MEINUNGreddit.com3d
Fehlende Benchmarks für Agent-Runtimes: Community diskutiert Lücke

Ora benchmarkt alle großen AI-Agents auf Vercel-Infrastruktur
Ora wurde von Assaf Elovic und Liad Yosef gegründet, nachdem Elovics vorheriges Unternehmen Tavily – eine Web-Suchmaschine speziell für KI-Agenten – von Nebius übernommen wurde. Die Kernthese von Ora: 99 % des Webs ist noch nicht agenten-tauglich. Das Unternehmen schickt Agenten auf Live-Websites mit konkreten Aufgaben – Produkt-Registrierung, Integration, Bezahlung – und zeichnet Kosten, Latenz und Schrittanzahl jedes Runs auf. Ein zentrales technisches Problem ist, dass jeder Agent-Harness eine eigene Infrastruktur erwartet und seine Schritte unterschiedlich exponiert; Ora betreibt daher für jeden Harness eine separate Runtime und trackt jeden einzelnen Schritt. Das ermöglicht Kunden, nicht nur einen Gesamtscore zu sehen, sondern exakt den Schritt und die Aktion, bei der ein Agent in einem Signup-Flow hängenbleibt. Besonders relevant ist das Sandbox-Override-Feature von Vercels eve-Framework: Da ein Agent im Standard-Sandbox außerhalb der instrumentierten Ora-Umgebung läuft, braucht Ora die Möglichkeit, die Sandbox zu überschreiben – ein Kriterium, das die Entscheidung für eve als eigenes Build-Framework maßgeblich beeinflusst hat. Das 16-köpfige Engineering-Team unter Ido Finder pusht täglich hunderte Commits, was eine enge Deployment-Integration auf einer einzigen Plattform praktisch voraussetzt.
- Benchmarked wurden Claude Code, ChatGPT, Gemini, Hermes, OpenClaw und Vercels eve – alle unter identischen Bedingungen auf denselben Domains.
- Der initiale eve-vs.-Claude-Code-Test lief über hunderte realer Journeys auf mehreren Domains, beide Harnesses nutzten dieselben Modelle: Claude Fable 5 und Haiku 4.5.
- Ein einzelner Benchmark-Run deckte einen Prompt-Caching-Bug in eve auf; nach dem Fix des eve-Teams sank der Gesamtkostenwert im nächsten Lauf um rund 15 %.
- Ora arbeitet als Design-Partner mit Vercel Engineering zusammen: Engineering-Lead Ido Finder gab dem eve-Team direkten Plattformzugang für die Ergebnisanalyse.
- Frontend, Backend und Agent-Runtime teilen bei Ora denselben Deployment-Pfad, dieselben Logs und dieselbe Authentifizierung – ohne separate Infrastruktur für die Runtime.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org2w
BekchiAI: Benchmark und Plattform zur Messung und Kontrolle von LLM-Agenten
- FORSCHUNGarxiv.org3d
Era by Eon: Neuer Benchmark für LLM-Agenten in Enterprise-Systemen
- FORSCHUNGarxiv.org3w
StartupBench: Neuer Benchmark testet Agenten an realen Startup-Workflows
- MEINUNGreddit.com3d
Fehlende Benchmarks für Agent-Runtimes: Community diskutiert Lücke