
xAI Grok Voice Think Fast 2.0 ab sofort im Vercel AI Gateway verfügbar
Grok Voice Think Fast 2.0 ist das neueste Sprach-zu-Sprach-Modell von xAI und seit Ende Juli 2026 über das AI Gateway von Vercel verfügbar. Das Modell nimmt Audioeingaben entgegen und gibt direkt Audio aus – ein klassisches Speech-to-Speech-System, das keinen separaten Text-Zwischenschritt benötigt. Gegenüber seinem Vorgänger Grok Voice wurden drei Kernbereiche verbessert: Reasoning-Qualität, Transkriptionsgenauigkeit und allgemeine Gesprächsqualität. Besonders hervorzuheben ist die parallele Verarbeitung: Das Modell denkt während des Sprechens, ohne dadurch Latenz einzuführen. Durch gezieltes Training auf einen reduzierten Reasoning-Token-Verbrauch lösen Tool-Calls früher aus als zuvor – oft noch innerhalb des ersten gesprochenen Satzes. Die Transkriptionsfähigkeit wurde explizit auf reale Umgebungsbedingungen ausgelegt, darunter Hintergrundgeräusche und Telefoniekompressions-Artefakte. Die Einbindung erfolgt über Vercels AI SDK via dessen Realtime-API unter dem Modell-Bezeichner `xai/grok-voice-think-fast-2.0`; zur Absicherung des API-Schlüssels werden kurzlebige Server-Tokens (Short-Lived Tokens) empfohlen, die clientseitig eingesetzt werden, ohne den eigentlichen Key preiszugeben.
- Modell-Bezeichner im AI SDK: `xai/grok-voice-think-fast-2.0` – direkt über Vercels Realtime-API ansprechbar.
- Kurzlebige Server-Tokens (Short-Lived Tokens) verhindern, dass der API-Schlüssel den Client erreicht.
- Transkription wurde explizit für Hintergrundgeräusche und Telefoniekompression trainiert.
- Tool-Calls feuern häufig noch vor dem Ende des ersten Satzes der Agenten-Antwort.
- Das Modell ist im AI Gateway Playground von Vercel direkt testbar, ohne eigenen Code-Setup.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge

xAI Grok Voice Think Fast 2.0 ab sofort im Vercel AI Gateway verfügbar
Grok Voice Think Fast 2.0 ist das neueste Sprach-zu-Sprach-Modell von xAI und seit Ende Juli 2026 über das AI Gateway von Vercel verfügbar. Das Modell nimmt Audioeingaben entgegen und gibt direkt Audio aus – ein klassisches Speech-to-Speech-System, das keinen separaten Text-Zwischenschritt benötigt. Gegenüber seinem Vorgänger Grok Voice wurden drei Kernbereiche verbessert: Reasoning-Qualität, Transkriptionsgenauigkeit und allgemeine Gesprächsqualität. Besonders hervorzuheben ist die parallele Verarbeitung: Das Modell denkt während des Sprechens, ohne dadurch Latenz einzuführen. Durch gezieltes Training auf einen reduzierten Reasoning-Token-Verbrauch lösen Tool-Calls früher aus als zuvor – oft noch innerhalb des ersten gesprochenen Satzes. Die Transkriptionsfähigkeit wurde explizit auf reale Umgebungsbedingungen ausgelegt, darunter Hintergrundgeräusche und Telefoniekompressions-Artefakte. Die Einbindung erfolgt über Vercels AI SDK via dessen Realtime-API unter dem Modell-Bezeichner `xai/grok-voice-think-fast-2.0`; zur Absicherung des API-Schlüssels werden kurzlebige Server-Tokens (Short-Lived Tokens) empfohlen, die clientseitig eingesetzt werden, ohne den eigentlichen Key preiszugeben.
- Modell-Bezeichner im AI SDK: `xai/grok-voice-think-fast-2.0` – direkt über Vercels Realtime-API ansprechbar.
- Kurzlebige Server-Tokens (Short-Lived Tokens) verhindern, dass der API-Schlüssel den Client erreicht.
- Transkription wurde explizit für Hintergrundgeräusche und Telefoniekompression trainiert.
- Tool-Calls feuern häufig noch vor dem Ende des ersten Satzes der Agenten-Antwort.
- Das Modell ist im AI Gateway Playground von Vercel direkt testbar, ohne eigenen Code-Setup.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.