FireRedTeam veröffentlicht FireRedAudio (9B) und FireRedTTS3 für Audio & Sprache
FireRedTeam, das hinter dem Open-Source-Ökosystem unter fireredteam.github.io steht, veröffentlicht mit FireRedAudio und FireRedTTS3 zwei komplementäre Systeme, die unterschiedliche Aspekte der Audio-KI abdecken. FireRedAudio basiert auf einem gemeinsamen 9-Milliarden-Parameter-LLM-Backbone und trennt intern die Repräsentationen für Verstehen und Generierung: Der Audio-Encoder-Pfad übernimmt Aufgaben wie ASR und allgemeines Audio-Verstehen, während der RedAE-Patch-Pfad die Sprachgenerierung übernimmt – laut FireRedTeam das erste öffentlich beschriebene Design dieser Art in einem vereinheitlichten Audio-Sprachmodell. Das Modell wurde auf Benchmarks wie MMAU, MMSU, Seed-TTS-Eval, InstructTTSEval und Ming-Freeform-Audio-Edit getestet und erzielt dort nach eigenen Angaben wettbewerbsfähige oder führende Ergebnisse. Besonders hervorzuheben ist die Fähigkeit, Aufnahmen von bis zu einer Stunde Länge mit präziser zeitlicher Verankerung zu verarbeiten – inklusive zeitgestempelter Zusammenfassungen und zeitbasierter Inhaltssuche. FireRedTTS3 ergänzt das Portfolio als eigenständiges Speech-Generation-System in zwei Varianten: Die Base-Variante erreicht auf dem MiniMax-MLS-Test eine durchschnittliche WER/CER von 3,754 % und eine Speaker-Similarity von 84,8 %, die Instruct-Variante ermöglicht darüber hinaus sprachgesteuerte Stimmgestaltung ohne Referenzaudio sowie freie semantische und akustische Sprachbearbeitung. Beide Modelle sind über Hugging Face und GitHub frei zugänglich, technische Details zu FireRedTTS3 sind zusätzlich in einem arXiv-Paper (2608.17492) dokumentiert.
- FireRedAudio nutzt zwei entkoppelte Repräsentationspfade auf einem gemeinsamen 9B-LLM: Audio Encoder (Verstehen) und RedAE-Patch (Generierung).
- FireRedTTS3-Base erzielt auf Seed-TTS-eval durchschnittlich 3,04 % WER/CER und 78,8 % Speaker-Similarity – beides Bestwerte laut FireRedTeam.
- FireRedTTS3-Instruct steuert Voice-Design über einen expliziten Textplanungsschritt vor der Synthese (Geschlecht, Alter, Timbre, Emotion, Tempo, Akzent).
- FireRedTTS3 unterstützt neben 24 Sprachen auch 21 chinesische Dialekte beim Zero-Shot-Voice-Cloning, darunter Wu, Minnan und Wenzhou.
- Das arXiv-Paper zu FireRedTTS3 ist unter der Kennung 2608.17492 abrufbar; FireRedAudio verfügt aktuell über kein eigenes Paper-Dokument.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
FireRedTeam veröffentlicht FireRedAudio (9B) und FireRedTTS3 für Audio & Sprache
FireRedTeam, das hinter dem Open-Source-Ökosystem unter fireredteam.github.io steht, veröffentlicht mit FireRedAudio und FireRedTTS3 zwei komplementäre Systeme, die unterschiedliche Aspekte der Audio-KI abdecken. FireRedAudio basiert auf einem gemeinsamen 9-Milliarden-Parameter-LLM-Backbone und trennt intern die Repräsentationen für Verstehen und Generierung: Der Audio-Encoder-Pfad übernimmt Aufgaben wie ASR und allgemeines Audio-Verstehen, während der RedAE-Patch-Pfad die Sprachgenerierung übernimmt – laut FireRedTeam das erste öffentlich beschriebene Design dieser Art in einem vereinheitlichten Audio-Sprachmodell. Das Modell wurde auf Benchmarks wie MMAU, MMSU, Seed-TTS-Eval, InstructTTSEval und Ming-Freeform-Audio-Edit getestet und erzielt dort nach eigenen Angaben wettbewerbsfähige oder führende Ergebnisse. Besonders hervorzuheben ist die Fähigkeit, Aufnahmen von bis zu einer Stunde Länge mit präziser zeitlicher Verankerung zu verarbeiten – inklusive zeitgestempelter Zusammenfassungen und zeitbasierter Inhaltssuche. FireRedTTS3 ergänzt das Portfolio als eigenständiges Speech-Generation-System in zwei Varianten: Die Base-Variante erreicht auf dem MiniMax-MLS-Test eine durchschnittliche WER/CER von 3,754 % und eine Speaker-Similarity von 84,8 %, die Instruct-Variante ermöglicht darüber hinaus sprachgesteuerte Stimmgestaltung ohne Referenzaudio sowie freie semantische und akustische Sprachbearbeitung. Beide Modelle sind über Hugging Face und GitHub frei zugänglich, technische Details zu FireRedTTS3 sind zusätzlich in einem arXiv-Paper (2608.17492) dokumentiert.
- FireRedAudio nutzt zwei entkoppelte Repräsentationspfade auf einem gemeinsamen 9B-LLM: Audio Encoder (Verstehen) und RedAE-Patch (Generierung).
- FireRedTTS3-Base erzielt auf Seed-TTS-eval durchschnittlich 3,04 % WER/CER und 78,8 % Speaker-Similarity – beides Bestwerte laut FireRedTeam.
- FireRedTTS3-Instruct steuert Voice-Design über einen expliziten Textplanungsschritt vor der Synthese (Geschlecht, Alter, Timbre, Emotion, Tempo, Akzent).
- FireRedTTS3 unterstützt neben 24 Sprachen auch 21 chinesische Dialekte beim Zero-Shot-Voice-Cloning, darunter Wu, Minnan und Wenzhou.
- Das arXiv-Paper zu FireRedTTS3 ist unter der Kennung 2608.17492 abrufbar; FireRedAudio verfügt aktuell über kein eigenes Paper-Dokument.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.