AMD-FP8-Training in TorchTitan und TorchAO upstream gemergt
Auf der PyTorch Conference 2025 demonstrierte AMD lineare Skalierung über mehr als 1.000 GPUs hinaus auf AMD-Instinct-Clustern – realisiert durch Primus-Turbo, eine AMD-eigene Optimierungsbibliothek für Trainings-Frameworks wie TorchTitan. Diese Demonstration war jedoch zunächst an den proprietären Fork gebunden. Inzwischen wurden die zugrundeliegenden Optimierungen in die offiziellen Upstream-Repositories pytorch/AO und pytorch/TorchTitan gemergt, sodass AMD Instinct GPUs nun ohne zusätzliche Abhängigkeiten nativ unterstützt werden. Im Mittelpunkt steht FP8-Training, das gegenüber höherpräzisen Formaten wie BF16 den Speicherbedarf und die Rechenzeit deutlich reduziert und besonders beim Training großer Sprachmodelle relevant ist. TorchAO übernimmt dabei die Quantisierungslogik, während TorchTitan als skalierbare Trainings-Referenzarchitektur fungiert. Durch das Upstreaming profitieren Entwickler direkt von kompetitiver FP8-Performance auf AMD-Hardware, ohne proprietäre Forks pflegen oder einsetzen zu müssen. Die Änderungen sind bereits in beiden Repositories zusammengeführt und stehen der Community zur Verfügung.
- Alle Beiträge wurden in pytorch/AO und pytorch/TorchTitan gemergt — kein separater Fork mehr nötig.
- Primus-Turbo war die AMD-Optimierungsbibliothek, deren Kernoptimierungen nun upstream eingeflossen sind.
- Die lineare Skalierung wurde auf AMD-Instinct-Clustern mit über 1.000 GPUs demonstriert.
- FP8-Training auf AMD Instinct GPUs ist damit out-of-the-box ohne proprietäre Abhängigkeiten verfügbar.
- TorchAO übernimmt die Quantisierungsseite, TorchTitan die skalierbare Trainingsinfrastruktur.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGdeveloper.nvidia.com2w
NVIDIA erklärt GPU-Sizing für AI-Inferenz und TCO-Optimierung
- MEINUNGreddit.com3w
Community sucht schnellste Qwen3-8/27B GGUF-Variante für AMD GPUs
- MEINUNGreddit.com2w
RTX 3090 beliebt für LLMs – warum kaum INT8 W8A8 Modelle?
- LAUNCHreddit.com2d
CUDA-for-AMD-Windows: CUDA-Apps auf AMD-GPUs via ZLUDA + ROCm
AMD-FP8-Training in TorchTitan und TorchAO upstream gemergt
Auf der PyTorch Conference 2025 demonstrierte AMD lineare Skalierung über mehr als 1.000 GPUs hinaus auf AMD-Instinct-Clustern – realisiert durch Primus-Turbo, eine AMD-eigene Optimierungsbibliothek für Trainings-Frameworks wie TorchTitan. Diese Demonstration war jedoch zunächst an den proprietären Fork gebunden. Inzwischen wurden die zugrundeliegenden Optimierungen in die offiziellen Upstream-Repositories pytorch/AO und pytorch/TorchTitan gemergt, sodass AMD Instinct GPUs nun ohne zusätzliche Abhängigkeiten nativ unterstützt werden. Im Mittelpunkt steht FP8-Training, das gegenüber höherpräzisen Formaten wie BF16 den Speicherbedarf und die Rechenzeit deutlich reduziert und besonders beim Training großer Sprachmodelle relevant ist. TorchAO übernimmt dabei die Quantisierungslogik, während TorchTitan als skalierbare Trainings-Referenzarchitektur fungiert. Durch das Upstreaming profitieren Entwickler direkt von kompetitiver FP8-Performance auf AMD-Hardware, ohne proprietäre Forks pflegen oder einsetzen zu müssen. Die Änderungen sind bereits in beiden Repositories zusammengeführt und stehen der Community zur Verfügung.
- Alle Beiträge wurden in pytorch/AO und pytorch/TorchTitan gemergt — kein separater Fork mehr nötig.
- Primus-Turbo war die AMD-Optimierungsbibliothek, deren Kernoptimierungen nun upstream eingeflossen sind.
- Die lineare Skalierung wurde auf AMD-Instinct-Clustern mit über 1.000 GPUs demonstriert.
- FP8-Training auf AMD Instinct GPUs ist damit out-of-the-box ohne proprietäre Abhängigkeiten verfügbar.
- TorchAO übernimmt die Quantisierungsseite, TorchTitan die skalierbare Trainingsinfrastruktur.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGdeveloper.nvidia.com2w
NVIDIA erklärt GPU-Sizing für AI-Inferenz und TCO-Optimierung
- MEINUNGreddit.com3w
Community sucht schnellste Qwen3-8/27B GGUF-Variante für AMD GPUs
- MEINUNGreddit.com2w
RTX 3090 beliebt für LLMs – warum kaum INT8 W8A8 Modelle?
- LAUNCHreddit.com2d
CUDA-for-AMD-Windows: CUDA-Apps auf AMD-GPUs via ZLUDA + ROCm