Intel Z890/Arrow Lake: PCIe P2P für Multi-GPU-KI-Workloads defekt
Der Reddit-Beitrag des Nutzers dokumentiert ein konkretes Praxisproblem mit der Intel-Arrow-Lake-Plattform (Z890-Chipsatz) in Multi-GPU-Setups: PCIe Peer-to-Peer (P2P), also die direkte GPU-zu-GPU-Kommunikation ohne CPU-Umweg, funktioniert auf diesen Consumer-Plattformen trotz vorhandener PCIe-5.0-Lanes nicht korrekt. Als Testsystem diente ein Intel Core Ultra 7 270K auf einem Asus Z890 Apex mit BIOS 3202 sowie zwei NVIDIA RTX A6000. Die Bandbreite zwischen den GPUs brach im P2P-Modus auf 5,48 GB/s (unidirektional, P2P Writes) bzw. 10,97 GB/s (bidirektional) ein – verglichen mit ~674 GB/s lokaler Speicherbandbreite ein faktischer Kollaps. NVIDIA hat PCIe P2P auf Consumer-Intel-Plattformen offenbar bewusst deaktiviert; per gepatchtem Open-Source-Kernel-Treiber (aikitoria/open-gpu-kernel-modules) lässt es sich zwar aktivieren, doch die erzwungene P2P-Verbindung liefert korrumpierte Ergebnisse: vLLM mit Tensor Parallelism (tp2) gibt bei einem Qwen3.5-27B-Modell nur Ausrufezeichen-Strings statt kohärenter Antworten aus. Der Autor vermutet eine Hardware- oder Firmware-Einschränkung im PCIe-Root-Complex von Arrow Lake, verweist auf einen bereits gemeldeten GitHub-Issue in den NVIDIA Open-GPU-Kernel-Modulen und rät Interessierten explizit zu AMD- oder Intel-Workstation-/Server-Plattformen, auf denen PCIe P2P korrekt implementiert ist.
- Testsystem: Intel Core Ultra 7 270K, Asus Z890 Apex, BIOS 3202, zwei NVIDIA RTX A6000 (PCIe Bus IDs 2 & 3).
- P2P-Writes-Bandbreite (aktiviert): nur 5,48 GB/s unidirektional – bei ~674 GB/s lokaler Speicherbandbreite ein Einbruch um Faktor ~120.
- NVIDIA blockiert PCIe P2P auf Consumer-Intel-Plattformen im Standard-Treiber; Umgehung nur via gepatchtem Fork 'aikitoria/open-gpu-kernel-modules' möglich.
- vLLM-Ausgabe mit erzwungenem P2P (tp2, Qwen3.5-27B): Reasoning-Feld enthält ausschließlich '!!!!!!!!!!!!!!!!!!!!' – Modell-Output vollständig korrumpiert.
- Der zugrundeliegende Bug ist in NVIDIA/open-gpu-kernel-modules Issue #1253 dokumentiert und betrifft die fehlerhafte Weiterleitung von Datenpaketen zwischen PCIe-Geräten unter Arrow Lake.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Intel Z890/Arrow Lake: PCIe P2P für Multi-GPU-KI-Workloads defekt
Der Reddit-Beitrag des Nutzers dokumentiert ein konkretes Praxisproblem mit der Intel-Arrow-Lake-Plattform (Z890-Chipsatz) in Multi-GPU-Setups: PCIe Peer-to-Peer (P2P), also die direkte GPU-zu-GPU-Kommunikation ohne CPU-Umweg, funktioniert auf diesen Consumer-Plattformen trotz vorhandener PCIe-5.0-Lanes nicht korrekt. Als Testsystem diente ein Intel Core Ultra 7 270K auf einem Asus Z890 Apex mit BIOS 3202 sowie zwei NVIDIA RTX A6000. Die Bandbreite zwischen den GPUs brach im P2P-Modus auf 5,48 GB/s (unidirektional, P2P Writes) bzw. 10,97 GB/s (bidirektional) ein – verglichen mit ~674 GB/s lokaler Speicherbandbreite ein faktischer Kollaps. NVIDIA hat PCIe P2P auf Consumer-Intel-Plattformen offenbar bewusst deaktiviert; per gepatchtem Open-Source-Kernel-Treiber (aikitoria/open-gpu-kernel-modules) lässt es sich zwar aktivieren, doch die erzwungene P2P-Verbindung liefert korrumpierte Ergebnisse: vLLM mit Tensor Parallelism (tp2) gibt bei einem Qwen3.5-27B-Modell nur Ausrufezeichen-Strings statt kohärenter Antworten aus. Der Autor vermutet eine Hardware- oder Firmware-Einschränkung im PCIe-Root-Complex von Arrow Lake, verweist auf einen bereits gemeldeten GitHub-Issue in den NVIDIA Open-GPU-Kernel-Modulen und rät Interessierten explizit zu AMD- oder Intel-Workstation-/Server-Plattformen, auf denen PCIe P2P korrekt implementiert ist.
- Testsystem: Intel Core Ultra 7 270K, Asus Z890 Apex, BIOS 3202, zwei NVIDIA RTX A6000 (PCIe Bus IDs 2 & 3).
- P2P-Writes-Bandbreite (aktiviert): nur 5,48 GB/s unidirektional – bei ~674 GB/s lokaler Speicherbandbreite ein Einbruch um Faktor ~120.
- NVIDIA blockiert PCIe P2P auf Consumer-Intel-Plattformen im Standard-Treiber; Umgehung nur via gepatchtem Fork 'aikitoria/open-gpu-kernel-modules' möglich.
- vLLM-Ausgabe mit erzwungenem P2P (tp2, Qwen3.5-27B): Reasoning-Feld enthält ausschließlich '!!!!!!!!!!!!!!!!!!!!' – Modell-Output vollständig korrumpiert.
- Der zugrundeliegende Bug ist in NVIDIA/open-gpu-kernel-modules Issue #1253 dokumentiert und betrifft die fehlerhafte Weiterleitung von Datenpaketen zwischen PCIe-Geräten unter Arrow Lake.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.