llama.cpp b9788 bringt Tensor-Split-Unterstützung für Intel-GPUs
llama.cpp Release b9788 führt mit Pull Request #24152 die Unterstützung für `--split-mode tensor` im SYCL-Backend ein, das primär auf Intel-GPUs (Arc, Data Center GPU) ausgerichtet ist. Tensor Split ist eine Methode, bei der Gewichtsmatrizen eines Modells schichtweise auf mehrere GPUs verteilt werden – im Gegensatz zum Row-Split, bei dem ganze Schichten einer GPU zugewiesen werden. Das SYCL-Backend in llama.cpp existiert seit geraumer Zeit als Brücke zwischen Intel-OpenCL-Ökosystem und der llama-Inferenz-Pipeline, hinkte bei Multi-GPU-Features jedoch dem CUDA-Backend hinterher. Mit diesem Fix schließt Intel-Hardware eine wichtige Lücke: Wer zwei oder mehr Intel-GPUs betreibt, kann den VRAM beider Karten nun gemeinsam nutzen, um größere Modelle zu laden als auf einer einzelnen Karte möglich wäre. Der Reddit-Post stammt vom Nutzer /u/Bulky-Priority6824, der explizit nach Benchmarks aus der Community für Dual-Intel-GPU-Setups fragt – konkrete Throughput- oder Latenz-Zahlen lagen zum Zeitpunkt der Veröffentlichung noch nicht vor. Der Fix war gut zwei Monate vor dem heutigen Datum (2026-08-24) erschienen, Praxis-Erfahrungsberichte aus der Community könnten seitdem nachgereicht worden sein.
- PR #24152 im llama.cpp-Repository implementiert `--split-mode tensor` speziell für das SYCL-Backend (Intel-GPU-Unterstützung).
- SYCL ist Intels offener Heterogeneous-Computing-Standard, der auf OpenCL aufbaut und für Arc- sowie Data-Center-GPUs genutzt wird.
- Tensor-Split verteilt Gewichtsmatrizen schichtweise auf mehrere GPUs – ermöglicht größere Modelle bei begrenztem VRAM pro Karte.
- Zum Veröffentlichungszeitpunkt (2026-06-25) lagen keine Community-Benchmarks für Dual-Intel-GPU-Setups vor; der Post-Autor rief explizit dazu auf.
- Das Release trägt die Build-Nummer b9788 — eine fortlaufende Versionsnummer im llama.cpp-Release-Schema ohne klassische Semver-Tags.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
llama.cpp b9788 bringt Tensor-Split-Unterstützung für Intel-GPUs
llama.cpp Release b9788 führt mit Pull Request #24152 die Unterstützung für `--split-mode tensor` im SYCL-Backend ein, das primär auf Intel-GPUs (Arc, Data Center GPU) ausgerichtet ist. Tensor Split ist eine Methode, bei der Gewichtsmatrizen eines Modells schichtweise auf mehrere GPUs verteilt werden – im Gegensatz zum Row-Split, bei dem ganze Schichten einer GPU zugewiesen werden. Das SYCL-Backend in llama.cpp existiert seit geraumer Zeit als Brücke zwischen Intel-OpenCL-Ökosystem und der llama-Inferenz-Pipeline, hinkte bei Multi-GPU-Features jedoch dem CUDA-Backend hinterher. Mit diesem Fix schließt Intel-Hardware eine wichtige Lücke: Wer zwei oder mehr Intel-GPUs betreibt, kann den VRAM beider Karten nun gemeinsam nutzen, um größere Modelle zu laden als auf einer einzelnen Karte möglich wäre. Der Reddit-Post stammt vom Nutzer /u/Bulky-Priority6824, der explizit nach Benchmarks aus der Community für Dual-Intel-GPU-Setups fragt – konkrete Throughput- oder Latenz-Zahlen lagen zum Zeitpunkt der Veröffentlichung noch nicht vor. Der Fix war gut zwei Monate vor dem heutigen Datum (2026-08-24) erschienen, Praxis-Erfahrungsberichte aus der Community könnten seitdem nachgereicht worden sein.
- PR #24152 im llama.cpp-Repository implementiert `--split-mode tensor` speziell für das SYCL-Backend (Intel-GPU-Unterstützung).
- SYCL ist Intels offener Heterogeneous-Computing-Standard, der auf OpenCL aufbaut und für Arc- sowie Data-Center-GPUs genutzt wird.
- Tensor-Split verteilt Gewichtsmatrizen schichtweise auf mehrere GPUs – ermöglicht größere Modelle bei begrenztem VRAM pro Karte.
- Zum Veröffentlichungszeitpunkt (2026-06-25) lagen keine Community-Benchmarks für Dual-Intel-GPU-Setups vor; der Post-Autor rief explizit dazu auf.
- Das Release trägt die Build-Nummer b9788 — eine fortlaufende Versionsnummer im llama.cpp-Release-Schema ohne klassische Semver-Tags.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.