PrismML komprimiert Qwen3-27B auf unter 4 GB – läuft auf iPhone 17 Pro
PrismML, ein Spinoff des California Institute of Technology (Caltech), hat nach eigenen Angaben ein mathematisches Kompressionsverfahren entwickelt, das große Sprachmodelle drastisch verkleinern kann, ohne die Leistung zu mindern. CEO Babak Hassibi ist Professor für Elektrotechnik an der Caltech und hat die zugrundeliegende mathematische Forschung gemeinsam mit seinen Mitgründern dort durchgeführt. Die Patente gehören der Caltech, werden aber exklusiv an PrismML lizenziert. Investor Vinod Khosla vom bekannten Risikokapitalgeber Khosla Ventures unterstützt das Startup. Ein zentraler Unterschied zum neuen On-Device-Modell von Apple besteht in der Architektur: Apples Modell mit 20 Milliarden Parametern nutzt eine sogenannte Sparse-Architektur, bei der jeweils nur 1 bis 4 Milliarden Parameter gleichzeitig aktiv sind – bei PrismMLs komprimiertem Qwen-3.6-Modell sind alle 27 Milliarden Parameter gleichzeitig aktiv. Hassibi skizziert eine mittelfristige Zukunft, in der rund 95 Prozent des KI-Bedarfs lokal auf Endgeräten verarbeitet wird und nur noch etwa 5 Prozent High-End-Aufgaben die Cloud erfordern. PrismML plant außerdem, das Verfahren auf noch größere Modelle im Billionen-Parameter-Bereich auszuweiten – und damit in die Liga von Modellen wie GPT oder Claude vorzustoßen.
- CEO Babak Hassibi ist Elektrotechnik-Professor an der Caltech; die Technologie-Patente liegen bei der Caltech, werden aber exklusiv an PrismML lizenziert.
- Apples neues On-Device-Modell hat 20 Mrd. Parameter, nutzt aber Sparse-Architektur mit nur 1–4 Mrd. aktiven Parametern gleichzeitig – bei PrismML sind alle 27 Mrd. aktiv.
- PrismML adressiert Anwendungsfälle wie komplexen Chat, Reasoning, vollautonome Agenten und Software-Coding direkt auf dem Gerät.
- Hassibi prognostiziert, dass on-device KI die Ökonomie von KI fundamental verändern wird, da Cloudkosten für den Großteil der Inferenz entfallen.
- Das Startup plant, das Kompressionsverfahren künftig auch auf Modelle im Billionen-Parameter-Bereich wie GPT oder Claude anzuwenden.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHthesequence.substack.com2w
PrismML Bonsai 27B: 27-Mrd-Parameter-Modell in 3,9 GB für Smartphones
- LAUNCHreddit.com3w
AirLLM unterstützt Qwen3.8-27B und Kimi K3 (2,8T) auf Single-GPU
- LAUNCHreddit.com2w
Qwen 3.8 Flash Next läuft lokal mit 3,5 tok/s auf Android-Mittelklasse
- FORSCHUNGhuggingface.co3w
Llama-Mobile: 2,7-Bit-Quantisierung bringt Llama 3.2 11B auf 3,7 GB
PrismML komprimiert Qwen3-27B auf unter 4 GB – läuft auf iPhone 17 Pro
PrismML, ein Spinoff des California Institute of Technology (Caltech), hat nach eigenen Angaben ein mathematisches Kompressionsverfahren entwickelt, das große Sprachmodelle drastisch verkleinern kann, ohne die Leistung zu mindern. CEO Babak Hassibi ist Professor für Elektrotechnik an der Caltech und hat die zugrundeliegende mathematische Forschung gemeinsam mit seinen Mitgründern dort durchgeführt. Die Patente gehören der Caltech, werden aber exklusiv an PrismML lizenziert. Investor Vinod Khosla vom bekannten Risikokapitalgeber Khosla Ventures unterstützt das Startup. Ein zentraler Unterschied zum neuen On-Device-Modell von Apple besteht in der Architektur: Apples Modell mit 20 Milliarden Parametern nutzt eine sogenannte Sparse-Architektur, bei der jeweils nur 1 bis 4 Milliarden Parameter gleichzeitig aktiv sind – bei PrismMLs komprimiertem Qwen-3.6-Modell sind alle 27 Milliarden Parameter gleichzeitig aktiv. Hassibi skizziert eine mittelfristige Zukunft, in der rund 95 Prozent des KI-Bedarfs lokal auf Endgeräten verarbeitet wird und nur noch etwa 5 Prozent High-End-Aufgaben die Cloud erfordern. PrismML plant außerdem, das Verfahren auf noch größere Modelle im Billionen-Parameter-Bereich auszuweiten – und damit in die Liga von Modellen wie GPT oder Claude vorzustoßen.
- CEO Babak Hassibi ist Elektrotechnik-Professor an der Caltech; die Technologie-Patente liegen bei der Caltech, werden aber exklusiv an PrismML lizenziert.
- Apples neues On-Device-Modell hat 20 Mrd. Parameter, nutzt aber Sparse-Architektur mit nur 1–4 Mrd. aktiven Parametern gleichzeitig – bei PrismML sind alle 27 Mrd. aktiv.
- PrismML adressiert Anwendungsfälle wie komplexen Chat, Reasoning, vollautonome Agenten und Software-Coding direkt auf dem Gerät.
- Hassibi prognostiziert, dass on-device KI die Ökonomie von KI fundamental verändern wird, da Cloudkosten für den Großteil der Inferenz entfallen.
- Das Startup plant, das Kompressionsverfahren künftig auch auf Modelle im Billionen-Parameter-Bereich wie GPT oder Claude anzuwenden.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHthesequence.substack.com2w
PrismML Bonsai 27B: 27-Mrd-Parameter-Modell in 3,9 GB für Smartphones
- LAUNCHreddit.com3w
AirLLM unterstützt Qwen3.8-27B und Kimi K3 (2,8T) auf Single-GPU
- LAUNCHreddit.com2w
Qwen 3.8 Flash Next läuft lokal mit 3,5 tok/s auf Android-Mittelklasse
- FORSCHUNGhuggingface.co3w
Llama-Mobile: 2,7-Bit-Quantisierung bringt Llama 3.2 11B auf 3,7 GB