LFM2.5 230M läuft im Browser mit 1.400 tok/s via WebGPU-Kernels
Der Reddit-Post von Nutzer xenovatech demonstriert LFM2.5 230M – ein kompaktes Sprachmodell von LiquidAI – vollständig im Browser laufend, mit einer Inferenzgeschwindigkeit von 1.400 Token pro Sekunde. Ermöglicht wird dies durch maßgeschneiderte WebGPU-Kernel, die ursprünglich vom inzwischen eingestellten Studio Fable 5 entwickelt wurden. Das Modell wird im GGUF-Format über den Hugging-Face-Space „webml-community/lfm2-webgpu-kernels" bereitgestellt und ist dort öffentlich zugänglich. Die Aufzeichnung erfolgte auf einem Apple M4 Max, einer der leistungsstärksten Consumer-Laptop-GPUs zum Aufzeichnungszeitpunkt. LFM2.5 gehört zur Liquid Foundation Model-Familie von LiquidAI, die auf Liquid Neural Networks basiert und sich von klassischen Transformer-Architekturen unterscheidet. Der Ansatz zeigt, dass durch handoptimierte WebGPU-Kernel auch unkonventionelle Modellarchitekturen effizient im Browser ausgeführt werden können – ein relevanter Schritt für clientseitige KI-Anwendungen ohne Server-Backend.
- Modell: LiquidAI/LFM2.5-230M im GGUF-Format, vollständig clientseitig im Browser ausgeführt.
- Die WebGPU-Kernel wurden von Fable 5 geschrieben – einem Studio, das inzwischen eingestellt wurde.
- Demo öffentlich zugänglich als Hugging-Face-Space: webml-community/lfm2-webgpu-kernels.
- Aufzeichnung erfolgte auf einem M4 Max; 1.400 tok/s sind auf dieser Hardware-Klasse gemessen.
- Kein Server-Backend erforderlich – Inferenz läuft vollständig lokal im Webbrowser.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org1w
LeanStream: Effiziente On-Device-LLM-Inferenz mit 2,1× höherem Durchsatz
- LAUNCHgithub.com1w
WebLLM: Hochperformante LLM-Inferenz direkt im Browser via WebGPU
- MEINUNGreddit.com2w
Ersteinstieg in lokale LLMs mit ik_llama auf 12 GB VRAM
- LAUNCHreddit.com6d
1-Bit-27B-Modell läuft mit 30 tok/s im Browser auf 6-GB-GPU
LFM2.5 230M läuft im Browser mit 1.400 tok/s via WebGPU-Kernels
Der Reddit-Post von Nutzer xenovatech demonstriert LFM2.5 230M – ein kompaktes Sprachmodell von LiquidAI – vollständig im Browser laufend, mit einer Inferenzgeschwindigkeit von 1.400 Token pro Sekunde. Ermöglicht wird dies durch maßgeschneiderte WebGPU-Kernel, die ursprünglich vom inzwischen eingestellten Studio Fable 5 entwickelt wurden. Das Modell wird im GGUF-Format über den Hugging-Face-Space „webml-community/lfm2-webgpu-kernels" bereitgestellt und ist dort öffentlich zugänglich. Die Aufzeichnung erfolgte auf einem Apple M4 Max, einer der leistungsstärksten Consumer-Laptop-GPUs zum Aufzeichnungszeitpunkt. LFM2.5 gehört zur Liquid Foundation Model-Familie von LiquidAI, die auf Liquid Neural Networks basiert und sich von klassischen Transformer-Architekturen unterscheidet. Der Ansatz zeigt, dass durch handoptimierte WebGPU-Kernel auch unkonventionelle Modellarchitekturen effizient im Browser ausgeführt werden können – ein relevanter Schritt für clientseitige KI-Anwendungen ohne Server-Backend.
- Modell: LiquidAI/LFM2.5-230M im GGUF-Format, vollständig clientseitig im Browser ausgeführt.
- Die WebGPU-Kernel wurden von Fable 5 geschrieben – einem Studio, das inzwischen eingestellt wurde.
- Demo öffentlich zugänglich als Hugging-Face-Space: webml-community/lfm2-webgpu-kernels.
- Aufzeichnung erfolgte auf einem M4 Max; 1.400 tok/s sind auf dieser Hardware-Klasse gemessen.
- Kein Server-Backend erforderlich – Inferenz läuft vollständig lokal im Webbrowser.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGarxiv.org1w
LeanStream: Effiziente On-Device-LLM-Inferenz mit 2,1× höherem Durchsatz
- LAUNCHgithub.com1w
WebLLM: Hochperformante LLM-Inferenz direkt im Browser via WebGPU
- MEINUNGreddit.com2w
Ersteinstieg in lokale LLMs mit ik_llama auf 12 GB VRAM
- LAUNCHreddit.com6d
1-Bit-27B-Modell läuft mit 30 tok/s im Browser auf 6-GB-GPU