Box: Vollständig offline Android-App kombiniert llama.cpp, Whisper und Stable Diffusion
Box ist ein Open-Source-Projekt von /u/Healthy_Bedroom5837, das auf Googles AI Edge Gallery aufbaut und zu einem vollständig offline-fähigen Android-KI-Assistenten weiterentwickelt wurde. Die App integriert vier Inferenz-Backends in einem Stack: llama.cpp für GGUF-LLM-Inferenz, whisper.cpp für lokale Spracherkennung, stable-diffusion.cpp für On-Device-Bildgenerierung sowie LiteRT als Googles On-Device-Runtime. Entscheidend ist ein automatisches Hardware-Routing, das je nach Modell und Gerät zwischen CPU, GPU, NPU und TPU wählt. Der Entwickler berichtet, dass die Kombination aus LiteRT und llama.cpp auf neueren Snapdragon- und Pixel-NPUs besser als erwartet funktioniert und dass Model-Routing einen größeren Einfluss hat als die rohe Modellgröße. Als praktischer Bottleneck wurde nicht die Rechenleistung, sondern Arbeitsspeicher und Persistenz identifiziert. Whisper.cpp gilt laut Erfahrungsbericht als stabilste STT-Schicht für vollständig offline Setups. Das Projekt unterstützt Voice-to-Voice-Konversation, Vision-plus-Voice mit Live-Kamera, Dokumentenverarbeitung sowie den Import eigener GGUF-Modelle.
- Vier Backends in einer App: llama.cpp (LLM), whisper.cpp (STT), stable-diffusion.cpp (Bild), LiteRT (Runtime)
- Automatisches Hardware-Routing zwischen CPU, GPU, NPU und TPU — kein manuelles Konfigurieren nötig
- Entwickler nennt RAM und Persistenz als primären Flaschenhals, nicht die Rechenkapazität
- Unterstützt Import beliebiger GGUF-Modelle sowie lokale Dokumentenverarbeitung als Kontext
- Quellcode öffentlich auf GitHub verfügbar: github.com/jegly/Box
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com2w
2× Speedup mit Strix Halo + R9700: Heterogenes GPU-Setup für Qwen3.5-122B
- LAUNCHreddit.com2w
Agro: Open-Source On-Device Agent-Client für 4B-Modelle auf Mobile & Desktop
- MEINUNGreddit.com4d
Community fragt nach llama.cpp Flash-Kernel für DeepSeek V4.1
- FORSCHUNGarxiv.org1w
LeanStream: Effiziente On-Device-LLM-Inferenz mit 2,1× höherem Durchsatz
Box: Vollständig offline Android-App kombiniert llama.cpp, Whisper und Stable Diffusion
Box ist ein Open-Source-Projekt von /u/Healthy_Bedroom5837, das auf Googles AI Edge Gallery aufbaut und zu einem vollständig offline-fähigen Android-KI-Assistenten weiterentwickelt wurde. Die App integriert vier Inferenz-Backends in einem Stack: llama.cpp für GGUF-LLM-Inferenz, whisper.cpp für lokale Spracherkennung, stable-diffusion.cpp für On-Device-Bildgenerierung sowie LiteRT als Googles On-Device-Runtime. Entscheidend ist ein automatisches Hardware-Routing, das je nach Modell und Gerät zwischen CPU, GPU, NPU und TPU wählt. Der Entwickler berichtet, dass die Kombination aus LiteRT und llama.cpp auf neueren Snapdragon- und Pixel-NPUs besser als erwartet funktioniert und dass Model-Routing einen größeren Einfluss hat als die rohe Modellgröße. Als praktischer Bottleneck wurde nicht die Rechenleistung, sondern Arbeitsspeicher und Persistenz identifiziert. Whisper.cpp gilt laut Erfahrungsbericht als stabilste STT-Schicht für vollständig offline Setups. Das Projekt unterstützt Voice-to-Voice-Konversation, Vision-plus-Voice mit Live-Kamera, Dokumentenverarbeitung sowie den Import eigener GGUF-Modelle.
- Vier Backends in einer App: llama.cpp (LLM), whisper.cpp (STT), stable-diffusion.cpp (Bild), LiteRT (Runtime)
- Automatisches Hardware-Routing zwischen CPU, GPU, NPU und TPU — kein manuelles Konfigurieren nötig
- Entwickler nennt RAM und Persistenz als primären Flaschenhals, nicht die Rechenkapazität
- Unterstützt Import beliebiger GGUF-Modelle sowie lokale Dokumentenverarbeitung als Kontext
- Quellcode öffentlich auf GitHub verfügbar: github.com/jegly/Box
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- BENCHMARKreddit.com2w
2× Speedup mit Strix Halo + R9700: Heterogenes GPU-Setup für Qwen3.5-122B
- LAUNCHreddit.com2w
Agro: Open-Source On-Device Agent-Client für 4B-Modelle auf Mobile & Desktop
- MEINUNGreddit.com4d
Community fragt nach llama.cpp Flash-Kernel für DeepSeek V4.1
- FORSCHUNGarxiv.org1w
LeanStream: Effiziente On-Device-LLM-Inferenz mit 2,1× höherem Durchsatz