Qwen3.8-27B mit 130 tok/s und vollem 262k-Kontext auf Kaggle-TPU
CompaniesOpenAI
Warum es zählt
Kostenloser Cloud-TPU-Zugang ermöglicht damit Inferenz eines 27B-Modells in bf16-Qualität mit sehr schnellem Prefill – ohne eigene Hardware. Das Notebook und Repo sind öffentlich, was den Aufwand für Nachahmer minimal hält.
— Lumeric Redaktion
~130 tok/s
Single-Stream-Inferenz auf Kaggle TPU v5e-8
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Qwen3.8-27B mit 130 tok/s und vollem 262k-Kontext auf Kaggle-TPU
CompaniesOpenAI
Warum es zählt
Kostenloser Cloud-TPU-Zugang ermöglicht damit Inferenz eines 27B-Modells in bf16-Qualität mit sehr schnellem Prefill – ohne eigene Hardware. Das Notebook und Repo sind öffentlich, was den Aufwand für Nachahmer minimal hält.
— Lumeric Redaktion
~130 tok/s
Single-Stream-Inferenz auf Kaggle TPU v5e-8
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.