Dev & Code Aug 14, 2026Zu Lesezeichen hinzufügen

Alibaba veröffentlicht Qwen 3.8 27B als Open Weights auf Hugging Face – beansprucht als bestes dichtes Modell für lokale Inferenz bisher. Was das konkret für Ihre lokalen Inferenz-Setups bedeutet und warum es Aufmerksamkeit verdient.
Seit Meta mit LLaMA die Open-Weights-Modelle populär gemacht hat, hat sich der Wettbewerb um das beste lokal ausführbare dichte Modell intensiviert. Alibaba hat kürzlich einen bedeutenden Punkt mit Qwen 3.8 27B gesetzt – der Version 3.8 der Qwen-Familie (千问, Tausend Fragen), die als Open Weights auf Hugging Face veröffentlicht wurde.
Qwen (ausgesprochen „tsyen“) ist die Familie der LLM (Large Language Models) von Alibaba Cloud. Die Version 3.8 mit 27 Milliarden Parametern ist in FP8-Quantisierung (8-Bit-Gleitkomma) verfügbar, was sie auf Consumer-GPUs mit ausreichend VRAM lauffähig macht.
Die Klassifizierung dicht unterscheidet dieses Modell von MoE-Architekturen (Mixture of Experts, Expertenmischung) wie Mixtral oder bestimmten Qwen MoE-Modellen: Ein dichtes Modell aktiviert alle seine Parameter bei jeder Inferenz. Das ist vorhersehbarer und leistungshomogener, erfordert aber mehr VRAM.
Um Qwen 3.8 27B im FP8-Format lokal auszuführen, benötigen Sie etwa 28–30 GB VRAM – erreichbar auf professioneller Hardware (A6000, H100 80 GB) oder mit Dual-GPU-Setups für Enthusiasten. Bei Q4_K_M (4-Bit-Quantisierung) sinkt der Bedarf auf etwa 14–16 GB, was auf eine RTX 3090 oder 4090 passt.
# Über Ollama, falls das Modell gepackt ist
ollama run qwen3.8:27b
# Über llama.cpp mit der quantisierten GGUF-Datei
./llama-cli -m qwen3.8-27b-q4_k_m.gguf \
-ctx-size 8192 \
-p "Erkläre Ring-Signaturen in der Kryptographie" Die Qwen-Modelle haben in Benchmarks zu Code und mathematischem Denken regelmäßig ihre westlichen Pendants ähnlicher Größe übertroffen. Falls unabhängige Bewertungen die Behauptung „bestes dichtes lokales Modell“ bestätigen, wird Qwen 3.8 27B zu einer ernsthaften Alternative für:
Ein Hinweis zur Lizenz: Die Qwen-Familie nutzt in der Regel eine Qwen-Lizenz, die von Apache 2.0 abgeleitet ist, mit kommerziellen Einschränkungen ab einer bestimmten Nutzerzahl. Prüfen Sie vor einem Produktiveinsatz die README-Datei auf Hugging Face.
Ein MoE-Modell aktiviert nur einen Bruchteil seiner Parameter pro Token – das ist effizienter bei der Inferenz, aber die Fähigkeiten können je nach Bereich weniger homogen sein. Ein dichtes Modell ist konstanter, allerdings auf Kosten eines höheren VRAM-Verbrauchs.
Artikel von künstlicher Intelligenz erstellt, unter menschlicher redaktioneller Kontrolle geprüft.