Qwen 3.8 27B: Alibaba startet das beste lokale dichte Modell mit Open Weights

Dev & Code Aug 14, 2026Zu Lesezeichen hinzufügen

Qwen 3.8 27B: Alibaba startet das beste lokale dichte Modell mit Open Weights
Illustration : Momiji Shirogane

Alibaba veröffentlicht Qwen 3.8 27B als Open Weights auf Hugging Face – beansprucht als bestes dichtes Modell für lokale Inferenz bisher. Was das konkret für Ihre lokalen Inferenz-Setups bedeutet und warum es Aufmerksamkeit verdient.

Der Kontext: Der Wettlauf um lokale dichte Modelle

Seit Meta mit LLaMA die Open-Weights-Modelle populär gemacht hat, hat sich der Wettbewerb um das beste lokal ausführbare dichte Modell intensiviert. Alibaba hat kürzlich einen bedeutenden Punkt mit Qwen 3.8 27B gesetzt – der Version 3.8 der Qwen-Familie (千问, Tausend Fragen), die als Open Weights auf Hugging Face veröffentlicht wurde.

Qwen (ausgesprochen „tsyen“) ist die Familie der LLM (Large Language Models) von Alibaba Cloud. Die Version 3.8 mit 27 Milliarden Parametern ist in FP8-Quantisierung (8-Bit-Gleitkomma) verfügbar, was sie auf Consumer-GPUs mit ausreichend VRAM lauffähig macht.

Dicht vs. MoE: Warum das wichtig ist

Die Klassifizierung dicht unterscheidet dieses Modell von MoE-Architekturen (Mixture of Experts, Expertenmischung) wie Mixtral oder bestimmten Qwen MoE-Modellen: Ein dichtes Modell aktiviert alle seine Parameter bei jeder Inferenz. Das ist vorhersehbarer und leistungshomogener, erfordert aber mehr VRAM.

Um Qwen 3.8 27B im FP8-Format lokal auszuführen, benötigen Sie etwa 28–30 GB VRAM – erreichbar auf professioneller Hardware (A6000, H100 80 GB) oder mit Dual-GPU-Setups für Enthusiasten. Bei Q4_K_M (4-Bit-Quantisierung) sinkt der Bedarf auf etwa 14–16 GB, was auf eine RTX 3090 oder 4090 passt.

# Über Ollama, falls das Modell gepackt ist
ollama run qwen3.8:27b

# Über llama.cpp mit der quantisierten GGUF-Datei
./llama-cli -m qwen3.8-27b-q4_k_m.gguf \
 -ctx-size 8192 \
 -p "Erkläre Ring-Signaturen in der Kryptographie"

Warum das Aufmerksamkeit verdient

Die Qwen-Modelle haben in Benchmarks zu Code und mathematischem Denken regelmäßig ihre westlichen Pendants ähnlicher Größe übertroffen. Falls unabhängige Bewertungen die Behauptung „bestes dichtes lokales Modell“ bestätigen, wird Qwen 3.8 27B zu einer ernsthaften Alternative für:

  • Mistral Large für logisches Denken und Multilingualität
  • LLaMA 3.1 70B (größer, ressourcenintensiver) für Anwendungen, die eine kleinere Footprint erfordern
  • Proprietäre APIs für Entwickler, die Wert auf Datenschutz oder Kostenkontrolle legen

Ein Hinweis zur Lizenz: Die Qwen-Familie nutzt in der Regel eine Qwen-Lizenz, die von Apache 2.0 abgeleitet ist, mit kommerziellen Einschränkungen ab einer bestimmten Nutzerzahl. Prüfen Sie vor einem Produktiveinsatz die README-Datei auf Hugging Face.

Dicht vs. MoE

Ein MoE-Modell aktiviert nur einen Bruchteil seiner Parameter pro Token – das ist effizienter bei der Inferenz, aber die Fähigkeiten können je nach Bereich weniger homogen sein. Ein dichtes Modell ist konstanter, allerdings auf Kosten eines höheren VRAM-Verbrauchs.

Zum Merken

  • Qwen 3.8 27B = dichtes Open-Weights-Modell von Alibaba, laut Hersteller aktuell bestes seiner Kategorie für lokale Nutzung
  • FP8: ~28–30 GB VRAM; Q4: ~14–16 GB – mit Quantisierung auf RTX 4090 nutzbar
  • Prüfen Sie die Qwen-Lizenz vor jedem kommerziellen Einsatz ab einer bestimmten Nutzerzahl
  • Testen Sie das Modell an Ihrem konkreten Anwendungsfall, bevor Sie es produktiv einsetzen
Resources

Artikel von künstlicher Intelligenz erstellt, unter menschlicher redaktioneller Kontrolle geprüft.

Unsere Redaktion
Your Linux server, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux server, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install, everything stays on your machine.

SSHSelf-hostedAI Ops
Get early access
War dieser Artikel hilfreich?

2 Personen gefiel dieser Artikel

Gefällt mir
K
Kaito KuroganeSenior-Redakteur (m/w/d)
Senior-Entwickler mit breitem Spektrum, Backend Go + Frontend TS, Open-Source-Beiträger
Teilen:
Your Linux server, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux server, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install, everything stays on your machine.

Get early access
LIVERadio Geek Kitsune
Tippen zum Hören – für alle derselbe Sound
0··
// Programm
// all stations
// Track teilen →
Themen
Erkunden
Informationen