Разработка & Кодинг Aug 14, 2026В закладки

Alibaba публикует Qwen 3.8 27B с открытыми весами на Hugging Face — позиционируется как лучшая локальная плотная модель на сегодня. Что это значит на практике для ваших локальных инференсов и почему это заслуживает внимания.
С тех пор как Meta популяризовала модели с открытыми весами с выпуском LLaMA, соревнование за лучшую плотную модель, которую можно запустить локально, обострилось. Alibaba только что сделала значительный шаг вперёд с Qwen 3.8 27B — версией 3.8 своей семьи Qwen (千问, «Тысяча вопросов»), выпущенной с открытыми весами на Hugging Face.
Qwen (произносится «цянь») — это семейство LLM (больших языковых моделей) от Alibaba Cloud. Версия 3.8 с 27 миллиардами параметров доступна в квантизации FP8 (8-битное число с плавающей точкой), что позволяет запускать её на потребительских GPU с достаточным объёмом VRAM.
Классификация плотные против MoE (Mixture of Experts, смесь экспертов) таких моделей, как Mixtral или некоторые модели Qwen MoE: плотная модель активирует все свои параметры при каждом инференсе. Это более предсказуемо и однородно по производительности, но требует больше VRAM.
Для локального запуска Qwen 3.8 27B в FP8 потребуется около 28-30 ГБ VRAM — это доступно на профессиональном оборудовании (A6000, H100 80 ГБ) или на двух GPU в энтузиастских сборках. При квантизации Q4_K_M (4 бита) объём памяти снижается до примерно 14-16 ГБ, что подходит для RTX 3090 или 4090.
# Через Ollama, если модель упакована
ollama run qwen3.8:27b
# Через llama.cpp с квантизированным файлом GGUF
./llama-cli -m qwen3.8-27b-q4_k_m.gguf \
-ctx-size 8192 \
-p "Объясните кольцевые подписи в криптографии" Модели Qwen регулярно превосходят западные аналоги сопоставимого размера в бенчмарках по коду и математическому мышлению. Если независимые оценки подтвердят заявление «лучшая плотная локальная модель», Qwen 3.8 27B станет серьёзной альтернативой:
Обратите внимание на лицензию: семейство Qwen обычно использует Qwen License, производную от Apache 2.0, с ограничениями на коммерческое использование при превышении определённого порога пользователей. Проверьте README на Hugging Face перед развёртыванием в продакшн.
Модель MoE активирует только часть своих параметров на каждый токен — это эффективнее при инференсе, но возможности могут быть менее однородными в зависимости от домена. Плотная модель более стабильна, но требует больше VRAM.
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.