Dev & Code Aug 14, 2026Adicionar aos favoritos

Alibaba lança o Qwen 3.8 27B em pesos abertos no Hugging Face — reivindicado como o melhor modelo denso local até hoje. O que isso significa na prática para suas configurações de inferência local e por que merece atenção.
Desde que a Meta popularizou os modelos com pesos abertos com o LLaMA, a competição pelo melhor modelo denso executável localmente se intensificou. A Alibaba acaba de marcar um ponto significativo com o Qwen 3.8 27B — a versão 3.8 de sua família Qwen (千问, Thousand Questions), lançada com pesos abertos no Hugging Face.
Qwen (pronuncia-se « tsyen ») é a família de LLMs (Large Language Models, grandes modelos de linguagem) da Alibaba Cloud. A versão 3.8 com 27 bilhões de parâmetros está disponível em quantização FP8 (ponto flutuante de 8 bits), o que a torna operável em GPUs de consumo com VRAM suficiente.
A classificação densa opõe esse modelo às arquiteturas MoE (Mixture of Experts, Mistura de Especialistas) como o Mixtral ou alguns modelos Qwen MoE: um modelo denso ativa todos os seus parâmetros a cada inferência. Isso é mais previsível e homogêneo em desempenho, mas mais exigente em VRAM.
Para executar o Qwen 3.8 27B em FP8 localmente, são necessários cerca de 28-30 GB de VRAM — acessível em hardware profissional (A6000, H100 80 GB) ou em configuração dual-GPU em setups enthusiast. Em Q4_K_M (quantização de 4 bits), esse valor cai para cerca de 14-16 GB, o que cabe em uma RTX 3090 ou 4090.
# Via Ollama, se o modelo estiver empacotado
ollama run qwen3.8:27b
# Via llama.cpp com o arquivo GGUF quantizado
./llama-cli -m qwen3.8-27b-q4_k_m.gguf \
-ctx-size 8192 \
-p "Explain ring signatures in cryptography" Os modelos Qwen têm consistentemente superado seus equivalentes ocidentais de tamanho comparável nos benchmarks de código e raciocínio matemático. Se as primeiras avaliações independentes confirmarem a alegação de "melhor modelo denso local", o Qwen 3.8 27B se torna uma alternativa séria para:
Um ponto de atenção sobre a licença: a família Qwen geralmente usa uma Qwen License derivada da Apache 2.0, com restrições comerciais acima de um certo limite de usuários. Verifique no README do Hugging Face antes de implantar em produção.
Um modelo MoE ativa apenas uma fração de seus parâmetros por token — é mais eficiente na inferência, mas as capacidades podem ser menos homogêneas dependendo do domínio. Um modelo denso é mais constante, ao custo de um consumo maior de VRAM.
Artigo produzido por inteligência artificial, revisto sob controlo editorial humano.