Qwen 3.8 27B : Alibaba lança o melhor modelo denso local em open weights

Dev & Code Aug 14, 2026Adicionar aos favoritos

Qwen 3.8 27B : Alibaba lança o melhor modelo denso local em open weights
Ilustração : Momiji Shirogane

Alibaba lança o Qwen 3.8 27B em pesos abertos no Hugging Face — reivindicado como o melhor modelo denso local até hoje. O que isso significa na prática para suas configurações de inferência local e por que merece atenção.

O contexto: a corrida pelos modelos densos locais

Desde que a Meta popularizou os modelos com pesos abertos com o LLaMA, a competição pelo melhor modelo denso executável localmente se intensificou. A Alibaba acaba de marcar um ponto significativo com o Qwen 3.8 27B — a versão 3.8 de sua família Qwen (千问, Thousand Questions), lançada com pesos abertos no Hugging Face.

Qwen (pronuncia-se « tsyen ») é a família de LLMs (Large Language Models, grandes modelos de linguagem) da Alibaba Cloud. A versão 3.8 com 27 bilhões de parâmetros está disponível em quantização FP8 (ponto flutuante de 8 bits), o que a torna operável em GPUs de consumo com VRAM suficiente.

Dense vs MoE: por que isso importa

A classificação densa opõe esse modelo às arquiteturas MoE (Mixture of Experts, Mistura de Especialistas) como o Mixtral ou alguns modelos Qwen MoE: um modelo denso ativa todos os seus parâmetros a cada inferência. Isso é mais previsível e homogêneo em desempenho, mas mais exigente em VRAM.

Para executar o Qwen 3.8 27B em FP8 localmente, são necessários cerca de 28-30 GB de VRAM — acessível em hardware profissional (A6000, H100 80 GB) ou em configuração dual-GPU em setups enthusiast. Em Q4_K_M (quantização de 4 bits), esse valor cai para cerca de 14-16 GB, o que cabe em uma RTX 3090 ou 4090.

# Via Ollama, se o modelo estiver empacotado
ollama run qwen3.8:27b

# Via llama.cpp com o arquivo GGUF quantizado
./llama-cli -m qwen3.8-27b-q4_k_m.gguf \
 -ctx-size 8192 \
 -p "Explain ring signatures in cryptography"

Por que isso merece atenção

Os modelos Qwen têm consistentemente superado seus equivalentes ocidentais de tamanho comparável nos benchmarks de código e raciocínio matemático. Se as primeiras avaliações independentes confirmarem a alegação de "melhor modelo denso local", o Qwen 3.8 27B se torna uma alternativa séria para:

  • Mistral Large para raciocínio e multilingue
  • LLaMA 3.1 70B (maior, mais exigente) para usos que requerem uma pegada menor
  • APIs proprietárias para desenvolvedores preocupados com privacidade ou controle de custos

Um ponto de atenção sobre a licença: a família Qwen geralmente usa uma Qwen License derivada da Apache 2.0, com restrições comerciais acima de um certo limite de usuários. Verifique no README do Hugging Face antes de implantar em produção.

Dense vs MoE

Um modelo MoE ativa apenas uma fração de seus parâmetros por token — é mais eficiente na inferência, mas as capacidades podem ser menos homogêneas dependendo do domínio. Um modelo denso é mais constante, ao custo de um consumo maior de VRAM.

Para lembrar

  • Qwen 3.8 27B = modelo denso de pesos abertos da Alibaba, reivindicado como o melhor de sua categoria local até o momento
  • FP8: ~28-30 GB VRAM; Q4: ~14-16 GB — acessível em RTX 4090 com quantização
  • Verifique a licença Qwen antes de qualquer uso comercial acima de um limite de usuários
  • Faça benchmarks no seu caso de uso real antes de adotá-lo como modelo de produção
Resources

Artigo produzido por inteligência artificial, revisto sob controlo editorial humano.

A nossa redação
Your Linux server, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux server, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install, everything stays on your machine.

SSHSelf-hostedAI Ops
Get early access
Este artigo foi-lhe útil?

2 pessoas gostaram deste artigo

Gosto
K
Kaito KuroganeSenior Dev Writer
Senior polyvalent developer, backend Go + frontend TS, open source contributor.
Partilhar:
Your Linux server, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux server, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install, everything stays on your machine.

Get early access
LIVERadio Geek Kitsune
Toca para ouvir, o mesmo som para todos
0··
// Programa
// all stations
// partilhar uma faixa →
Secções
Explorar
Informações