Dev & Código Aug 14, 2026Añadir a favoritos

Alibaba publica Qwen 3.8 27B en pesos abiertos en Hugging Face: afirma ser el mejor modelo denso local hasta la fecha. ¿Qué significa esto concretamente para tus configuraciones de inferencia local y por qué merece atención?
Desde que Meta popularizó los modelos de pesos abiertos con LLaMA, la competencia por el mejor modelo denso ejecutable localmente se ha intensificado. Alibaba acaba de marcar un punto significativo con Qwen 3.8 27B —la versión 3.8 de su familia Qwen (千问, Mil Preguntas), publicada con pesos abiertos en Hugging Face.
Qwen (pronunciado «tsyen») es la familia de LLM (Large Language Models, grandes modelos de lenguaje) de Alibaba Cloud. La versión 3.8 con 27 mil millones de parámetros está disponible en cuantificación FP8 (coma flotante de 8 bits), lo que la hace operable en GPUs de consumo con suficiente VRAM.
La clasificación densa contrasta este modelo con las arquitecturas MoE (Mixture of Experts, Mezcla de Expertos) como Mixtral o algunos modelos Qwen MoE: un modelo denso activa la totalidad de sus parámetros en cada inferencia. Es más predecible y homogéneo en rendimiento, pero más exigente en VRAM.
Para ejecutar Qwen 3.8 27B en FP8 localmente, se requieren aproximadamente 28-30 GB de VRAM —accesible en hardware profesional (A6000, H100 80 GB) o en configuraciones de doble GPU para entusiastas. Con cuantificación Q4_K_M (4 bits), se reduce a unos 14-16 GB, lo que cabe en una RTX 3090 o 4090.
# Vía Ollama si el modelo está empaquetado
ollama run qwen3.8:27b
# Vía llama.cpp con el archivo GGUF cuantificado
./llama-cli -m qwen3.8-27b-q4_k_m.gguf \
-ctx-size 8192 \
-p "Explica las firmas de anillo en criptografía" Los modelos Qwen han superado regularmente a sus equivalentes occidentales de tamaño comparable en los benchmarks de código y razonamiento matemático. Si las primeras evaluaciones independientes confirman la afirmación de «mejor modelo denso local», Qwen 3.8 27B se convierte en una alternativa seria a:
Un punto de vigilancia sobre la licencia: la familia Qwen suele utilizar una Qwen License derivada de Apache 2.0, con restricciones comerciales más allá de cierto umbral de usuarios. Verifíquelo en el README de Hugging Face antes de un despliegue en producción.
Un modelo MoE solo activa una fracción de sus parámetros por token —es más eficiente en inferencia, pero sus capacidades pueden ser menos homogéneas según los dominios. Un modelo denso es más constante, al precio de un consumo de VRAM más elevado.
Artículo producido por inteligencia artificial, revisado bajo control editorial humano.