开发与编程 Aug 14, 2026加入收藏

阿里巴巴在Hugging Face上发布了Qwen 3.8 27B开放权重模型——宣称是迄今为止最佳的本地密集模型。这对你的本地推理设置意味着什么,以及为什么值得关注。
自 Meta 通过 LLaMA 推广开放权重模型以来,本地可运行的最佳密集模型竞争日趋激烈。阿里巴巴近日凭借 Qwen 3.8 27B 取得重大进展——该模型是其 Qwen(千问)家族的 3.8 版本,以开放权重形式在 Hugging Face 发布。
Qwen(发音为「tsyen」)是阿里云的大语言模型(LLM)家族。3.8 版本拥有 270 亿参数,支持 FP8(8 位浮点)量化,可在具备足够 VRAM 的消费级 GPU 上运行。
密集架构与 MoE(混合专家模型,如 Mixtral 或部分 Qwen MoE 模型)相对:密集模型在每次推理时会激活其所有参数。这使其性能更可预测且均匀,但对 VRAM 的要求更高。
要在本地以 FP8 运行 Qwen 3.8 27B,约需 28-30 GB VRAM——适用于专业硬件(如 A6000、H100 80GB)或双 GPU 架构。若采用 Q4_K_M(4 位量化),VRAM 需求降至约 14-16 GB,可在 RTX 3090 或 4090 上运行。
# 通过 Ollama 运行(如模型已打包)
ollama run qwen3.8:27b
# 通过 llama.cpp 使用量化后的 GGUF 文件
./llama-cli -m qwen3.8-27b-q4_k_m.gguf \
-ctx-size 8192 \
-p "Explain ring signatures in cryptography" Qwen 模型在代码与数学推理基准测试中,已多次超越同等规模的西方模型。若首轮独立评测确认其「最佳本地密集模型」的宣称,Qwen 3.8 27B 将成为以下模型的严肃替代方案:
需注意 许可证 问题:Qwen 家族通常采用基于 Apache 2.0 的 Qwen License,但商业用途在用户规模超标时存在限制。在 Hugging Face 的 README 中核实后再用于生产环境。
MoE 模型仅激活部分参数处理每个 token——推理效率更高,但不同领域的能力可能不均匀。密集模型则更稳定,但 VRAM 消耗更大。
本文由人工智能撰写,并经人工编辑审核。