GGUF量化等级

清夏晚风 Lv7

GGUF量化等级

GGUF 文件的命名包含量化方案、量化级别与变体后缀等信息。看懂命名就能根据显存快速选出合适的量化版本,避免下错模型。

MoE 模型与 Dense 模型的区别

GGUF 命名中常出现类似 35B-A3B 的写法,这与模型架构有关:

对比项 Dense(稠密)模型 MoE(混合专家)模型
推理时参数 全部参数参与计算 仅激活部分专家参数
命名示例 27B(总参数 = 实际计算量) 35B-A3B(总参数 35B,每次激活 3B)
显存占用 按总参数量 按总参数量(所有专家均需加载)
推理速度 按总参数量 按激活参数量,更快
能力上限 受实际计算量限制 同等算力下可承载更大总参数量

例如 Qwen3.6-35B-A3B 是 MoE 架构,仅激活 3B 参数就能媲美 27B 稠密模型,因此成为端侧部署的热门选择。

选型影响:GGUF 命名中的总参数量(如 35B)决定文件体积与显存占用,激活参数量(如 A3B)决定推理速度。

量化等级表(7B 模型参考)

格式 含义 典型内存占用(7B模型) 精度损失 适用场景
q2_k 2-bit量化,K-means聚类优化,极端压缩 约2.67GB 较大(约10%+) 资源极有限的边缘设备
q3_k_m 3-bit混合量化,K-means聚类,平衡内存与精度 约3.06GB 中等(约5-8%) 移动端轻量级部署
q4_0 原始4-bit量化(无混合策略) 约3.8GB 较高(约8-10%) 基础推理场景
q4_k_m 4-bit混合量化,对关键层(如Attention.wv)用6-bit,其余用4-bit 约4.45GB 较低(约3-5%) 主流移动端/服务器端部署
q5_0 原始5-bit量化,精度较高但速度较慢 约5.1GB 较小(约2-4%) 高精度需求场景
q5_k_m 5-bit混合量化,K-means优化,平衡性能与内存 约5.4GB 极低(约1-3%) 推荐的通用量化方案
q6_k 6-bit量化,接近FP16精度 约6.7GB 极小(约0.5-1%) 高精度推理(接近无损)
q8_0 8-bit量化,精度接近FP16,内存占用较高 约7.5GB 几乎无损(<0.5%) 高精度服务器端部署
fp16 半精度浮点(16-bit),无量化 约14GB 无损 高精度推理或精度基准

注:7B 模型的内存占用随模型与词表大小略有差异(约 ±0.5GB),且运行还需额外内存存放 KV Cache。

内存占用随模型参数量线性增长,例如 Q4 级别在 35B 模型上约为 17-21GB。

GGUF 命名结构

GGUF 文件的命名遵循一套固定规则,从左到右依次为:

1
Qwen3.6-35B-A3B-[量化方案]-[量化级别]_[变体].gguf

其中 [量化方案] 仅在存在时出现,无前缀时文件名为 模型名-量化级别_变体.gguf,如 Qwen3.6-35B-A3B-Q8_0.gguf。

前缀:量化方案

前缀 含义
UD Unsloth Dynamic 量化,Unsloth 团队优化的动态量化方案,关键层自动以更高位宽(如 8-bit/16-bit)保留,同等体积下精度通常更好,优先选
MXFP4 OCP 开放标准的 Microscaling FP4(4-bit 浮点),RTX 50 系(Blackwell)原生硬件加速,老显卡仅模拟运行
BF16/F32 Brain Float 16 / Float 32,原始精度(未量化),体积最大

量化类型:IQ / Q / K

类型 全称 说明
IQ Importance Quantization 重要性感知量化,利用 imatrix 识别关键权重并保留更高精度
Q Standard Quantization 标准量化
K K-quants llama.cpp 改进的量化算法,通过优化分组策略提升质量,推荐优先选择

量化级别:数字越小体积越小

级别 典型文件大小(35B 模型) 适用场景
Q2 ~10-12GB 极限压缩,质量损失较大
Q3 ~13-17GB 低显存设备应急使用
Q4 ~17-21GB 甜点级,大多数用户首选
Q5 ~24-27GB 高质量需求,接近原始精度
Q6 ~29-32GB 接近无损,需大显存
Q8 ~37GB 几乎无损,但体积较大

注:以上为 unsloth/Qwen3.6-35B-A3B-GGUF 仓库的实测 .gguf 文件大小;运行还需额外显存存放 KV Cache 与计算缓冲。

后缀变体:S / M / L

后缀 含义
_XXS/_XS 极小/超小体积,精度最低,仅应急
_S 小体积,速度较快
_M 黄金平衡点,推荐
_L/_XL 大/超大体积,最高精度(XL 为 Unsloth Dynamic 特有)
_NL 非线性量化(如 IQ4_NL),同档位精度更优
_K_M/_K_X K-quants 下的 Medium / Extra Large 分级

记忆口诀:S 快 M 稳 L 准,日常用 M,追求极致选 L,显存紧张选 S。

特殊文件:mmproj 与 imatrix

文件名 用途 是否必须
mmproj-xxx.gguf 多模态投影器(视觉编码器) ✅ 用视觉功能时必须
imatrix_unsloth.gguf 重要性矩阵,用于提升 IQ 量化质量 ❌ 可选

多模态使用示例:

1
2
3
4
5
./llama-cli \
--model Qwen3.6-35B-A3B-UD-Q5_K_M.gguf \
--mmproj mmproj-BF16.gguf \
--image your_image.jpg \
--prompt "描述这张图片"

选型参考(Qwen3.6-35B-A3B 实测)

显存 推荐版本 文件大小
16GB UD-IQ3_XXS / UD-IQ3_S 13.2 / 13.7GB
24GB UD-IQ4_XS / UD-Q4_K_S 17.7 / 20.9GB
32GB UD-Q5_K_M / UD-Q6_K 26.5 / 29.1GB

避坑提醒:

  • 文件大小仅为权重占用,运行还需额外显存存放 KV Cache 与计算缓冲,建议留出 1-3GB 余量
  • Q8_0(36.90GB)超出显存时需内存 offload,速度暴跌
  • MXFP4(21.71GB)在 RTX 50 系(Blackwell)上原生加速,老显卡仅模拟运行、无速度优势,不建议

参考链接

  • Title: GGUF量化等级
  • Author: 清夏晚风
  • Created at : 2026-08-15 10:36:57
  • Updated at : 2026-09-24 06:18:38
  • Link: https://blog.yuil.cn/2026/08/15/AI相关工具/GGUF量化/GGUF量化等级/
  • License: This work is licensed under CC BY-NC-SA 4.0.
Comments