GGUF量化等级
GGUF量化等级
GGUF 文件的命名包含量化方案、量化级别与变体后缀等信息。看懂命名就能根据显存快速选出合适的量化版本,避免下错模型。
MoE 模型与 Dense 模型的区别
GGUF 命名中常出现类似 35B-A3B 的写法,这与模型架构有关:
| 对比项 | Dense(稠密)模型 | MoE(混合专家)模型 |
|---|---|---|
| 推理时参数 | 全部参数参与计算 | 仅激活部分专家参数 |
| 命名示例 | 27B(总参数 = 实际计算量) | 35B-A3B(总参数 35B,每次激活 3B) |
| 显存占用 | 按总参数量 | 按总参数量(所有专家均需加载) |
| 推理速度 | 按总参数量 | 按激活参数量,更快 |
| 能力上限 | 受实际计算量限制 | 同等算力下可承载更大总参数量 |
例如 Qwen3.6-35B-A3B 是 MoE 架构,仅激活 3B 参数就能媲美 27B 稠密模型,因此成为端侧部署的热门选择。
选型影响:GGUF 命名中的总参数量(如 35B)决定文件体积与显存占用,激活参数量(如 A3B)决定推理速度。
量化等级表(7B 模型参考)
| 格式 | 含义 | 典型内存占用(7B模型) | 精度损失 | 适用场景 |
|---|---|---|---|---|
| q2_k | 2-bit量化,K-means聚类优化,极端压缩 | 约2.67GB | 较大(约10%+) | 资源极有限的边缘设备 |
| q3_k_m | 3-bit混合量化,K-means聚类,平衡内存与精度 | 约3.06GB | 中等(约5-8%) | 移动端轻量级部署 |
| q4_0 | 原始4-bit量化(无混合策略) | 约3.8GB | 较高(约8-10%) | 基础推理场景 |
| q4_k_m | 4-bit混合量化,对关键层(如Attention.wv)用6-bit,其余用4-bit | 约4.45GB | 较低(约3-5%) | 主流移动端/服务器端部署 |
| q5_0 | 原始5-bit量化,精度较高但速度较慢 | 约5.1GB | 较小(约2-4%) | 高精度需求场景 |
| q5_k_m | 5-bit混合量化,K-means优化,平衡性能与内存 | 约5.4GB | 极低(约1-3%) | 推荐的通用量化方案 |
| q6_k | 6-bit量化,接近FP16精度 | 约6.7GB | 极小(约0.5-1%) | 高精度推理(接近无损) |
| q8_0 | 8-bit量化,精度接近FP16,内存占用较高 | 约7.5GB | 几乎无损(<0.5%) | 高精度服务器端部署 |
| fp16 | 半精度浮点(16-bit),无量化 | 约14GB | 无损 | 高精度推理或精度基准 |
注:7B 模型的内存占用随模型与词表大小略有差异(约 ±0.5GB),且运行还需额外内存存放 KV Cache。
内存占用随模型参数量线性增长,例如 Q4 级别在 35B 模型上约为 17-21GB。
GGUF 命名结构
GGUF 文件的命名遵循一套固定规则,从左到右依次为:
1 | Qwen3.6-35B-A3B-[量化方案]-[量化级别]_[变体].gguf |
其中 [量化方案] 仅在存在时出现,无前缀时文件名为 模型名-量化级别_变体.gguf,如 Qwen3.6-35B-A3B-Q8_0.gguf。
前缀:量化方案
| 前缀 | 含义 |
|---|---|
| UD | Unsloth Dynamic 量化,Unsloth 团队优化的动态量化方案,关键层自动以更高位宽(如 8-bit/16-bit)保留,同等体积下精度通常更好,优先选 |
| MXFP4 | OCP 开放标准的 Microscaling FP4(4-bit 浮点),RTX 50 系(Blackwell)原生硬件加速,老显卡仅模拟运行 |
| BF16/F32 | Brain Float 16 / Float 32,原始精度(未量化),体积最大 |
量化类型:IQ / Q / K
| 类型 | 全称 | 说明 |
|---|---|---|
| IQ | Importance Quantization | 重要性感知量化,利用 imatrix 识别关键权重并保留更高精度 |
| Q | Standard Quantization | 标准量化 |
| K | K-quants | llama.cpp 改进的量化算法,通过优化分组策略提升质量,推荐优先选择 |
量化级别:数字越小体积越小
| 级别 | 典型文件大小(35B 模型) | 适用场景 |
|---|---|---|
| Q2 | ~10-12GB | 极限压缩,质量损失较大 |
| Q3 | ~13-17GB | 低显存设备应急使用 |
| Q4 | ~17-21GB | 甜点级,大多数用户首选 |
| Q5 | ~24-27GB | 高质量需求,接近原始精度 |
| Q6 | ~29-32GB | 接近无损,需大显存 |
| Q8 | ~37GB | 几乎无损,但体积较大 |
注:以上为 unsloth/Qwen3.6-35B-A3B-GGUF 仓库的实测 .gguf 文件大小;运行还需额外显存存放 KV Cache 与计算缓冲。
后缀变体:S / M / L
| 后缀 | 含义 |
|---|---|
| _XXS/_XS | 极小/超小体积,精度最低,仅应急 |
| _S | 小体积,速度较快 |
| _M | 黄金平衡点,推荐 |
| _L/_XL | 大/超大体积,最高精度(XL 为 Unsloth Dynamic 特有) |
| _NL | 非线性量化(如 IQ4_NL),同档位精度更优 |
| _K_M/_K_X | K-quants 下的 Medium / Extra Large 分级 |
记忆口诀:S 快 M 稳 L 准,日常用 M,追求极致选 L,显存紧张选 S。
特殊文件:mmproj 与 imatrix
| 文件名 | 用途 | 是否必须 |
|---|---|---|
| mmproj-xxx.gguf | 多模态投影器(视觉编码器) | ✅ 用视觉功能时必须 |
| imatrix_unsloth.gguf | 重要性矩阵,用于提升 IQ 量化质量 | ❌ 可选 |
多模态使用示例:
1 | ./llama-cli \ |
选型参考(Qwen3.6-35B-A3B 实测)
| 显存 | 推荐版本 | 文件大小 |
|---|---|---|
| 16GB | UD-IQ3_XXS / UD-IQ3_S | 13.2 / 13.7GB |
| 24GB | UD-IQ4_XS / UD-Q4_K_S | 17.7 / 20.9GB |
| 32GB | UD-Q5_K_M / UD-Q6_K | 26.5 / 29.1GB |
避坑提醒:
- 文件大小仅为权重占用,运行还需额外显存存放 KV Cache 与计算缓冲,建议留出 1-3GB 余量
- Q8_0(36.90GB)超出显存时需内存 offload,速度暴跌
- MXFP4(21.71GB)在 RTX 50 系(Blackwell)上原生加速,老显卡仅模拟运行、无速度优势,不建议
参考链接
- 一文读懂 Qwen3.6 GGUF 量化命名:https://blog.csdn.net/qq_41797451/article/details/160237954
- unsloth/Qwen3.6-35B-A3B-GGUF(文件体积实测):https://www.modelscope.cn/models/unsloth/Qwen3.6-35B-A3B-GGUF/files
- Unsloth Dynamic:https://unsloth.ai/docs/zh/ji-chu-zhi-shi/unsloth-dynamic-2.0-ggufs
- Title: GGUF量化等级
- Author: 清夏晚风
- Created at : 2026-08-15 10:36:57
- Updated at : 2026-09-24 06:18:38
- Link: https://blog.yuil.cn/2026/08/15/AI相关工具/GGUF量化/GGUF量化等级/
- License: This work is licensed under CC BY-NC-SA 4.0.
Comments