# AI 模型质量保障 · 压缩 · 低端显卡与平民化部署  
## 全面认知手册（现状 · 科研 · 未来）

> **目标**：弄清 AI 模型如何 **保质量、压体积、跑在低端显卡/平民设备上**——技术原理、工具生态、硬件门槛、科研前沿与未来。  
> **方法**：规划 → **4 轮迭代调研** → 双层文档（简介表 + 详细说明 + 链接）。  
> **日期**：2026-07-13  
> **范围**：以 **LLM 推理压缩与本地部署** 为主，兼及图像/语音侧共性思路。

**姊妹文档**  
- `纯AI领域全面认知手册.md`  
- `AI生成式媒体_图像视频音频_认知手册.md`  

---

# 阅读导航

| 时间 | 读什么 |
|------|--------|
| **5 分钟** | [§0 总览](#0-五分钟总览) + [附录作弊条](#附录一页纸作弊条) |
| **30 分钟** | §0–§3 + §6 硬件 + §7 工具 |
| **深挖技术** | §4 压缩全家桶 · §5 质量保障 |
| **科研与未来** | §8–§9 |
| **方法** | [§11 四轮迭代](#11-规划与四轮迭代过程) |

---

# 目录

0. [五分钟总览](#0-五分钟总览)  
1. [问题本质：质量 · 体积 · 速度 · 显存](#1-问题本质质量--体积--速度--显存)  
2. [技术地图：怎么「变小」还能「好用」](#2-技术地图怎么变小还能好用)  
3. [量化深度：INT8/INT4 · GPTQ · AWQ · GGUF](#3-量化深度int8int4--gptq--awq--gguf)  
4. [蒸馏 · 剪枝 · 小模型 · MoE](#4-蒸馏--剪枝--小模型--moe)  
5. [推理系统优化：注意力 · KV · 投机解码](#5-推理系统优化注意力--kv--投机解码)  
6. [平民硬件现实：能跑多大](#6-平民硬件现实能跑多大)  
7. [软件生态：llama.cpp · Ollama · MLX · vLLM…](#7-软件生态llamacpp--ollama--mlx--vllm)  
8. [科研前沿：1.58-bit · 端侧 · 边缘](#8-科研前沿158-bit--端侧--边缘)  
9. [未来情景与时间线](#9-未来情景与时间线)  
10. [实践指南：选型 · 工作流 · 质量门](#10-实践指南选型--工作流--质量门)  
11. [规划与四轮迭代过程](#11-规划与四轮迭代过程)  
12. [学习路径](#12-学习路径)  
13. [链接总库](#13-链接总库)  
14. [诚实边界](#14-诚实边界)  
[附录：一页纸作弊条](#附录一页纸作弊条)

---

# 0. 五分钟总览

## 0.1 简介

「大模型只有数据中心能跑」已经过时。通过 **量化 + 蒸馏小模型 + 高效推理引擎 + 可选 MoE**，**8–12GB 消费级显卡** 可流畅跑 7B–14B 级对话模型；旗舰手机可跑 1B–3B 级；更大模型靠「显存不够时 CPU/RAM 分担」或「只激活部分专家」。

## 0.2 一句话地图

| 问题 | 答案 |
|------|------|
| **怎么保证质量？** | 评测矩阵 + 校准数据 + 别压过狠；任务对齐（蒸馏/微调）比盲目缩小更有效 |
| **怎么压缩？** | 权重量化（主）· 蒸馏变小 · 剪枝 · 架构（MoE/高效注意力）· 系统层（KV 量化、批处理） |
| **低端显卡怎么跑？** | GGUF/llama.cpp 或 AWQ+vLLM；层卸载；降上下文；用 3B–8B 或 MoE「总参大、激活小」 |
| **平民现状** | Ollama/LM Studio 一键；开源权重多；质量与云顶尖仍有差距 |
| **科研方向** | 原生低比特训练（BitNet）、更好 PTQ、KV 极致压缩、NPU 专用核 |
| **未来** | 端侧默认离线助手；专用低比特芯片；云边协同 |

## 0.3 压缩手段「谁主谁辅」

```
训练期：小模型设计 · 蒸馏 · 原生低比特(BitNet) · 剪枝感知训练
    ↓
导出期：GPTQ / AWQ / GGUF 等后训练量化
    ↓
推理期：FlashAttention · KV 量化 · 投机解码 · 连续批处理 · 层卸载
    ↓
产品期：LoRA 热插拔 · 路由到云大模型（难任务）
```

## 0.4 内存直觉（粗算）

| 精度 | 每参数约 | 7B 权重约 | 70B 权重约 |
|------|----------|-----------|------------|
| FP16/BF16 | 2 字节 | ~14 GB | ~140 GB |
| INT8 | 1 字节 | ~7 GB | ~70 GB |
| INT4 | 0.5 字节 | ~3.5–4.5 GB* | ~35–40 GB* |
| ~1.58-bit 原生 | ~0.2 字节量级 | 显著更小 | 研究/早期产品 |

\*另加 **KV Cache**（随上下文长度暴涨）、激活、框架开销——所以「模型 4GB」≠「4GB 显卡一定够」。

---

# 1. 问题本质：质量 · 体积 · 速度 · 显存

## 1.1 四目标冲突

| 目标 | 简介 | 往往牺牲 |
|------|------|----------|
| **质量** | 准确、推理、拒答、安全 | 压缩过狠时 |
| **体积** | 磁盘/下载/存储 | — |
| **显存/内存** | 能否装进卡 | 速度或上下文 |
| **速度** | tokens/s、首字延迟 | 质量或成本 |

## 1.2 瓶颈在哪（为何量化有效）

| 阶段 | 瓶颈 | 说明 |
|------|------|------|
| 预填充 prefill | 算力 | 处理整段提示 |
| 解码 decode | **显存带宽** 常为主 | 反复读权重与 KV |
| 结论 | 降位宽 → 同带宽搬更多参数 → 常加速 | 推理多是 memory-bound |

## 1.3 「质量」测什么

| 维度 | 简介 | 压缩时谁先崩 |
|------|------|----------------|
| 困惑度 / 基准分 | MMLU、代码、数学 | 低 bit 时数学/多步更敏感 |
| 主观生成 | 连贯、幻觉 | 过度 Q2/Q3 明显变傻 |
| 长上下文 | 找针、摘要 | KV 压缩/量化影响大 |
| 安全对齐 | 拒答、偏见 | 量化偶发「对齐漂移」 |
| 任务专项 | 领域准确率 | 应用最相关 |

**原则**：用 **你的任务集** 对比 FP16 vs Q4/Q5，而不是只看博主 demo。

---

# 2. 技术地图：怎么「变小」还能「好用」

## 2.1 全家桶总表

| 技术 | 作用对象 | 简介 | 质量影响（典型） | 平民相关 |
|------|----------|------|------------------|----------|
| **后训练量化 PTQ** | 已有权重大模型 | 不重训，压到 8/4 bit | Q4 常 -1%～-3% 量级任务分* | ★★★★★ |
| **量化感知训练 QAT** | 训练过程 | 训练时模拟低比特 | 极低 bit 更好 | ★★ 成本高 |
| **知识蒸馏** | 小模型 | 大模型教小模型 | 专长任务可逼近大模型 | ★★★★ |
| **剪枝** | 权重/专家 | 删不重要连接 | 结构剪枝更易加速 | ★★★ |
| **高效架构** | 设计时 | GQA、MLA、SSM、MoE | 从根上省 | ★★★★ |
| **PEFT/LoRA** | 适配 | 不存多份全量模型 | 定制几乎不损 | ★★★★★ |
| **系统优化** | 引擎 | FlashAttn、KV 量化、投机解码 | 不改权重大多无损/微损 | ★★★★★ |
| **原生 1.58-bit** | 从零训练 | BitNet 类 | 论文称可比同规模 FP | ★★ 生态成长中 |

\*具体数字因模型与校准而异，见 §3 产业对比叙述。

## 2.2 保证质量的「方法论」

| 方法 | 简介 | 详细说明 |
|------|------|----------|
| 足够大的「有效容量」 | 别把 70B 硬压到能塞进 4GB 还要求 GPT-4 | 选对尺寸阶梯 |
| 校准数据 | PTQ 用代表性样本 | 校准偏→AWQ/GPTQ 变脆 |
| 混合精度 | 敏感层更高 bit | 常见工程 trick |
| 蒸馏对齐任务 | 小模型专精 | 聊天小模型 + 云端推理大模型 |
| 评测门禁 | 压缩前后同卷考试 | 发布前必跑 |
| 人审抽检 | 主观质量 | 开放生成任务 |

---

# 3. 量化深度：INT8/INT4 · GPTQ · AWQ · GGUF

## 3.1 精度阶梯

| 格式 | 简介 | 典型用途 |
|------|------|----------|
| FP32 | 全精度 | 研究少用 |
| FP16/BF16 | 训练/高端推理基线 | 数据中心 |
| FP8 | 新卡友好 | 服务端吞吐 |
| INT8 | 接近无损压缩 | 边缘/服务 |
| INT4 / NF4 | 平民主力 | 消费卡本地 |
| 2–3 bit | 极限体积 | 质量掉速明显，慎用 |
| 三值 ~1.58 bit | 原生训练路线 | BitNet 科研/早期产品 |

## 3.2 主流后训练量化方法

| 方法 | 简介 | 详细说明 | 适合 |
|------|------|----------|------|
| **GPTQ** | 逐层二阶近似压权重 | GPU 向；INT4 经典；部分基准上略逊 AWQ | 服务端、兼容栈 |
| **AWQ** | **激活感知**，保护重要通道 | 常报 4-bit 下质量/推理更稳；校准数据要选好 | 生产 INT4 常见优选 |
| **GGUF + llama.cpp 体系** | 文件格式 + 多后端运行时 | Q2_K～Q8_0 等多档；CPU/GPU/Apple 通吃；本地生态事实标准 | **平民首选** |
| **EXL2 等** | 可变 bit 等 | 部分社区追速度 | 特定引擎 |
| **SmoothQuant 等** | 平滑激活利量化 | 与 W8A8 等组合 | 服务端 |
| **QLoRA** | 4-bit 基座上 LoRA 微调 | 训练省显存，不是纯推理格式 | 个人微调 |

产业对比叙述例（8B/70B 量级、质量掉点供参考，非普适真理）：  
https://sesamedisk.com/quantization-techniques-ai-inference-2026/  

解读：  
https://www.spheron.network/blog/awq-quantization-guide-llm-deployment/  
https://www.e2enetworks.com/blog/which-quantization-method-is-best-for-you-gguf-gptq-or-awq  

## 3.3 GGUF 档位怎么选（经验表）

| 档位取向 | 简介 | 质量 | 体积/速度 |
|----------|------|------|-----------|
| Q8_0 / Q6_K | 接近原版 | 高 | 较大 |
| **Q5_K_M / Q4_K_M** | 平民甜点 | 多数任务可接受 | **推荐起点** |
| Q3_K / IQ3 | 更挤 | 推理/代码更易掉 | 低显存 |
| Q2 | 极限 | 常明显变差 | 仅试用 |

社区盲测讨论（主观）：https://github.com/ggml-org/llama.cpp/discussions/5962  

## 3.4 量化会伤哪里更多

| 更稳 | 更脆 |
|------|------|
| 闲聊、摘要、简单指令 | 竞赛数学、多步代码、严谨逻辑 |
| 大模型的 Q4 | 同档位小模型 Q3 |
| 校准匹配领域 | 校准数据「窄」的 AWQ |

---

# 4. 蒸馏 · 剪枝 · 小模型 · MoE

## 4.1 知识蒸馏（KD）

### 简介

**大老师 → 小学生**：学生学老师的输出分布/推理轨迹，而不是只学原始语料。

### 表

| 类型 | 简介 | 例子取向 |
|------|------|----------|
| Logits 蒸馏 | 学软标签概率 | Llama 3.2 1B/3B 等边缘模型叙事 |
| 特征/中间层 | 对齐表示 | 研究常用 |
| **推理轨迹蒸馏** | 学长 CoT | DeepSeek-R1 蒸馏 1.5B–70B 等，小模型数学可超更大基座 |
| 多步蒸馏 | 逐级缩小能力鸿沟 | 容量差过大时一跳蒸馏易崩 |

端侧综述取向：https://v-chandra.github.io/on-device-llms/  
SLM 综述 arXiv 例：https://arxiv.org/html/2501.05465v2  

### 质量含义

| 点 | 说明 |
|----|------|
| 专精可极强 | 领域小模型 + 好数据 > 通用半吊子大模型 |
| 不能魔法 | 参数过少装不下全部能力 |
| 与量化叠加 | 先蒸馏再 Q4 是平民标配配方 |

---

## 4.2 剪枝（Pruning）

| 类型 | 简介 | 详细说明 |
|------|------|----------|
| 非结构 | 删单个权重 | 稀疏度高，需稀疏算子才真加速 |
| 结构 | 删头/通道/层 | 通用硬件更好加速 |
| LLM-Pruner 等 | 分组重要性 | 实用工具方向 |
| **MoE 专家剪枝** | 删/合并专家 | 减总参数与内存；路由提示哪些专家冗余 |

MoE 剪枝论文例：  
https://arxiv.org/abs/2410.12013 （MoE-Pruner）  
https://arxiv.org/abs/2407.00945 （EEP）  

---

## 4.3 小语言模型 SLM（1B–9B）

| 点 | 说明 |
|----|------|
| 定义取向 | 约 1–9B 参数族，可边缘部署 |
| 为何够用 | 多数办公/客服/分类不需要 70B |
| 隐私 | 数据不出设备 |
| 代价 | 复杂推理、知识广度弱 → **路由到云** |

系统综述（部署/隐私/量化组合）：  
https://onlinelibrary.wiley.com/doi/full/10.1111/exsy.70331  

---

## 4.4 MoE：总参数大，每次只算一部分

| 点 | 简介 |
|----|------|
| 思想 | 很多「专家」FFN，路由只激活少数 |
| 好处 | 同算力下更大知识库；消费卡可跑「总参 30B+、激活数 B 级」类模型（视实现） |
| 内存 | 专家权重仍常要装下或卸载；有专家固定进显存等技巧（llama.cpp `-ncmoe` 等社区实践） |
| 质量 | 好路由 ≈ 大模型；差路由浪费 |

社区硬件实践叙述例：12GB 卡跑大 MoE 量化的经验帖（作启发非保证）——检索 *Qwen MoE llama.cpp 4070*。

---

# 5. 推理系统优化：注意力 · KV · 投机解码

## 5.1 简介

**不改模型权重** 也能大幅加速、省显存——平民与机房都用。

## 5.2 FlashAttention 与高效注意力

| 技术 | 简介 | 作用 |
|------|------|------|
| FlashAttention 系 | 分块算注意力，少写 HBM | 省显存、加速，长上下文关键 |
| GQA / MQA | 组查询/多查询注意力 | 减 KV 体积 |
| MLA 等 | 更激进的注意力压缩 | 深长上下文服务 |

## 5.3 KV Cache 优化

| 问题 | 说明 |
|------|------|
| 现象 | 生成越长，KV 越大，显存爆 |
| 手段 | FP8/INT4/更低 bit 量化 KV；驱逐不重要 token；分层量化 |
| 研究 | 层次量化 KV + 自投机解码等（如 Apple QuantSpec 取向：高接受率、端到端加速） |

- QuantSpec（Apple ML Research）：https://machinelearning.apple.com/research/quantspec  
- arXiv：https://arxiv.org/abs/2502.10424  
- vLLM FP8 KV 文档：https://docs.vllm.ai/en/latest/features/quantization/quantized_kvcache/  

## 5.4 投机解码（Speculative Decoding）

| 点 | 说明 |
|----|------|
| 思想 | 小草稿模型猜多词，大模型一次验证 |
| 效果 | 接受率高时显著加速解码 |
| 与量化 | 草稿可用更低 bit；自投机共享权重 |

## 5.5 服务端叠加（对照平民）

| 技术 | 机房 | 家用 |
|------|------|------|
| 连续批处理 | vLLM 核心 | 单用户不重要 |
| TensorRT-LLM / 专用核 | 极致吞吐 | 可选 |
| PagedAttention | 显存碎片 | 框架内置 |

---

# 6. 平民硬件现实：能跑多大

## 6.1 简介

**经验规则**（Q4–Q5、中等上下文、聊天向）——实测为准。

## 6.2 显存/内存粗对照

| 硬件 | 粗可用模型取向 | 说明 |
|------|----------------|------|
| **8GB 显存** | 7B Q4～Q5；部分 13B 极限/卸载 | 上下文别开太大 |
| **12GB** | 7B–14B 舒适；MoE 总参更大可试 | 甜点卡常见 |
| **16–24GB** | 14B–32B 量化；70B 需激进量化+慢 | 发烧友 |
| **CPU + 大内存** | 任何 GGUF，速度看核与带宽 | 能跑≠快 |
| **Apple 16–36GB 统一内存** | 8B～30B+ 视量化 | MLX/llama.cpp Metal |
| **手机 NPU/旗舰** | 1B–3B 实时；部分 7B 能跑偏慢 | 厂商端侧模型 |
| **核显/老卡** | 小模型或 CPU | 预期管理 |

## 6.3 显存不够时的手段

| 手段 | 简介 |
|------|------|
| 更多层 CPU 卸载 | `-ngl` 少挂几层到 GPU |
| 降上下文 `-c` | KV 变小 |
| 降量化档 | Q5→Q4→Q3 |
| 换更小/蒸馏模型 | 8B→3B |
| MoE + 专家策略 | 总参大激活小 |
| 云端兜底 | 难问题 API |

## 6.4 「能用」的主观标准

| 场景 | 可接受速度粗感 |
|------|----------------|
| 对话 | ≥10–15 tok/s 较顺 |
| 写长文 | 可更慢，有流式即可 |
| 代码补全 | 低延迟更重要 |
| 实时语音 Agent | TTS/ASR 链路 &lt;200ms 级体验 |

---

# 7. 软件生态：llama.cpp · Ollama · MLX · vLLM…

## 7.1 选型总表

| 工具 | 简介 | 详细说明 | 适合 |
|------|------|----------|------|
| **llama.cpp** | C/C++ 推理核心，GGUF | 跨 NVIDIA/AMD/Apple/CPU；可控性最强 | 极客、嵌入 |
| **Ollama** | 一键模型+API | 包一层易用；OpenAI 兼容本地口 | **大多数平民** |
| **LM Studio / Jan 等** | GUI | 点选下载聊天 | 非命令行用户 |
| **MLX** | Apple 官方向 ML 框架 | 统一内存吃香；吞吐常优 | Mac 用户 |
| **vLLM / SGLang** | 高吞吐服务 | 连续批处理；AWQ/FP8 等 | 小团队 GPU 服务器 |
| **TensorRT-LLM** | NVIDIA 极致优化 | 部署复杂 | 生产 NVIDIA |
| **bitnet.cpp** | 1.58-bit 专用 | CPU 上宣称高倍速与节能 | BitNet 模型 |

对比研究例（Apple Silicon）：https://arxiv.org/pdf/2511.05502  
本地指南例：https://www.sitepoint.com/definitive-guide-local-llms-2026-privacy-tools-hardware/  

## 7.2 典型平民路径

```
1. 安装 Ollama 或 LM Studio
2. 拉 7B–8B 的 Q4/Q5 指令模型
3. 本地聊天评测你的任务
4. 不够强 → 换 14B 或云 API 混合
5. 要隐私微调 → Unsloth/QLoRA + 再量化
```

## 7.3 图像/语音侧的「平民压缩」（补充）

| 模态 | 手段 |
|------|------|
| 图像 | SD/FLUX 蒸馏 turbo、少步采样、低分辨率、TensorRT/ONNX |
| 语音 | 小 TTS、量化 ONNX、端侧 NPU |
| 视频 | 仍重；平民多为云 API |

---

# 8. 科研前沿：1.58-bit · 端侧 · 边缘

## 8.1 BitNet / 1.58-bit LLM

| 点 | 说明 |
|----|------|
| **思想** | 权重三值 {-1,0,1}，约 1.58 bit；**原生训练** 而非事后暴力压到 1-bit |
| **宣称** | 同规模、同训练量下可比 FP16 困惑度/下游；延迟、内存、能耗大降 |
| **意义** | 为 **CPU/专用芯** 打开门；与「先 FP16 再 GPTQ」路线不同 |
| **推理** | microsoft/BitNet（bitnet.cpp）：CPU 加速与节能数字见项目说明 |
| **冷静** | 生态、工具链、通用任务全面性仍在追；「1-bit」营销名 vs 技术三值需分清 |

论文：  
- https://arxiv.org/abs/2402.17764 （b1.58）  
- JMLR BitNet：https://www.jmlr.org/papers/v26/24-2050.html  
- 推理框架：https://github.com/microsoft/BitNet  
- 2B 级开放权重相关：检索 `BitNet b1.58 2B4T` / https://arxiv.org/abs/2504.12285  

## 8.2 端侧 LLM 现状（2026 取向）

| 点 | 说明 |
|----|------|
| 手机 | 旗舰实时十亿级参数；厂商预装小模型 |
| 蒸馏推理 | R1 类轨迹蒸馏让小模型「会想一点」 |
| 挑战 | 电量、发热、NPU 算子不全、应用商店模型更新 |

综述页：https://v-chandra.github.io/on-device-llms/  

## 8.3 其他科研热点

| 方向 | 简介 |
|------|------|
| 极低 bit PTQ | 2-bit 可生成但质量难稳 |
| KV 极致压缩 | 3-bit 级 KV 与 FlashAttn 融合 |
| 结构化稀疏硬件 | 剪枝真正吃到加速 |
| 异构专家卸载 | 大 MoE 家用 |
| 质量可证压缩 | 压缩比-风险界限理论 |

---

# 9. 未来情景与时间线

| 时期 | 较可能 | 不确定 |
|------|--------|--------|
| **2026–27** | Q4 8B 笔记本默认；Ollama 级体验普及；企业「小本地+大云」 | 统一格式之争 |
| **2027–29** | NPU 成为 PC/手机标配推理；1.58-bit/专用核产品化尝试；70B 级家用更常见（统一内存/大显存降价） | 能耗法规 |
| **2030 前后** | 多数日常 AI **默认可离线**；云专攻超难推理与训练 | 是否人人本地 70B 级智能 |

## 质量会怎样

| 趋势 | 说明 |
|------|------|
| 同尺寸更强 | 数据与蒸馏进步 |
| 同质量更小 | 压缩与架构 |
| 差距结构 | 尖端闭源云仍可能领先 1–2 代「难任务」；日常任务本地足够 |

---

# 10. 实践指南：选型 · 工作流 · 质量门

## 10.1 按显存选起点

| 显存 | 建议起点 |
|------|----------|
| 6–8 GB | 3B–7B Q4；短上下文 |
| 12 GB | 8B–14B Q4/Q5 |
| 16 GB+ | 14B–32B；或 70B 激进量化试水 |
| 仅 CPU 32GB RAM | 7B–13B Q4，慢但能用 |

## 10.2 质量保障清单（压缩发布前）

| # | 检查 |
|---|------|
| 1 | 同提示对比 FP16/Q8 vs 目标量化 |
| 2 | 数学/代码/你的业务各 20 题 |
| 3 | 长文摘要与「大海捞针」若相关 |
| 4 | 安全拒答抽检 |
| 5 | 中文/多语言若需要 |
| 6 | 速度与显存峰值记录 |

## 10.3 推荐组合配方

| 场景 | 配方 |
|------|------|
| 家庭聊天 | Ollama + 8B Q5 |
| 隐私办公 | 本地 14B Q4 + 敏感不上传 |
| 个人微调 | QLoRA 7B/8B → 导出 GGUF |
| 小团队 API | 单卡 vLLM + AWQ 14B/32B |
| 极致边缘 | 1B–3B 蒸馏 + NPU / BitNet 类 |

## 10.4 常见坑

| 坑 | 说明 |
|----|------|
| 只看体积不看 KV | 长上下文照样爆显存 |
| Q2 强上 70B | 常不如 Q5 8B |
| 校准随便抓维基 | 领域任务掉点 |
| 忽视许可证 | 权重许可 ≠ 可商用 |
| 把 tok/s 当唯一指标 | 首字延迟、质量更重要 |

---

# 11. 规划与四轮迭代过程

## 11.1 总规划

| 阶段 | 目标 |
|------|------|
| 规划 | 质量/压缩/平民硬件/科研/未来五块 |
| 迭代 1 | 量化方法 GPTQ/AWQ/GGUF |
| 迭代 2 | 蒸馏 SLM、端侧 |
| 迭代 3 | 本地引擎与硬件现实 |
| 迭代 4 | BitNet、KV/投机解码、剪枝 MoE、未来 |
| 合成 | 本手册 |

## 11.2 四轮记录

### 迭代 1 — 量化

| 得 | GPTQ 层式压；AWQ 激活感知常更稳；GGUF 平民生态；INT4 大约对半显存、任务掉点常个位数百分点内（视模型） |
| 源 | 产业对比文、llama.cpp 讨论 |

### 迭代 2 — 蒸馏与 SLM

| 得 | 蒸馏是小模型主路径；推理轨迹蒸馏抬数学；端侧 1B–3B 实时 |
| 源 | on-device 综述、SLM 综述、DeepSeek-R1 蒸馏叙事 |

### 迭代 3 — 运行时与硬件

| 得 | llama.cpp/Ollama/MLX/vLLM 分工；8–12GB 可跑 7B–14B；MoE 技巧 |
| 源 | 本地 LLM 指南、运行时比较 arXiv |

### 迭代 4 — 前沿系统

| 得 | BitNet 原生三值；KV 量化与 QuantSpec；剪枝/专家剪枝；质量门实践 |
| 源 | arXiv 2402.17764、BitNet GitHub、Apple QuantSpec、MoE-Pruner |

## 11.3 续更（第 5 轮）

```
[ ] 新 GGUF 档位 / 引擎版本
[ ] 新端侧 SoC NPU 算子支持
[ ] BitNet 生态是否进 Ollama
[ ] 自家任务压缩回归测试
```

---

# 12. 学习路径

## 12.1 三天上手

| 天 | 动作 |
|----|------|
| 1 | 装 Ollama，跑 8B，体感速度 |
| 2 | 同模型 Q4 vs Q8 各测 10 题 |
| 3 | 读 §3–§4，记下自己的「可接受掉点」 |

## 12.2 进阶

| 主题 | 材料 |
|------|------|
| 量化原理 | 任意系统向 GPTQ/AWQ 长文 + 自测 |
| 引擎 | llama.cpp README；vLLM 文档 |
| 科研 | BitNet 论文 + on-device 综述 |
| 生产 | 建立 50 题私有回归集 |

---

# 13. 链接总库

## 13.1 量化与格式

| 资源 | URL |
|------|-----|
| 量化技术 2026 对比文 | https://sesamedisk.com/quantization-techniques-ai-inference-2026/ |
| AWQ 部署向导 | https://www.spheron.network/blog/awq-quantization-guide-llm-deployment/ |
| GGUF/GPTQ/AWQ 选型 | https://www.e2enetworks.com/blog/which-quantization-method-is-best-for-you-gguf-gptq-or-awq |
| llama.cpp 量化盲测讨论 | https://github.com/ggml-org/llama.cpp/discussions/5962 |
| vLLM KV 量化文档 | https://docs.vllm.ai/en/latest/features/quantization/quantized_kvcache/ |

## 13.2 蒸馏 · SLM · 端侧

| 资源 | URL |
|------|-----|
| On-Device LLMs 2026 | https://v-chandra.github.io/on-device-llms/ |
| SLM 综述 html | https://arxiv.org/html/2501.05465v2 |
| SLM 系统综述 | https://onlinelibrary.wiley.com/doi/full/10.1111/exsy.70331 |

## 13.3 运行时

| 资源 | URL |
|------|-----|
| Apple Silicon 运行时比较 PDF | https://arxiv.org/pdf/2511.05502 |
| 本地 LLM 2026 指南 | https://www.sitepoint.com/definitive-guide-local-llms-2026-privacy-tools-hardware/ |
| llama.cpp 组织 | https://github.com/ggml-org/llama.cpp |

## 13.4 BitNet / 低比特

| 资源 | URL |
|------|-----|
| BitNet b1.58 论文 | https://arxiv.org/abs/2402.17764 |
| BitNet JMLR | https://www.jmlr.org/papers/v26/24-2050.html |
| bitnet.cpp | https://github.com/microsoft/BitNet |
| 2B4T 相关 arXiv | https://arxiv.org/abs/2504.12285 |

## 13.5 KV / 投机 / 剪枝

| 资源 | URL |
|------|-----|
| QuantSpec (Apple) | https://machinelearning.apple.com/research/quantspec |
| QuantSpec arXiv | https://arxiv.org/abs/2502.10424 |
| MoE-Pruner | https://arxiv.org/abs/2410.12013 |
| EEP 专家剪枝 | https://arxiv.org/abs/2407.00945 |

---

# 14. 诚实边界

| 项目 | 说明 |
|------|------|
| tok/s、掉点% | 强依赖硬件/驱动/版本；文中为量级与产业叙述 |
| 「能跑」 | ≠ 生产 SLA |
| BitNet | 有前景，非已全面替代 Q4 Transformer 生态 |
| 未测图像全栈 | 图像压缩另有蒸馏/TensorRT，仅点到 |
| 非硬件购买建议 | 显卡行情变化快 |

---

# 附录：一页纸作弊条

```
保质量：任务评测门禁 + 校准数据 + 别过度量化 + 蒸馏对齐任务。
主压缩：INT4/Q4–Q5 量化（AWQ/GPTQ/GGUF）。
变聪明的小：蒸馏（尤其推理轨迹）> 硬剪到残废。
省算力结构：MoE 激活少；GQA；小模型。
系统加速：FlashAttn、KV 量化、投机解码、批处理。
平民路径：Ollama/LM Studio + 8B Q4/Q5 + 12GB 甜点。
8GB：7B Q4；不够就卸载/降上下文/上云混合。
科研尖刀：BitNet 1.58-bit 原生训练 + 端侧 NPU。
未来：离线默认 + 云攻坚难推理。
别做：Q2 强上当万能；忽视 KV；无评测发布。
```

---

**文档结束**

**路径**：`D:\AI\量子\AI模型压缩与平民化部署_认知手册.md`  

**建议读序**：§0 → §3 → §6–§7 → §4–§5 → §8–§10。
