AI 模型质量保障 · 压缩 · 低端显卡与平民化部署
全面认知手册(现状 · 科研 · 未来)
目标:弄清 AI 模型如何 保质量、压体积、跑在低端显卡/平民设备上——技术原理、工具生态、硬件门槛、科研前沿与未来。
方法:规划 → 4 轮迭代调研 → 双层文档(简介表 + 详细说明 + 链接)。
日期:2026-07-13
范围:以 LLM 推理压缩与本地部署 为主,兼及图像/语音侧共性思路。
姊妹文档
纯AI领域全面认知手册.md
AI生成式媒体_图像视频音频_认知手册.md
阅读导航
| 时间 |
读什么 |
| 5 分钟 |
§0 总览 + 附录作弊条 |
| 30 分钟 |
§0–§3 + §6 硬件 + §7 工具 |
| 深挖技术 |
§4 压缩全家桶 · §5 质量保障 |
| 科研与未来 |
§8–§9 |
| 方法 |
§11 四轮迭代 |
目录
- 五分钟总览
- 问题本质:质量 · 体积 · 速度 · 显存
- 技术地图:怎么「变小」还能「好用」
- 量化深度:INT8/INT4 · GPTQ · AWQ · GGUF
- 蒸馏 · 剪枝 · 小模型 · MoE
- 推理系统优化:注意力 · KV · 投机解码
- 平民硬件现实:能跑多大
- 软件生态:llama.cpp · Ollama · MLX · vLLM…
- 科研前沿:1.58-bit · 端侧 · 边缘
- 未来情景与时间线
- 实践指南:选型 · 工作流 · 质量门
- 规划与四轮迭代过程
- 学习路径
- 链接总库
- 诚实边界
附录:一页纸作弊条
0. 五分钟总览
0.1 简介
「大模型只有数据中心能跑」已经过时。通过 量化 + 蒸馏小模型 + 高效推理引擎 + 可选 MoE,8–12GB 消费级显卡 可流畅跑 7B–14B 级对话模型;旗舰手机可跑 1B–3B 级;更大模型靠「显存不够时 CPU/RAM 分担」或「只激活部分专家」。
0.2 一句话地图
| 问题 |
答案 |
| 怎么保证质量? |
评测矩阵 + 校准数据 + 别压过狠;任务对齐(蒸馏/微调)比盲目缩小更有效 |
| 怎么压缩? |
权重量化(主)· 蒸馏变小 · 剪枝 · 架构(MoE/高效注意力)· 系统层(KV 量化、批处理) |
| 低端显卡怎么跑? |
GGUF/llama.cpp 或 AWQ+vLLM;层卸载;降上下文;用 3B–8B 或 MoE「总参大、激活小」 |
| 平民现状 |
Ollama/LM Studio 一键;开源权重多;质量与云顶尖仍有差距 |
| 科研方向 |
原生低比特训练(BitNet)、更好 PTQ、KV 极致压缩、NPU 专用核 |
| 未来 |
端侧默认离线助手;专用低比特芯片;云边协同 |
0.3 压缩手段「谁主谁辅」
训练期:小模型设计 · 蒸馏 · 原生低比特(BitNet) · 剪枝感知训练
↓
导出期:GPTQ / AWQ / GGUF 等后训练量化
↓
推理期:FlashAttention · KV 量化 · 投机解码 · 连续批处理 · 层卸载
↓
产品期:LoRA 热插拔 · 路由到云大模型(难任务)
0.4 内存直觉(粗算)
| 精度 |
每参数约 |
7B 权重约 |
70B 权重约 |
| FP16/BF16 |
2 字节 |
~14 GB |
~140 GB |
| INT8 |
1 字节 |
~7 GB |
~70 GB |
| INT4 |
0.5 字节 |
~3.5–4.5 GB* |
~35–40 GB* |
| ~1.58-bit 原生 |
~0.2 字节量级 |
显著更小 |
研究/早期产品 |
*另加 KV Cache(随上下文长度暴涨)、激活、框架开销——所以「模型 4GB」≠「4GB 显卡一定够」。
1. 问题本质:质量 · 体积 · 速度 · 显存
1.1 四目标冲突
| 目标 |
简介 |
往往牺牲 |
| 质量 |
准确、推理、拒答、安全 |
压缩过狠时 |
| 体积 |
磁盘/下载/存储 |
— |
| 显存/内存 |
能否装进卡 |
速度或上下文 |
| 速度 |
tokens/s、首字延迟 |
质量或成本 |
1.2 瓶颈在哪(为何量化有效)
| 阶段 |
瓶颈 |
说明 |
| 预填充 prefill |
算力 |
处理整段提示 |
| 解码 decode |
显存带宽 常为主 |
反复读权重与 KV |
| 结论 |
降位宽 → 同带宽搬更多参数 → 常加速 |
推理多是 memory-bound |
1.3 「质量」测什么
| 维度 |
简介 |
压缩时谁先崩 |
| 困惑度 / 基准分 |
MMLU、代码、数学 |
低 bit 时数学/多步更敏感 |
| 主观生成 |
连贯、幻觉 |
过度 Q2/Q3 明显变傻 |
| 长上下文 |
找针、摘要 |
KV 压缩/量化影响大 |
| 安全对齐 |
拒答、偏见 |
量化偶发「对齐漂移」 |
| 任务专项 |
领域准确率 |
应用最相关 |
原则:用 你的任务集 对比 FP16 vs Q4/Q5,而不是只看博主 demo。
2. 技术地图:怎么「变小」还能「好用」
2.1 全家桶总表
| 技术 |
作用对象 |
简介 |
质量影响(典型) |
平民相关 |
| 后训练量化 PTQ |
已有权重大模型 |
不重训,压到 8/4 bit |
Q4 常 -1%~-3% 量级任务分* |
★★★★★ |
| 量化感知训练 QAT |
训练过程 |
训练时模拟低比特 |
极低 bit 更好 |
★★ 成本高 |
| 知识蒸馏 |
小模型 |
大模型教小模型 |
专长任务可逼近大模型 |
★★★★ |
| 剪枝 |
权重/专家 |
删不重要连接 |
结构剪枝更易加速 |
★★★ |
| 高效架构 |
设计时 |
GQA、MLA、SSM、MoE |
从根上省 |
★★★★ |
| PEFT/LoRA |
适配 |
不存多份全量模型 |
定制几乎不损 |
★★★★★ |
| 系统优化 |
引擎 |
FlashAttn、KV 量化、投机解码 |
不改权重大多无损/微损 |
★★★★★ |
| 原生 1.58-bit |
从零训练 |
BitNet 类 |
论文称可比同规模 FP |
★★ 生态成长中 |
*具体数字因模型与校准而异,见 §3 产业对比叙述。
2.2 保证质量的「方法论」
| 方法 |
简介 |
详细说明 |
| 足够大的「有效容量」 |
别把 70B 硬压到能塞进 4GB 还要求 GPT-4 |
选对尺寸阶梯 |
| 校准数据 |
PTQ 用代表性样本 |
校准偏→AWQ/GPTQ 变脆 |
| 混合精度 |
敏感层更高 bit |
常见工程 trick |
| 蒸馏对齐任务 |
小模型专精 |
聊天小模型 + 云端推理大模型 |
| 评测门禁 |
压缩前后同卷考试 |
发布前必跑 |
| 人审抽检 |
主观质量 |
开放生成任务 |
3. 量化深度:INT8/INT4 · GPTQ · AWQ · GGUF
3.1 精度阶梯
| 格式 |
简介 |
典型用途 |
| FP32 |
全精度 |
研究少用 |
| FP16/BF16 |
训练/高端推理基线 |
数据中心 |
| FP8 |
新卡友好 |
服务端吞吐 |
| INT8 |
接近无损压缩 |
边缘/服务 |
| INT4 / NF4 |
平民主力 |
消费卡本地 |
| 2–3 bit |
极限体积 |
质量掉速明显,慎用 |
| 三值 ~1.58 bit |
原生训练路线 |
BitNet 科研/早期产品 |
3.2 主流后训练量化方法
| 方法 |
简介 |
详细说明 |
适合 |
| GPTQ |
逐层二阶近似压权重 |
GPU 向;INT4 经典;部分基准上略逊 AWQ |
服务端、兼容栈 |
| AWQ |
激活感知,保护重要通道 |
常报 4-bit 下质量/推理更稳;校准数据要选好 |
生产 INT4 常见优选 |
| GGUF + llama.cpp 体系 |
文件格式 + 多后端运行时 |
Q2_K~Q8_0 等多档;CPU/GPU/Apple 通吃;本地生态事实标准 |
平民首选 |
| EXL2 等 |
可变 bit 等 |
部分社区追速度 |
特定引擎 |
| SmoothQuant 等 |
平滑激活利量化 |
与 W8A8 等组合 |
服务端 |
| QLoRA |
4-bit 基座上 LoRA 微调 |
训练省显存,不是纯推理格式 |
个人微调 |
产业对比叙述例(8B/70B 量级、质量掉点供参考,非普适真理):
https://sesamedisk.com/quantization-techniques-ai-inference-2026/
解读:
https://www.spheron.network/blog/awq-quantization-guide-llm-deployment/
https://www.e2enetworks.com/blog/which-quantization-method-is-best-for-you-gguf-gptq-or-awq
3.3 GGUF 档位怎么选(经验表)
| 档位取向 |
简介 |
质量 |
体积/速度 |
| Q8_0 / Q6_K |
接近原版 |
高 |
较大 |
| Q5_K_M / Q4_K_M |
平民甜点 |
多数任务可接受 |
推荐起点 |
| Q3_K / IQ3 |
更挤 |
推理/代码更易掉 |
低显存 |
| Q2 |
极限 |
常明显变差 |
仅试用 |
社区盲测讨论(主观):https://github.com/ggml-org/llama.cpp/discussions/5962
3.4 量化会伤哪里更多
| 更稳 |
更脆 |
| 闲聊、摘要、简单指令 |
竞赛数学、多步代码、严谨逻辑 |
| 大模型的 Q4 |
同档位小模型 Q3 |
| 校准匹配领域 |
校准数据「窄」的 AWQ |
4. 蒸馏 · 剪枝 · 小模型 · MoE
4.1 知识蒸馏(KD)
简介
大老师 → 小学生:学生学老师的输出分布/推理轨迹,而不是只学原始语料。
表
| 类型 |
简介 |
例子取向 |
| Logits 蒸馏 |
学软标签概率 |
Llama 3.2 1B/3B 等边缘模型叙事 |
| 特征/中间层 |
对齐表示 |
研究常用 |
| 推理轨迹蒸馏 |
学长 CoT |
DeepSeek-R1 蒸馏 1.5B–70B 等,小模型数学可超更大基座 |
| 多步蒸馏 |
逐级缩小能力鸿沟 |
容量差过大时一跳蒸馏易崩 |
端侧综述取向:https://v-chandra.github.io/on-device-llms/
SLM 综述 arXiv 例:https://arxiv.org/html/2501.05465v2
质量含义
| 点 |
说明 |
| 专精可极强 |
领域小模型 + 好数据 > 通用半吊子大模型 |
| 不能魔法 |
参数过少装不下全部能力 |
| 与量化叠加 |
先蒸馏再 Q4 是平民标配配方 |
4.2 剪枝(Pruning)
| 类型 |
简介 |
详细说明 |
| 非结构 |
删单个权重 |
稀疏度高,需稀疏算子才真加速 |
| 结构 |
删头/通道/层 |
通用硬件更好加速 |
| LLM-Pruner 等 |
分组重要性 |
实用工具方向 |
| MoE 专家剪枝 |
删/合并专家 |
减总参数与内存;路由提示哪些专家冗余 |
MoE 剪枝论文例:
https://arxiv.org/abs/2410.12013 (MoE-Pruner)
https://arxiv.org/abs/2407.00945 (EEP)
4.3 小语言模型 SLM(1B–9B)
| 点 |
说明 |
| 定义取向 |
约 1–9B 参数族,可边缘部署 |
| 为何够用 |
多数办公/客服/分类不需要 70B |
| 隐私 |
数据不出设备 |
| 代价 |
复杂推理、知识广度弱 → 路由到云 |
系统综述(部署/隐私/量化组合):
https://onlinelibrary.wiley.com/doi/full/10.1111/exsy.70331
4.4 MoE:总参数大,每次只算一部分
| 点 |
简介 |
| 思想 |
很多「专家」FFN,路由只激活少数 |
| 好处 |
同算力下更大知识库;消费卡可跑「总参 30B+、激活数 B 级」类模型(视实现) |
| 内存 |
专家权重仍常要装下或卸载;有专家固定进显存等技巧(llama.cpp -ncmoe 等社区实践) |
| 质量 |
好路由 ≈ 大模型;差路由浪费 |
社区硬件实践叙述例:12GB 卡跑大 MoE 量化的经验帖(作启发非保证)——检索 Qwen MoE llama.cpp 4070。
5. 推理系统优化:注意力 · KV · 投机解码
5.1 简介
不改模型权重 也能大幅加速、省显存——平民与机房都用。
5.2 FlashAttention 与高效注意力
| 技术 |
简介 |
作用 |
| FlashAttention 系 |
分块算注意力,少写 HBM |
省显存、加速,长上下文关键 |
| GQA / MQA |
组查询/多查询注意力 |
减 KV 体积 |
| MLA 等 |
更激进的注意力压缩 |
深长上下文服务 |
5.3 KV Cache 优化
| 问题 |
说明 |
| 现象 |
生成越长,KV 越大,显存爆 |
| 手段 |
FP8/INT4/更低 bit 量化 KV;驱逐不重要 token;分层量化 |
| 研究 |
层次量化 KV + 自投机解码等(如 Apple QuantSpec 取向:高接受率、端到端加速) |
5.4 投机解码(Speculative Decoding)
| 点 |
说明 |
| 思想 |
小草稿模型猜多词,大模型一次验证 |
| 效果 |
接受率高时显著加速解码 |
| 与量化 |
草稿可用更低 bit;自投机共享权重 |
5.5 服务端叠加(对照平民)
| 技术 |
机房 |
家用 |
| 连续批处理 |
vLLM 核心 |
单用户不重要 |
| TensorRT-LLM / 专用核 |
极致吞吐 |
可选 |
| PagedAttention |
显存碎片 |
框架内置 |
6. 平民硬件现实:能跑多大
6.1 简介
经验规则(Q4–Q5、中等上下文、聊天向)——实测为准。
6.2 显存/内存粗对照
| 硬件 |
粗可用模型取向 |
说明 |
| 8GB 显存 |
7B Q4~Q5;部分 13B 极限/卸载 |
上下文别开太大 |
| 12GB |
7B–14B 舒适;MoE 总参更大可试 |
甜点卡常见 |
| 16–24GB |
14B–32B 量化;70B 需激进量化+慢 |
发烧友 |
| CPU + 大内存 |
任何 GGUF,速度看核与带宽 |
能跑≠快 |
| Apple 16–36GB 统一内存 |
8B~30B+ 视量化 |
MLX/llama.cpp Metal |
| 手机 NPU/旗舰 |
1B–3B 实时;部分 7B 能跑偏慢 |
厂商端侧模型 |
| 核显/老卡 |
小模型或 CPU |
预期管理 |
6.3 显存不够时的手段
| 手段 |
简介 |
| 更多层 CPU 卸载 |
-ngl 少挂几层到 GPU |
降上下文 -c |
KV 变小 |
| 降量化档 |
Q5→Q4→Q3 |
| 换更小/蒸馏模型 |
8B→3B |
| MoE + 专家策略 |
总参大激活小 |
| 云端兜底 |
难问题 API |
6.4 「能用」的主观标准
| 场景 |
可接受速度粗感 |
| 对话 |
≥10–15 tok/s 较顺 |
| 写长文 |
可更慢,有流式即可 |
| 代码补全 |
低延迟更重要 |
| 实时语音 Agent |
TTS/ASR 链路 <200ms 级体验 |
7. 软件生态:llama.cpp · Ollama · MLX · vLLM…
7.1 选型总表
| 工具 |
简介 |
详细说明 |
适合 |
| llama.cpp |
C/C++ 推理核心,GGUF |
跨 NVIDIA/AMD/Apple/CPU;可控性最强 |
极客、嵌入 |
| Ollama |
一键模型+API |
包一层易用;OpenAI 兼容本地口 |
大多数平民 |
| LM Studio / Jan 等 |
GUI |
点选下载聊天 |
非命令行用户 |
| MLX |
Apple 官方向 ML 框架 |
统一内存吃香;吞吐常优 |
Mac 用户 |
| vLLM / SGLang |
高吞吐服务 |
连续批处理;AWQ/FP8 等 |
小团队 GPU 服务器 |
| TensorRT-LLM |
NVIDIA 极致优化 |
部署复杂 |
生产 NVIDIA |
| bitnet.cpp |
1.58-bit 专用 |
CPU 上宣称高倍速与节能 |
BitNet 模型 |
对比研究例(Apple Silicon):https://arxiv.org/pdf/2511.05502
本地指南例:https://www.sitepoint.com/definitive-guide-local-llms-2026-privacy-tools-hardware/
7.2 典型平民路径
1. 安装 Ollama 或 LM Studio
2. 拉 7B–8B 的 Q4/Q5 指令模型
3. 本地聊天评测你的任务
4. 不够强 → 换 14B 或云 API 混合
5. 要隐私微调 → Unsloth/QLoRA + 再量化
7.3 图像/语音侧的「平民压缩」(补充)
| 模态 |
手段 |
| 图像 |
SD/FLUX 蒸馏 turbo、少步采样、低分辨率、TensorRT/ONNX |
| 语音 |
小 TTS、量化 ONNX、端侧 NPU |
| 视频 |
仍重;平民多为云 API |
8. 科研前沿:1.58-bit · 端侧 · 边缘
8.1 BitNet / 1.58-bit LLM
| 点 |
说明 |
| 思想 |
权重三值 {-1,0,1},约 1.58 bit;原生训练 而非事后暴力压到 1-bit |
| 宣称 |
同规模、同训练量下可比 FP16 困惑度/下游;延迟、内存、能耗大降 |
| 意义 |
为 CPU/专用芯 打开门;与「先 FP16 再 GPTQ」路线不同 |
| 推理 |
microsoft/BitNet(bitnet.cpp):CPU 加速与节能数字见项目说明 |
| 冷静 |
生态、工具链、通用任务全面性仍在追;「1-bit」营销名 vs 技术三值需分清 |
论文:
8.2 端侧 LLM 现状(2026 取向)
| 点 |
说明 |
| 手机 |
旗舰实时十亿级参数;厂商预装小模型 |
| 蒸馏推理 |
R1 类轨迹蒸馏让小模型「会想一点」 |
| 挑战 |
电量、发热、NPU 算子不全、应用商店模型更新 |
综述页:https://v-chandra.github.io/on-device-llms/
8.3 其他科研热点
| 方向 |
简介 |
| 极低 bit PTQ |
2-bit 可生成但质量难稳 |
| KV 极致压缩 |
3-bit 级 KV 与 FlashAttn 融合 |
| 结构化稀疏硬件 |
剪枝真正吃到加速 |
| 异构专家卸载 |
大 MoE 家用 |
| 质量可证压缩 |
压缩比-风险界限理论 |
9. 未来情景与时间线
| 时期 |
较可能 |
不确定 |
| 2026–27 |
Q4 8B 笔记本默认;Ollama 级体验普及;企业「小本地+大云」 |
统一格式之争 |
| 2027–29 |
NPU 成为 PC/手机标配推理;1.58-bit/专用核产品化尝试;70B 级家用更常见(统一内存/大显存降价) |
能耗法规 |
| 2030 前后 |
多数日常 AI 默认可离线;云专攻超难推理与训练 |
是否人人本地 70B 级智能 |
质量会怎样
| 趋势 |
说明 |
| 同尺寸更强 |
数据与蒸馏进步 |
| 同质量更小 |
压缩与架构 |
| 差距结构 |
尖端闭源云仍可能领先 1–2 代「难任务」;日常任务本地足够 |
10. 实践指南:选型 · 工作流 · 质量门
10.1 按显存选起点
| 显存 |
建议起点 |
| 6–8 GB |
3B–7B Q4;短上下文 |
| 12 GB |
8B–14B Q4/Q5 |
| 16 GB+ |
14B–32B;或 70B 激进量化试水 |
| 仅 CPU 32GB RAM |
7B–13B Q4,慢但能用 |
10.2 质量保障清单(压缩发布前)
| # |
检查 |
| 1 |
同提示对比 FP16/Q8 vs 目标量化 |
| 2 |
数学/代码/你的业务各 20 题 |
| 3 |
长文摘要与「大海捞针」若相关 |
| 4 |
安全拒答抽检 |
| 5 |
中文/多语言若需要 |
| 6 |
速度与显存峰值记录 |
10.3 推荐组合配方
| 场景 |
配方 |
| 家庭聊天 |
Ollama + 8B Q5 |
| 隐私办公 |
本地 14B Q4 + 敏感不上传 |
| 个人微调 |
QLoRA 7B/8B → 导出 GGUF |
| 小团队 API |
单卡 vLLM + AWQ 14B/32B |
| 极致边缘 |
1B–3B 蒸馏 + NPU / BitNet 类 |
10.4 常见坑
| 坑 |
说明 |
| 只看体积不看 KV |
长上下文照样爆显存 |
| Q2 强上 70B |
常不如 Q5 8B |
| 校准随便抓维基 |
领域任务掉点 |
| 忽视许可证 |
权重许可 ≠ 可商用 |
| 把 tok/s 当唯一指标 |
首字延迟、质量更重要 |
11. 规划与四轮迭代过程
11.1 总规划
| 阶段 |
目标 |
| 规划 |
质量/压缩/平民硬件/科研/未来五块 |
| 迭代 1 |
量化方法 GPTQ/AWQ/GGUF |
| 迭代 2 |
蒸馏 SLM、端侧 |
| 迭代 3 |
本地引擎与硬件现实 |
| 迭代 4 |
BitNet、KV/投机解码、剪枝 MoE、未来 |
| 合成 |
本手册 |
11.2 四轮记录
迭代 1 — 量化
| 得 | GPTQ 层式压;AWQ 激活感知常更稳;GGUF 平民生态;INT4 大约对半显存、任务掉点常个位数百分点内(视模型) |
| 源 | 产业对比文、llama.cpp 讨论 |
迭代 2 — 蒸馏与 SLM
| 得 | 蒸馏是小模型主路径;推理轨迹蒸馏抬数学;端侧 1B–3B 实时 |
| 源 | on-device 综述、SLM 综述、DeepSeek-R1 蒸馏叙事 |
迭代 3 — 运行时与硬件
| 得 | llama.cpp/Ollama/MLX/vLLM 分工;8–12GB 可跑 7B–14B;MoE 技巧 |
| 源 | 本地 LLM 指南、运行时比较 arXiv |
迭代 4 — 前沿系统
| 得 | BitNet 原生三值;KV 量化与 QuantSpec;剪枝/专家剪枝;质量门实践 |
| 源 | arXiv 2402.17764、BitNet GitHub、Apple QuantSpec、MoE-Pruner |
11.3 续更(第 5 轮)
[ ] 新 GGUF 档位 / 引擎版本
[ ] 新端侧 SoC NPU 算子支持
[ ] BitNet 生态是否进 Ollama
[ ] 自家任务压缩回归测试
12. 学习路径
12.1 三天上手
| 天 |
动作 |
| 1 |
装 Ollama,跑 8B,体感速度 |
| 2 |
同模型 Q4 vs Q8 各测 10 题 |
| 3 |
读 §3–§4,记下自己的「可接受掉点」 |
12.2 进阶
| 主题 |
材料 |
| 量化原理 |
任意系统向 GPTQ/AWQ 长文 + 自测 |
| 引擎 |
llama.cpp README;vLLM 文档 |
| 科研 |
BitNet 论文 + on-device 综述 |
| 生产 |
建立 50 题私有回归集 |
13. 链接总库
13.1 量化与格式
13.2 蒸馏 · SLM · 端侧
13.3 运行时
13.4 BitNet / 低比特
13.5 KV / 投机 / 剪枝
14. 诚实边界
| 项目 |
说明 |
| tok/s、掉点% |
强依赖硬件/驱动/版本;文中为量级与产业叙述 |
| 「能跑」 |
≠ 生产 SLA |
| BitNet |
有前景,非已全面替代 Q4 Transformer 生态 |
| 未测图像全栈 |
图像压缩另有蒸馏/TensorRT,仅点到 |
| 非硬件购买建议 |
显卡行情变化快 |
附录:一页纸作弊条
保质量:任务评测门禁 + 校准数据 + 别过度量化 + 蒸馏对齐任务。
主压缩:INT4/Q4–Q5 量化(AWQ/GPTQ/GGUF)。
变聪明的小:蒸馏(尤其推理轨迹)> 硬剪到残废。
省算力结构:MoE 激活少;GQA;小模型。
系统加速:FlashAttn、KV 量化、投机解码、批处理。
平民路径:Ollama/LM Studio + 8B Q4/Q5 + 12GB 甜点。
8GB:7B Q4;不够就卸载/降上下文/上云混合。
科研尖刀:BitNet 1.58-bit 原生训练 + 端侧 NPU。
未来:离线默认 + 云攻坚难推理。
别做:Q2 强上当万能;忽视 KV;无评测发布。
文档结束
路径:D:\AI\量子\AI模型压缩与平民化部署_认知手册.md
建议读序:§0 → §3 → §6–§7 → §4–§5 → §8–§10。