GGUF是llama.cpp项目定义的二进制模型文件格式,专门针对CPU推理优化。几乎所有的本地开源模型部署都使用GGUF。
量化级别:Q8_0(8bit,极高)、Q6_K(6bit,很高)、Q5_K_M(5bit,高)、Q4_K_M(4bit,最常用)、Q2_K(2bit,极限)。
为什么需要:原始模型文件体积巨大且不适合直接推理。GGUF将模型权重、tokenizer、元数据打包成单一文件,内置量化支持。
使用场景:Ollama自动下载和加载GGUF、llama.cpp直接推理、LM Studio桌面UI、树莓派等ARM设备推理。
GGUF和Ollama/llama.cpp共同构成了本地AI推理的安卓生态——开放、标准化、人人可用。