🗜️

GGUF (模型格式)

GGUF Model Format
基础设施
推理优化部署格式

GGUF是llama.cpp项目定义的二进制模型文件格式,专门针对CPU推理优化。几乎所有的本地开源模型部署都使用GGUF。

量化级别:Q8_0(8bit,极高)、Q6_K(6bit,很高)、Q5_K_M(5bit,高)、Q4_K_M(4bit,最常用)、Q2_K(2bit,极限)。

为什么需要:原始模型文件体积巨大且不适合直接推理。GGUF将模型权重、tokenizer、元数据打包成单一文件,内置量化支持。

使用场景:Ollama自动下载和加载GGUF、llama.cpp直接推理、LM Studio桌面UI、树莓派等ARM设备推理。

GGUF和Ollama/llama.cpp共同构成了本地AI推理的安卓生态——开放、标准化、人人可用。

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。