小语言模型(Small Language Model,SLM)是指参数规模较小(通常 1B-14B)但通过高质量数据和精心训练达到接近大模型性能的语言模型。在 2025-2026 年,SLM 因端侧AI、成本控制和数据隐私需求而迅速崛起。
SLM vs LLM 对比
| 维度 | SLM | LLM | |------|-----|-----| | 参数量 | 1B-14B | 70B-1000B+ | | 显存需求 | 2-8 GB | 40-200+ GB | | 推理速度 | 快(可在手机运行) | 慢(需GPU集群) | | 精度(复杂任务) | 接近但略低 | 最高 | | 部署成本 | 低 | 高 |
代表模型
- Microsoft Phi-4(14B):用「教科书级」数据训练,在数学和编程基准上追平或超越 Llama-3-70B
- Google Gemma 3(1B-12B):开源,支持 128K 上下文,面向开发者
- Apple 端侧模型(3B):集成在 iOS/macOS 中,驱动 Apple Intelligence
- DeepSeek-V3-Lite、Qwen2.5-7B 等国内方案
为什么 SLM 重要
- 成本:端侧运行几乎零边际成本,适合大规模部署
- 隐私:数据不离开设备,满足 GDPR/HIPAA 等合规要求
- 可定制:体量小,微调成本低,适合企业私有化部署
- 延迟:本地推理毫秒级响应,远优于云端 API