LiteLLM 是一个统一调用 100+ 大语言模型的开源网关与 Python SDK,将 OpenAI、Anthropic、Azure、Bedrock、Gemini 等各家接口统一为 OpenAI 格式,提供重试/回退、负载均衡、消费追踪与预算控制,被 Netflix、Lemonade 等团队用于生产环境。 定价:开源免费(企业版付费)。编辑评分:⭐ 4.5。
LiteLLM 是什么?
LiteLLM 是一个开源的 LLM 网关与 Python SDK,解决的是一个很实际的问题:当你要用 OpenAI、Anthropic、Azure、Bedrock、Gemini 等多家模型时,每家接口格式、错误结构都不一样,接起来很头疼。LiteLLM 把所有这些都统一成 OpenAI 的格式——你用同一套 completion() 调用,只要改个 model 名字(比如 openai/gpt-5、anthropic/claude-sonnet-4-5、ollama/llama2),就能在 100+ 模型之间切换。
它被 Netflix、Lemonade 等团队的 GenAI 平台用来给开发者「Day 0」地提供模型访问能力,核心卖点是统一接口 + 稳定性(重试/回退)+ 成本可观测。
核心功能
1. 统一 OpenAI 格式调用 100+ 模型 无论是 OpenAI、Azure、Bedrock、Vertex、Anthropic、Ollama 还是 OpenRouter,都通过一致的函数签名调用,输出格式也统一,迁移 provider 几乎不用改业务代码。
2. LLM 网关(Proxy Server) 除了 Python SDK,LiteLLM 还提供中心化网关:带认证授权、虚拟密钥、多租户消费追踪、按 key/团队/组织计费,配合 Admin UI 做监控。适合「平台团队给很多开发者发模型权限」的场景。
3. 重试、回退与负载均衡 某个 provider 限流或宕机时,LiteLLM 能在多个部署/provider 之间自动回退(Failover),并对 RPM/TPM 做追踪与冷却重试,显著提升线上可用性。
4. 消费追踪与预算控制 可以按 key、user、team、org 精确归因花费,设置预算与速率限制,并把日志写到 S3/GCS 等对象存储,方便财务与治理。
5. Guardrails、日志与可观测性 集成 Langfuse、Arize Phoenix、Langsmith、OTEL 等观测工具,并提供 Prompt Management、Pass-Through Endpoints 等能力。
6. 支持本地模型
通过 ollama/llama2 这类前缏即可把本机 Ollama 模型接入统一接口,云端/本地模型在同一条调用链里混用。
值不值得用?
优点:
- 一套接口打天下,切换模型成本极低
- 重试/回退 + 负载均衡,生产可用性更好
- 消费追踪与预算控制开箱即用,适合多团队
- SDK 与网关两种形态,灵活
- 被多家大型团队验证过
缺点:
- 网关模式需要自己部署运绻
- 企业版 SSO、审计等高级能力要付费
- 各家模型行为差异仍在,不能假设完全等价
我的看法: 只要你的项目打算接两家以上模型,或者需要给团队统一发模型权限并管成本,LiteLLM 几乎是标配。它不替代某个具体模型,而是把「调模型」这件脏活标准化了。
使用建议
- 先从 SDK 试起:
uv add litellm后改 model 名就能切 provider,成本最低 - 生产用网关:多开发者/多模型时上 Proxy,配虚拟密钥与预算
- 配可观测:接 Langfuse 等,把每次调用成本与质量看清楚
- 善用回退:给关键链路配 provider 回退,避免单点限流
适合谁用?
推荐:
- 需要接多模型的平台/基础设施团队
- 做 AI 应用、想灵活换底层模型的开发者
- 需要统一配额与成本治理的团队
可考虑:
- 只用单一模型、且不在乎接口差异的小项目(直接调官方 SDK 更简单)
常见问题(FAQ)
LiteLLM 免费吗?
开源版 MIT 协议免费可自托管;企业版提供 SSO、审计日志、定制 SLA 等需付费。
LiteLLM 支持本地模型吗?
支持,通过 ollama/llama2 等 provider 前缀即可将本地模型接入统一接口。