📋 编辑总结
LiteLLM 是一个统一调用 100+ 大语言模型的开源网关与 Python SDK,将 OpenAI、Anthropic、Azure、Bedrock、Gemini 等各家接口统一为 OpenAI 格式,提供重试/回退、负载均衡、消费追踪与预算控制,被 Netflix、Lemonade 等团队用于生产环境。 定价:开源免费(企业版付费)。编辑评分:⭐ 4.5。

LiteLLM 是什么?

LiteLLM 是一个开源的 LLM 网关与 Python SDK,解决的是一个很实际的问题:当你要用 OpenAI、Anthropic、Azure、Bedrock、Gemini 等多家模型时,每家接口格式、错误结构都不一样,接起来很头疼。LiteLLM 把所有这些都统一成 OpenAI 的格式——你用同一套 completion() 调用,只要改个 model 名字(比如 openai/gpt-5anthropic/claude-sonnet-4-5ollama/llama2),就能在 100+ 模型之间切换。

它被 Netflix、Lemonade 等团队的 GenAI 平台用来给开发者「Day 0」地提供模型访问能力,核心卖点是统一接口 + 稳定性(重试/回退)+ 成本可观测。

核心功能

1. 统一 OpenAI 格式调用 100+ 模型 无论是 OpenAI、Azure、Bedrock、Vertex、Anthropic、Ollama 还是 OpenRouter,都通过一致的函数签名调用,输出格式也统一,迁移 provider 几乎不用改业务代码。

2. LLM 网关(Proxy Server) 除了 Python SDK,LiteLLM 还提供中心化网关:带认证授权、虚拟密钥、多租户消费追踪、按 key/团队/组织计费,配合 Admin UI 做监控。适合「平台团队给很多开发者发模型权限」的场景。

3. 重试、回退与负载均衡 某个 provider 限流或宕机时,LiteLLM 能在多个部署/provider 之间自动回退(Failover),并对 RPM/TPM 做追踪与冷却重试,显著提升线上可用性。

4. 消费追踪与预算控制 可以按 key、user、team、org 精确归因花费,设置预算与速率限制,并把日志写到 S3/GCS 等对象存储,方便财务与治理。

5. Guardrails、日志与可观测性 集成 Langfuse、Arize Phoenix、Langsmith、OTEL 等观测工具,并提供 Prompt Management、Pass-Through Endpoints 等能力。

6. 支持本地模型 通过 ollama/llama2 这类前缏即可把本机 Ollama 模型接入统一接口,云端/本地模型在同一条调用链里混用。

值不值得用?

优点:

  • 一套接口打天下,切换模型成本极低
  • 重试/回退 + 负载均衡,生产可用性更好
  • 消费追踪与预算控制开箱即用,适合多团队
  • SDK 与网关两种形态,灵活
  • 被多家大型团队验证过

缺点:

  • 网关模式需要自己部署运绻
  • 企业版 SSO、审计等高级能力要付费
  • 各家模型行为差异仍在,不能假设完全等价

我的看法: 只要你的项目打算接两家以上模型,或者需要给团队统一发模型权限并管成本,LiteLLM 几乎是标配。它不替代某个具体模型,而是把「调模型」这件脏活标准化了。

使用建议

  • 先从 SDK 试起uv add litellm 后改 model 名就能切 provider,成本最低
  • 生产用网关:多开发者/多模型时上 Proxy,配虚拟密钥与预算
  • 配可观测:接 Langfuse 等,把每次调用成本与质量看清楚
  • 善用回退:给关键链路配 provider 回退,避免单点限流

适合谁用?

推荐:

  • 需要接多模型的平台/基础设施团队
  • 做 AI 应用、想灵活换底层模型的开发者
  • 需要统一配额与成本治理的团队

可考虑:

  • 只用单一模型、且不在乎接口差异的小项目(直接调官方 SDK 更简单)

常见问题(FAQ)

LiteLLM 免费吗?

开源版 MIT 协议免费可自托管;企业版提供 SSO、审计日志、定制 SLA 等需付费。

LiteLLM 支持本地模型吗?

支持,通过 ollama/llama2 等 provider 前缀即可将本地模型接入统一接口。