📋 编辑总结
Ollama 是在本地运行大语言模型的开源工具,支持 macOS / Linux / Windows,一条命令拉取并运行 Llama、DeepSeek、Qwen、Gemma 等模型,内置 OpenAI 兼容本地 API(localhost:11434),并可选用 Ollama Cloud 运行更大模型。 定价:开源免费(本地);云端Pro $20/月。编辑评分:⭐4.7。

Ollama 是什么?

Ollama 是一个在本地跑大语言模型的开源工具,支持 macOS、Linux 和 Windows。它的设计哲学就一个字:简。你只需要在终端里敲一行 ollama run llama3,它就会自动拉取模型并启动一个对话——不用配环境、不用下权重、不用懂推理框架。

对开发者来说,Ollama 更大的价值是它内置了一个 OpenAI 兼容的本地 API(默认跑在 http://localhost:11434),你手头基于 OpenAI SDK 的代码,把地址指过来就能调本地模型,几乎零改动。这也是为什么它成了很多本地 AI 项目的事实标准基座。

核心功能

1. 一行命令跑模型

ollama run <模型名> 即可拉取并启动对话。模型库里直接能拿到 Llama 3.3、DeepSeek-R1、Qwen 3、Gemma 3、Phi 等主流开源模型,无需自己去 Hugging Face 找权重。

2. 本地 API 服务

Ollama 启动后自动在后台提供 API,格式兼容 OpenAI。开发者可以用现有的 SDK 直接调用本地模型做聊天、嵌入、补全,非常适合做隐私敏感或离线场景的原型。

3. 跨平台与 GPU 加速

支持 macOS、Linux、Windows,Windows 预览版已带内置 GPU 加速。模型库完整可用,含视觉模型,API 同样兼容 OpenAI。

4. 生态联动

Ollama 可以和 LM Studio、Open WebUI、Claude Code、OpenClaw 等大量工具联动,作为本地模型的供给方。很多「本地 AI 助手」类项目底层都是 Ollama 在跑模型。

值不值得用?

优点:

  • 上手极简,一条命令就能用
  • 本地 API 兼容 OpenAI,集成成本几乎为零
  • 跨平台、支持 GPU 加速
  • 模型库丰富,社区活跃
  • 开源免费,可商用

缺点:

  • 以命令行为主,纯新手需要学几个基础命令
  • 大模型对显存/内存要求高,机器弱会卡
  • 多 GPU、高并发等高级玩法需要一定经验

我的看法: 如果你是个开发者,想在自己机器上跑模型、接进自己的应用,Ollama 基本是首选。它和 LM Studio 是「黄金拼椅」——Ollama 管命令行和 API,LM Studio 管界面,按习惯选或一起用都行。

使用建议

  • 从 run 开始ollama run qwen3 这类命令先跑通,感受一下本地推理
  • 接 API 做开发:把 OpenAI SDK 的 base_url 指向 localhost:11434,立刻用上本地模型
  • 注意硬件:跑 7B 很轻松,13B+ 建议有独显或够大的内存
  • 搭配前端:想要图形界面可以装 Open WebUI,体验接近 ChatGPT

适合谁用?

推荐:

  • 开发者(本地模型供给 + OpenAI 兼容 API)
  • 想离线/隐私跑模型的研究者
  • 做本地 AI 原型的工程师

可考虑:

  • 愿意学一点命令行的进阶用户

不推荐:

  • 完全不想碰终端、又要跑大模型的纯新手(可先用 LM Studio 的图形界面)