Modal 是一个 Python 原生的 Serverless 云平台,专门面向 AI 与计算密集型工作负载。开发者用 Python 装饰器直接在代码里声明容器镜像和硬件规格(CPU/GPU),无需写 Dockerfile、YAML 或碰 Kubernetes,部署后按秒计费、闲置不收费、支持从零瞬时扩容。常见用途包括模型推理、微调训练、批量任务、定时任务,以及在沙箱里安全运行 AI 生成的代码。 定价:Starter 计划 $0/月 + 用量,含每月 $30 免费算力额度、3 个席位、100 容器与 10 GPU 并发;Team 计划 $250/月 + 用量,含每月 $100 额度、不限席位、1000 容器与 50 GPU 并发;Enterprise 定制。算力按秒计费,官方公布如 H100 $0.001097/秒、A100 80GB $0.000694/秒、T4 $0.000164/秒,存储卷 $0.09/GiB/月(含每月 1TiB 免费)。指定区域约 1.5–1.75 倍、非抢占式执行约 3 倍基准价。详见 https://modal.com/pricing。编辑评分:⭐ 4.7。
Modal 是什么?
做 AI 应用的人多半都有过这种经历:模型代码两小时写完,部署上线折腾了三天。Dockerfile 要调,CUDA 版本要对齐,Kubernetes 的 YAML 要写一堆,GPU 资源要提前申请还不能闲着浪费钱。真正花时间的从来不是算法,是这些「把它跑到线上」的琐事。
Modal 想干掉的就是这一整套麻烦。它是一个 Python 原生的 Serverless 云平台,做法很直接:你在 Python 文件里加几个装饰器,说清楚这个函数需要什么镜像、要几核 CPU、要不要 GPU 要哪块 GPU,然后一条命令部署。没有 Dockerfile,没有 YAML,不需要 DevOps 知识。基础设施变成了代码里的参数。
公司是 Modal Labs,2021 年成立,总部在纽约。产品定位是「面向 AI 的生产级云」,典型用法包括模型推理服务、微调训练、批量处理、Embedding 生成、定时任务,以及一个很有意思的场景——在隔离沙箱里安全运行 AI 生成的代码(这在 Agent 类产品里越来越常见)。
计费方式是按秒算,闲置不收费,请求来了瞬时扩容,没请求就缩回零。对流量忽高忽低的 AI 业务来说,这个模型比包月租一台 GPU 实例更贴合实际。
核心功能
1. Python 原生的基础设施定义
这是 Modal 最有辨识度的地方。容器镜像、依赖安装、硬件规格全部写在 Python 里,和业务代码放在同一个文件。改配置就是改代码,版本管理天然跟着 Git 走。实际使用中最舒服的一点是——你不需要在 Python 和 YAML 两套心智模型之间来回切换,很多用户反馈这一点大幅降低了心理负担。
2. Serverless GPU 与瞬时扩缩容
请求进来自动起容器,请求多了自动加,请求没了自动缩到零。你不需要预估容量、不需要预留实例。官方给的对比很直观:传统云上按 75 张 GPU 跑满一天算钱,Serverless 模式下只按实际平均用量(比如 50 张)计费,即便单价略高,总账单反而更低。这个逻辑对突发型负载成立,对 7×24 满载的业务则不一定。
3. 秒级冷启动
Serverless GPU 最怕的就是冷启动——模型几十个 G,加载一次要几分钟,那用户体验就没了。Modal 用轻量虚拟机加基于 FUSE 的懒加载文件系统来解决这件事,GPU 容器通常几秒内就能起来。这个数字在同类产品里属于领先水平,也是它敢主打「serverless 也能跑生产推理」的底气。
4. 多形态工作负载
除了常规的函数调用,还有 Web 端点(直接暴露 HTTPS 接口)、定时任务(cron)、批量任务、分布式队列和分布式字典。也就是说,一个 AI 应用需要的异步、调度、状态共享能力,平台层面都给了,不用再额外搭一套 Celery + Redis。
5. Sandbox 与 Notebook
这块是近年新增且很实用的能力。AI 生成的代码敢不敢直接跑?在 Modal 的 Sandbox 里跑就相对安全,天然隔离。做 Code Interpreter、Agent 执行环境的团队会很吃这个。另外还有云端 Notebook,适合交互式探索。
6. 存储与数据原语
持久化 Volume 按 $0.09/GiB/月计费,每月自带 1TiB 免费额度,用来存模型权重和数据集基本够。Secret 管理、自定义镜像、即时部署都是不限量的。
版本/套餐对比
| 计划 | 价格 | 免费算力额度 | 席位 | 容器 / GPU 并发 | 主要差异 |
|---|---|---|---|---|---|
| Starter | $0/月 + 用量 | $30/月 | 最多 3 个 | 100 / 10 | 日志保留 1 天,5 个定时任务,8 个 Web 端点,200 个已部署应用 |
| Team | $250/月 + 用量 | $100/月 | 不限 | 1000 / 50 | 日志保留 30 天,定时任务与端点不限量,自定义域名、静态 IP、部署回滚 |
| Enterprise | 定制 | 定制 | 不限 | 更高 | 用量折扣、HIPAA、Okta SSO、审计日志、私有 Slack 支持、嵌入式 ML 工程服务 |
算力单价(官方公布,按秒计费):H100 $0.001097/秒、H200 $0.001261/秒、B200 $0.001736/秒、A100 80GB $0.000694/秒、A100 40GB $0.000583/秒、L40S $0.000542/秒、A10 $0.000306/秒、L4 $0.000222/秒、T4 $0.000164/秒。CPU 按物理核每秒计费,内存按 GiB 每秒计费。
需要留意两个加价项:指定区域约为基准价的 1.5–1.75 倍,非抢占式执行约为 3 倍。另外初创企业和学术研究者可以申请额外算力赠款,学术方向官方标注最高可达 $10k。
值不值得用?
优点很硬。 开发体验在同类产品里属于第一梯队,「用 Python 写基础设施」这个思路一旦用顺了很难回头。冷启动快、真正 scale-to-zero、按秒计费这三点组合起来,让 Serverless GPU 从一个概念变成了真能跑生产的东西。覆盖场景也够广,推理、训练、批处理、沙箱一套搞定,不用拼三四个平台。免费额度是每月发放而不是一次性的,试用和小项目长期挂着基本零成本。
缺点也要说清楚。 它是基础设施不是产品——应用层代码得你自己写,指望「上传模型点一下就有 API」的人会失望。只有云端形态,没有私有化部署,数据合规要求严格的场景直接排除。成本上要小心那两个倍数:指定区域和非抢占式执行的加价,如果不注意配置,账单可能比预估高出一大截。规模上去之后,按用量计费的 GPU 支出增长是相当陡的,长期满载的业务反而不如包月实例便宜。
结论: 如果你是用 Python 做 AI 的开发者或小团队,工作负载又是突发式、不可预测的,Modal 值得优先考虑,省下的运维时间大概率比算力差价更值钱。但如果你的业务是 7×24 高负载稳定跑,或者对数据本地化有硬要求,就该看别的方案。
使用建议
- 先用 Starter 的每月 $30 额度跑通一个完整链路。 别只做 Hello World,把真实模型部署一次、调一次、看一次日志,才能判断它适不适合你。$30 大约够 T4 跑二十多个小时或 H100 跑七八个小时,足够摸清底细。
- 重点关注冷启动优化。 把模型权重放进 Volume 或烤进镜像,避免每次冷启动都从外部下载。这一步做对,用户体验差别很大。
- 默认别开非抢占式执行和指定区域。 这两个是 3 倍和 1.5–1.75 倍加价的来源。只有确实需要(比如低延迟或合规要求)再开,否则纯烧钱。
- GPU 型号别一上来就选顶配。 很多推理任务 T4、L4、A10 就够了,价格差好几倍。先用小卡跑基线,确认瓶颈在算力再往上换。
- 配好用量监控和预算告警。 按秒计费的平台,一个死循环或忘关的任务能烧掉不少钱。Starter 的日志只保留 1 天,出问题要及时看。
- 初创和学术团队记得申请赠款。 官方有专门的 startup 和 academic credit 计划,额度不小,符合条件的没必要自己掏钱。
- 想跑高吞吐 LLM 推理,把 vLLM 装进 Modal 容器里。 这是社区里很常见的组合——Modal 负责弹性和运维,vLLM 负责推理性能。
适合谁用?
推荐
- 用 Python 做 AI 的独立开发者和小团队:不想碰 Docker 和 K8s,但需要 GPU
- 流量突发、不可预测的 AI 产品:scale-to-zero 能省下大量闲置成本
- 需要做微调、批量推理、Embedding 生成等间歇性重计算任务的团队
- 做 Agent、Code Interpreter 类产品,需要安全沙箱执行不可信代码的开发者
- 早期初创和学术研究者:有算力赠款可申请,起步成本很低
可考虑
- 中等规模的生产推理业务:能用,但要认真算一遍按量 vs 包月的成本,并压测冷启动
- 已有 AWS/GCP 承诺消费额度的企业:Modal 支持通过云市场使用这些额度,可以顺便消耗
- 需要合规资质的团队:官方提供 SOC 2、HIPAA 兼容等能力,但要在 Team/Enterprise 层级
不推荐
- 数据必须留在内网、要求私有化部署的场景:Modal 只有云端形态
- 7×24 长期满载的稳定负载:包月 GPU 实例或自建集群单位成本更低
- 不写代码、希望图形界面点几下就部署模型的用户:这不是它的产品形态
- 主要用非 Python 技术栈的团队:SDK 是 Python 原生的,其他语言体验会打折扣