🧰 Baseten 到底是个什么东西
Baseten 是一家总部在旧金山的 AI 基础设施公司,2019 年就成立了,四个联合创始人之前都在 Gumroad 干过,那时候被信用卡欺诈检测模型的上线问题折腾得够呛,后来干脆自己出来做工具。公司名字取自澳洲小学数学课上的十进制积木,挺随意的。早期几年他们其实挺挣扎的,做的还是传统机器学习模型的部署,客户拿去搞反欺诈、内容审核之类的内部工具,声量不大,收入也几乎为零。
转机出现在 2022 年 ChatGPT 爆了之后。开源模型一个接一个往外冒,开发者突然意识到:训练模型不是最难的,把模型跑得快、跑得便宜、跑得稳才是真本事。Baseten 正好在这个时间点踩对了位置,他们那套为推理优化的基础设施一下子从可有可无变成了刚需。现在的 Baseten 服务着 Cursor、Notion、Lovable、OpenEvidence 这些你多少听过的 AI 产品,平台上每天处理的推理调用超过 10 亿次。
所以 Baseten 到底是干嘛的?一句话:它帮你把 AI 模型跑起来,并且跑得比你自己折腾要快、要稳、要省钱。不管你是要调用现成的开源模型,还是把自己微调过的模型部署上线,或者是自己训练一个小模型,Baseten 都有一套工具链来接住你。

⚙️ 核心功能有哪些
- 模型 API 调用:不想自己部署?直接用 OpenAI 兼容的 API 调用 Baseten 托管好的开源模型,一行代码改个 base_url 就能跑。
- 自定义模型部署:用 Truss 框架把你的模型打包成一个配置文件,推上去就能获得一个带自动扩缩容的推理端点,不用碰 Docker 和 K8s。
- 模型训练与微调:2025 年正式 GA 的训练能力,支持 LoRA 微调、多节点训练、RL 环境构建,还能把训练出的 checkpoint 一键部署成推理服务。
- 多模型编排:如果你的流程涉及多个模型,比如先检索再生成,可以把它们串成一条链,每个步骤跑在各自合适的硬件上。
- 专用 GPU 实例:按分钟计费租 GPU,从便宜的 T4 到顶配的 B200 都有,用多少算多少,空闲了自动缩到零。
- 企业级托管选项:除了默认的共享云,还提供单租户隔离和完全自托管两种模式,满足金融医疗那套合规要求。
- CLI 工具链:baseten 命令行工具把所有操作都脚本化了,支持 JSON 输出和 jq 过滤,适合塞进 CI/CD 流水线里。
✨ 和其他同类工具比,它特别在哪
如果你把 Baseten 和 Fireworks、Together、Modal 这些放一起看,会发现每家都有自己的脾气。Fireworks 主打低延迟,Together 主打模型目录丰富,Modal 主打 Python 原生开发体验,Replicate 主打多模态覆盖广。Baseten 的定位关键词是企业级打磨。
这个打磨体现在几个具体的地方。第一,它的 Truss 框架把模型打包这件事变得非常标准化,依赖、密钥、推理配置全塞进一个 manifest 里,团队协作的时候不会出现我本地能跑你怎么跑不了的破事。第二,它对 SOC 2 Type II 和 HIPAA 合规的支持是实打实的,这在金融和医疗客户眼里是硬门槛。第三,它的多云端 GPU 池化能力让它能在 18 个云和 87 个集群之间调度资源,不会因为某个云的区域故障就全线趴窝。
还有一个容易被忽略的点:Baseten 是按分钟计费的。如果你的负载比较稳定,GPU 利用率能维持在 30% 以上,按分钟租用往往比按 token 计费要划算。这个经济账对用量大的团队来说很关键。
🎯 用它来做什么比较合适
最典型的场景是 AI 产品后端。比如你在做一个 AI 编程助手、一个医疗问答工具、或者一个法律文书生成器,你需要把模型跑得快、响应稳、并发扛得住,Baseten 就是给这种场景准备的。Cursor 和 OpenEvidence 都是靠 Baseten 撑着推理层。
第二个场景是模型微调和蒸馏。有个客户 OpenEvidence 拿大模型跑通了用例之后,把知识蒸馏到一个更小的模型上,用 Baseten 训练完直接部署,端到端推理速度提了 23 倍,还预计能省 190 万美元。这个路径对很多公司都有参考价值:先用大模型验证,再用小模型省钱。
第三个场景是需要数据隔离的企业部署。银行、医院、政府机构这类客户,模型不能随便跑在公网上,Baseten 的单租户和自托管方案就是给他们准备的。
不太适合的场景:如果你只是偶尔调一下 GPT-4 的 API 写写文案,Baseten 这套东西对你来说太重了,直接买 token 更省事。
🚀 怎么开始用
注册流程没什么特别的,用邮箱或者 GitHub 账号登录就行。新 workspace 会给一些初始 credits,够你跑几个小实验试试水温。注意 Baseten 没有那种永久免费版,credits 花完了如果没绑支付方式,模型会被停掉。
最快上手的方式是直接调 Model API。如果你不想部署任何东西,只是想试试 Baseten 上的托管模型,去控制台拿一个 API key,然后像用 OpenAI SDK 一样调就行,把 base_url 换掉就完事。
如果你想部署自己的模型,流程大概是:本地安装 Truss CLI,写一个 config.yaml 声明模型类型、GPU 规格、依赖包,然后推上去。第一次推会创建一个开发部署,你改代码它自动同步,改完看到日志没问题了,再推上生产。
想训练模型的话,Baseten 提供了一个 ML Cookbook,里面有 Gemma3、Qwen3、Whisper 这些模型的现成训练配方,拿过来改改数据路径就能跑。
💡 几个能帮你省钱的实用技巧
Baseten 的钱是按分钟烧的,而且冷启动也是要计费的,模型加载那几分钟,GPU 已经在跑了,账单已经在跳了。所以有几个习惯能帮你控制成本:
能用开发部署就用开发部署。开发部署是不计费的,虽然只有单副本、不适合跑生产流量,但调试阶段完全够用,别一上来就推生产环境。
闲置时把最小副本数设成 0。这样没有请求的时候不会产生 GPU 费用,代价是下一个请求要等冷启动。如果你的负载有明显波峰波谷,这个设置能省不少钱。
镜像构建要当心。每次推送都会触发一次镜像构建,而构建过程是按分钟计费的。如果依赖包没怎么变,构建会快很多;如果你在 requirements 里塞了一堆用不上的库,构建时间拉长,成本就上去了。
善用 scale-to-zero 和自动扩缩容信号。GPU 利用率这个指标其实不太准,真正反映负载的是请求队列深度和首 token 延迟,配置自动扩缩容的时候用这两个信号更靠谱。
📱 在哪里能用
Baseten 的核心使用界面是网页控制台,浏览器打开就能用,Chrome、Edge、Safari 都支持。开发工作主要靠 Truss CLI 和 Baseten CLI 完成,这两个命令行工具支持 macOS,Homebrew 安装最方便,Linux 和 Windows 需要手动下载二进制文件放到 PATH 里。
没有官方的 iOS 或 Android 应用,也没有浏览器插件。Baseten 本质上是一个开发者工具,不是那种装在手机里随时点两下的产品。如果你需要用手机管理部署,只能通过浏览器打开控制台,体验只能说凑合。
💰 收费情况
Baseten 的定价分两条线走。Model API 这条路是按 token 计费的,不同模型价格不一样,从每百万 token 几毛钱到几十块钱都有,具体看你在官网或者 Vercel AI Gateway 的价目表。
专用 GPU 部署这条路是按分钟计费的,实例类型从便宜的 T4 到顶配的 B200 不等。H100 80GB 大约是每小时 6.50 美元,A100 80GB 大约是每小时 4.00 美元。
计费的颗粒度是分钟,而且冷启动和模型加载的那几分钟也算在内。新用户会拿到一些初始 credits 用于测试,但没有永久免费版。对于企业客户,Baseten 提供定制报价和承诺容量折扣。
👥 谁适合用,谁不适合
适合的人:需要把 AI 模型部署到生产环境的工程团队;做 AI 产品、对推理延迟和稳定性有要求的创业公司;有数据合规要求、需要私有化部署的企业;想从大模型切换到小模型来降本的团队。
不太适合的人:只是想调 API 写点内容的一般用户;预算极其有限、用量又大的个人开发者,按分钟计费可能比按 token 贵;没有工程能力、完全不想碰命令行的人。
🌍 全球使用情况
Baseten 的客户名单挺有说服力:Cursor、Notion、Lovable、Abridge、Harvey、Clay、OpenEvidence 这些名字你大概率听过其中几个。平台每天处理超过 10 亿次推理调用,跑在 87 个集群、18 个云上。收入在过去一年增长了 20 倍,这个增速在 B2B 基础设施领域相当少见。
用户主要集中在北美,欧洲也有不少金融和医疗客户。官网月访问量大约 26.6 万,季度增长 29.5%。2026 年 6 月完成 15 亿美元 F 轮融资,估值达到 130 亿美元,英伟达也参与了投资。
⚖️ 优缺点说清楚
优点:推理性能经过大规模验证,每天十亿级调用不是吹的;Truss 框架把模型部署的复杂度降了一个量级;企业级合规能力,SOC 2、HIPAA、自托管都是实打实的;多云端调度让可靠性有保障;按分钟计费在高利用率场景下比按 token 划算。
缺点:学习曲线不低,Truss 和 CLI 需要时间上手,对非工程用户不友好;冷启动是收费的,而且大模型的冷启动可能要好几分钟,这笔钱用户承担;没有永久免费版,credits 花完不绑卡模型直接停;客服响应慢,有用户反馈连改个账单地址都折腾了十天,聊天支持基本不回消息。
🔍 和同类工具比一比
对比 Modal:Modal 的开发者体验更 Python 原生,用装饰器就能部署函数,按秒计费,冷启动更快。Baseten 在模型性能和 GPU 调度深度上更专注,适合对推理有极致要求的场景。
对比 Together 和 Fireworks:这两家更偏向模型市场路线,目录丰富、按 token 计费。Baseten 更偏你的模型你的硬件,适合需要自定义部署和私密性的场景。
对比 Replicate:Replicate 是多模态模型调用的首选,按预测次数计费,集成生态好。Baseten 在 LLM 推理和大规模生产部署上更专业,价格在 A100 上比 Replicate 便宜约 21%。
从场景上分:想快速调模型就选 Replicate 或 Together;想自己部署但不想管硬件就选 Modal 或 Baseten;对性能和合规有硬要求就选 Baseten。
📌 最后的结论
Baseten 是个给认真做 AI 产品的人准备的推理基础设施。如果你在跑的模型已经开始产生真实流量,延迟每多几百毫秒用户就在流失,GPU 账单每个月都在涨,那 Baseten 值得花时间研究一下。它的学习曲线确实存在,但一旦跑通,你获得的是一个经过 Cursor 和 Notion 这种量级产品验证过的部署方案。
如果你还在早期探索阶段,模型调用量不大,或者你根本不想碰命令行和配置文件,那 Baseten 对你来说可能有点杀鸡用牛刀。先试试托管 API 或者更轻量的方案,等负载上来了再回来也不迟。
一句话:把它当生产环境的推理引擎来用,别当玩具来玩。

评论