mofcloud

本地部署大模型 vs 云 API 成本计算器

算清买 GPU / Mac 本地部署大模型,到底每月要跑多少 token 才回本。填上硬件与用量,立刻得出「月固定开销 / 单机产能上限 / 回本门槛」,并画出成本-用量交点图。不确定模型单价?先看 Token 成本计算器

🖥️ 本地硬件部署

套用一个硬件预设参考值,可改;吞吐随模型 / 量化 / 并发变化很大
设备利用率50%

☁️ 云端 API 参照

参照模型
云端综合单价 / 百万 tokens
月固定开销F = 采购价÷折旧 + 固定开销
月产能上限百万 / 月
回本门槛用量百万 / 月
本地月成本
API 月成本
每月差额
该用量下利用率

成本-用量交点图 本地(固定+边际电费)与云 API(纯按量)两条线的交点,就是回本门槛

本地部署 云 API
使用指南

回本模型是怎么算的?

本地自部署和云 API 是两种成本结构。本地 = 固定成本 F + 边际成本 m×用量:F 是硬件采购价按月折旧再加托管运维;m 是每百万 token 的电费(由功率、电价和吞吐折算)。云 API = 综合单价 c × 用量,纯按量、零固定。

两条线的交点就是回本门槛 M\* = F ÷ (c − m):月用量高于它,本地更省;低于它,云 API 更省。另一个约束是单机产能上限 M_max = 吞吐 × 利用率 × 一个月的秒数——一张卡一个月最多也就吐这么多 token,超过就得再加设备,固定成本随之翻倍。

举个例子

买一张卡:采购价 ¥13,000、折旧 24 个月、每月固定开销 ¥200 → 月固定 F ≈ ¥742。若云端综合单价 ¥12 / 百万 token、本地边际电费 ¥0.6 / 百万 token —— 回本门槛 ≈ 742 ÷ (12 − 0.6) ≈ 65 百万 token / 月
也就是说,月调用量长期低于 6,500 万 token 时,其实继续用 API 更划算。

吞吐(TPS)对结果影响极大,而它取决于模型大小、量化、batch 和并发,请按你的真实部署实测修正。想先校准云端单价,去 Token 成本计算器大模型价格对比

常见问题

回本门槛 M* 是怎么算的?

M* = 月固定开销 F ÷ (云端综合单价 c − 本地边际电费 m)。它是本地总成本 (F + m×用量) 与云 API 成本 (c×用量) 相等的那个月用量。月用量高于 M* 本地更省,低于则云 API 更省。

为什么要填功率和电价,而不是直接填电费?

本地跑模型的边际成本主要是电。我们用 整机功率 × 电价 ÷ 吞吐 折算出每百万 token 的电费,比让你直接估「每百万 token 多少钱」更直观、也更准。

「设备利用率」为什么重要?

没人能让 GPU 一天 24 小时满负荷跑推理。利用率决定单机月产能上限 M_max = 吞吐 × 利用率 × 一个月秒数。利用率越低,回本越难。

硬件价格填人民币还是美元?

跟随站点币种:中文站按人民币,海外站按美元。选中的参照模型价格会自动折算到同一币种再参与计算。

预设的吞吐(TPS)准吗?

只是量级参考。真实吞吐取决于模型大小、量化精度、batch size 和并发,差异可达数倍,请按你的实测修正。