回本模型是怎么算的?
本地自部署和云 API 是两种成本结构。本地 = 固定成本 F + 边际成本 m×用量:F 是硬件采购价按月折旧再加托管运维;m 是每百万 token 的电费(由功率、电价和吞吐折算)。云 API = 综合单价 c × 用量,纯按量、零固定。
两条线的交点就是回本门槛 M\* = F ÷ (c − m):月用量高于它,本地更省;低于它,云 API 更省。另一个约束是单机产能上限 M_max = 吞吐 × 利用率 × 一个月的秒数——一张卡一个月最多也就吐这么多 token,超过就得再加设备,固定成本随之翻倍。
买一张卡:采购价 ¥13,000、折旧 24 个月、每月固定开销 ¥200 → 月固定 F ≈ ¥742。若云端综合单价 ¥12 / 百万 token、本地边际电费 ¥0.6 / 百万 token —— 回本门槛 ≈ 742 ÷ (12 − 0.6) ≈ 65 百万 token / 月。
也就是说,月调用量长期低于 6,500 万 token 时,其实继续用 API 更划算。
吞吐(TPS)对结果影响极大,而它取决于模型大小、量化、batch 和并发,请按你的真实部署实测修正。想先校准云端单价,去 Token 成本计算器 或 大模型价格对比。