mofcloud

按场景选大模型:谁最划算?

数据更新于 2026-08-29

典型用量:单次输入约 80,000 tokens · 输出约 1,500 tokens · 需上下文 ≥ 128K

全部满足条件的模型(156)
# 模型 输入 / 输出 / 1M 上下文 单次成本 VS 最便宜
1 Qwen Flash 🇨🇳 阿里云百炼 ¥0.15 / ¥1 1000K ¥0.0140
2 Qwen3.7 Flash 🇨🇳 阿里云百炼 ¥0.20 / ¥0.80 1000K ¥0.0171 ×1.2
3 Qwen3.5 Flash 🇨🇳 阿里云百炼 ¥0.20 / ¥2 1000K ¥0.0190 ×1.4
4 Qwen Turbo 🇨🇳 阿里云百炼 ¥0.30 / ¥0.58 1000K ¥0.0245 ×1.8
5 GPT-5 Nano 🇺🇸 OpenAI ¥0.34 / ¥3 400K ¥0.0309 ×2.2
6 Qwen2.5 7B Instruct 🇨🇳 阿里云百炼 ¥0.48 / ¥0.97 131K ¥0.0402 ×2.9
7 Qwen Long 🇨🇳 阿里云百炼 ¥0.48 / ¥2 10000K ¥0.0416 ×3.0
8 GLM-4.7-FlashX 🇨🇳 智谱 GLM ¥0.47 / ¥3 200K ¥0.0417 ×3.0
9 GLM-5.3-Flash 🇨🇳 智谱 GLM ¥0.50 / ¥2 1000K ¥0.0428 ×3.1
10 Qwen Doc Turbo 🇨🇳 阿里云百炼 ¥0.58 / ¥0.97 131K ¥0.0482 ×3.4
11 Mistral Small 3.2 🇫🇷 Mistral ¥0.67 / ¥2 128K ¥0.0568 ×4.1
12 Gemini 2.5 Flash-Lite 🇺🇸 Google ¥0.67 / ¥3 1049K ¥0.0578 ×4.1

想按你真实的 prompt 精算?打开 Token 成本计算器 →

怎么用

为什么同一个「最便宜」,换个场景答案就变了?

很多人挑大模型时只看一个「每百万 token 多少钱」的单价榜,但真实账单取决于你的输入和输出各有多长。同样一份价目表,长文档摘要(输入 8 万 token、输出很短)和复杂推理(输入短、输出上万)算出来的「最便宜」几乎是两拨模型。

这个工具替你把每个场景的典型 token 用量预设好,代入所有模型的官方输入价、输出价,再算单次成本排序。所以你不用自己填数字,直接选场景就能看到答案。

三个推荐分别代表什么
  • 💰 性价比之选:满足该场景硬性要求(上下文、模态、能力)里单次成本最低的那个 —— 走量、跑批时看它。国内数据里这一档通常是国产模型。
  • 🏁 国产旗舰:国产大厂顶配里满足要求最强的一个(DeepSeek / 通义 / GLM / Kimi 等)。中文与合规友好,效果优先时的国产之选。
  • 🌐 海外旗舰:海外大厂顶配里满足要求最强的一个(GPT / Claude / Gemini 等)。业务指定海外大厂、或追求最强效果时看它。

想要更精确?每个场景的用量是「典型值」,你自己的 prompt 可能不同。把真实文本粘进 Token 成本计算器 能按你的实际长度精算;想看每个模型的完整参数,去 大模型价格对比

常见问题

推荐是怎么排出来的?

每个场景预设一组典型的输入/输出 token 用量与硬性要求(上下文窗口、模态、能力标签),代入各模型的官方输入价与输出价,算出单次成本后升序排列。不掺入主观打分。

为什么不同场景推荐的模型不一样?

因为成本由你的输入、输出长度决定。输入很长的场景(长文档、RAG)由输入价主导;输出很长的场景(推理、代码)由输出价主导。同一份价目表,两类场景的最便宜往往是不同模型。

国产旗舰、海外旗舰是怎么选出来的?

旗舰是我们人工标注的一份各大厂顶配清单(如 DeepSeek V4 Pro、通义千问 Max、GPT-5.5 Pro、Claude Opus 等)。国产旗舰取国产厂商里满足该场景要求、排名最靠前的一个,海外旗舰同理取海外厂商。它代表「不将就能力」的选择,价格通常明显高于性价比款。

这些价格准吗?

价格复用主价格站数据,来自各厂商官方文档,国产模型走官方人民币价,海外模型按最新汇率折算。仅供参考,实际以厂商计费为准。

能按我自己的 prompt 精算吗?

可以。这里用的是场景典型值;把你的真实文本粘进 Token 成本计算器,能按你的实际输入/输出长度和调用量算出单次与月度成本。

---