怎么挑 Embedding 模型?
Embedding 的调用量往往比对话大得多 —— 整个知识库要先向量化,之后每条查询也要编码,所以单价一点点差别,会被放大成月账的一大截。预算敏感就先挑便宜的;想彻底省,自部署开源的 BGE / Qwen3-Embedding。
价格之外主要盯两个数:维度决定向量多细、也决定向量库的存储与检索开销(1024~1536 够用,追精度再上 3072);最大输入决定一次能塞多长,多数在 8K 上下,长文档得切块,少数如 Cohere embed v4 能到 128K。
国产的通义、BGE 走人民币、对中文更稳;要多语言或长上下文,Cohere、Voyage、Jina 更常见。想知道换算成一个月多少钱,把你的量代进 Token 成本计算器。


