价格战打成什么样了?先看几个硬数字

上周有个做独立开发的朋友给我发了张截图,他一个月跑了120万次API调用,账单从DeepSeek换到豆包之后,省了差不多400块。他跟我说,早知道价格差这么多,之前就不该死磕一家。这事儿让我挺有感触的,国产大模型这波价格战,从2024年5月打到2025年年中,价格已经低到有点魔幻了。

我帮你拉一组数据。DeepSeek-V3的输入价格是0.001元/千tokens,输出0.002元/千tokens,缓存命中之后输入只要0.0005元。字节豆包Pro定价更狠,输入0.0008元/千tokens,输出0.002元/千tokens。智谱的GLM-4-Flash干脆直接免费。对比一下GPT-4o,输入要0.02美元/千tokens,折合人民币大概0.15元,差了150倍。

我自己的项目跑下来,一个月大概200万tokens的调用量,主要做文本总结和关键词提取。用DeepSeek-V3,成本不到6块钱。同样的量,放GPT-4o上得200多。上个月接了个舆情监控的小项目,每天处理50万条新闻标题,一开始用文心,一个月账单800多,换到DeepSeek-V3后变成40块。客户差点以为我数据造假。价格战打得越凶,对咱们做应用的越有利。但价格低不代表闭眼选就行,下面几条实战技巧,都是我自己踩过坑之后总结的。

技巧清单:按输出价选模型 + 学会薅缓存羊毛

第一条:选模型别看输入价格,盯着输出价格排序。我见过不少人,看到某家输入价格是0.0005元/千tokens就冲了,结果输出价格贵得离谱。大多数应用场景,比如写文案、总结文档、生成代码,输出量通常是输入量的2到3倍。你输出单价高,整体成本就压不下来。我现在的做法是打开各家定价页,单独把输出价格列出来排序。DeepSeek-V3、豆包Pro、通义qwen-plus这三家输出都是0.002元/千tokens,属于第一梯队。文心ERNIE-4.0-Turbo输出要0.06元/千tokens,贵了整整30倍,除非你非用百度的生态不可,不然真的没必要。你要是做客服机器人,输出的是大段回复文本,输出价差30倍,一个月下来账单能差出一台手机。

第二条:缓存命中是隐藏的省钱大招。DeepSeek和豆包都支持上下文缓存,命中之后输入价格能降90%。怎么做?把system prompt写死,保持前缀稳定,动态内容全放到靠后的位置。我有个爬虫总结项目,system prompt固定200字,缓存命中率能做到70%以上,成本直接砍掉一半。这里有个坑,别把用户ID、时间戳这种变量塞在prompt开头,一塞进去,前缀就全miss了,缓存等于白开。我一开始没注意,把日期写进了前缀,结果命中率掉到10%,后来改了位置才救回来。

技巧清单:混合调度 + 免费额度 + 窗口期折扣

第三条:搞混合调度,免费模型打底,贵模型兜底。我拿智谱GLM-4-Flash当免费打底,处理简单分类、关键词提取这类活儿。复杂推理再转给DeepSeek-R1。具体做法是写一个路由逻辑,先让Flash判断任务复杂度,超过5分(我自己定义的评分标准)再转给R1。跑了一个月,200万tokens里80%都消耗在免费模型上,整体成本压到接近零。这套路特别适合那种请求量大但单条逻辑不复杂的业务,比如评论审核、标题分类、垃圾信息过滤。

第四条:免费额度要用在批量离线任务上。通义千问、Kimi、智谱的新用户都有免费额度,但别注册完就扔着。我的做法是拿这些额度跑批量离线任务,比如给历史数据打标、清洗语料。这类任务不要求实时响应,用免费额度慢慢跑就行。免费额度通常有30天或90天的有效期,你存着不用,到期就清零了。把免费额度花在离线任务上,付费预算就能留给线上实时请求。我有一次用Kimi的免费额度清洗了20万条历史评论,一分钱没花,就是跑了半天。

第五条:盯着新模型上线的窗口期,折扣力度最大。新模型发布头两周,各家基本都有临时折扣,有的能打到1折。我习惯隔三差五刷一下各家公告页,或者加几个官方技术群。2025年3月DeepSeek-V3-0324上线那阵,API价格临时降了30%,我趁那几天把积压的数据预处理任务全跑完了。窗口期一过,价格就回调到正常水平,所以看到新模型上线,先别急着体验,算算有没有批量任务可以蹭这波折扣。

技巧清单:自部署要算账 + 价格计算器 + 限流坑

第六条:月调用量够大再考虑自部署。我有个朋友用两张4090跑Qwen-32B,单token成本算下来0.0005元/千tokens,比API便宜一半。但前提是你有运维能力,光调显存和并发就够折腾的。我的判断标准是:月调用量超过1000万tokens,自部署才划算。低于这个量,API省心多了,别给自己找事。我自己就吃过亏,有段时间图新鲜部署了个7B模型,结果显卡占用率上不去,吞吐量还不如API,折腾两周又迁回去了。

第七条:用价格计算器算账,别凭感觉换模型。OpenRouter有价格对比页,但国产模型收录不全。我的办法是写个简单脚本,把各家价格表拉下来,按你实际的调用分布(输入输出比例、日调用量)算总成本。我之前就这么发现,我的场景用豆包比DeepSeek便宜15%,因为豆包的缓存命中价格更低。价格表是死的,你的调用模式是活的,不按自己的数据算,光看别人说谁便宜就换,容易踩坑。脚本大概50行,用Python写,把价格填进去就能跑。

第八条:下单前先看限流和并发限制。有些便宜模型限流很死,RPM只有60,你稍微上点并发就报429错误。我的做法是先用脚本压测,拿100个并发请求打一下,看实际吞吐量再决定上不上。价格再低,限流导致请求失败,重试的成本反而更高。特别是做实时应用,稳定性比单价重要得多。我之前用过一个免费模型,白天高峰期几乎每个请求都要重试3次,最后算下来时间成本比用付费模型还高。

💬 你在用什么AI工具?

聊了这么多,我自己现在的组合是:DeepSeek-V3跑常规任务,GLM-4-Flash做免费打底,豆包用在缓存敏感的场景。你用的哪家?有没有踩过什么坑?去AI House排行榜看看真实用户的投票吧,aibunkhouse.com/rankings/,给喜欢的工具投一票,也能看到别人在用什么。评论区聊聊你的API账单故事,我每条都看。

常见问题 / FAQ

价格战打成什么样了?先看几个硬数字

上周有个做独立开发的朋友给我发了张截图,他一个月跑了120万次API调用,账单从DeepSeek换到豆包之后,省了差不多400块。他跟我说,早知道价格差这么多,之前就不该死磕一家。这事儿让我挺有感触的,国产大模型这波价格战,从2024年5月打到2025年年中,价格已经低到有点魔幻了。 我帮你拉一组数据。DeepSeek-V3的输入价格是0.001元/千tokens,输出0.002元/千tok...

技巧清单:按输出价选模型 + 学会薅缓存羊毛

第一条:选模型别看输入价格,盯着输出价格排序。我见过不少人,看到某家输入价格是0.0005元/千tokens就冲了,结果输出价格贵得离谱。大多数应用场景,比如写文案、总结文档、生成代码,输出量通常是输入量的2到3倍。你输出单价高,整体成本就压不下来。我现在的做法是打开各家定价页,单独把输出价格列出来排序。DeepSeek-V3、豆包Pro、通义qwen-plus这三家输出都是0.002元/千t...

技巧清单:混合调度 + 免费额度 + 窗口期折扣

第三条:搞混合调度,免费模型打底,贵模型兜底。我拿智谱GLM-4-Flash当免费打底,处理简单分类、关键词提取这类活儿。复杂推理再转给DeepSeek-R1。具体做法是写一个路由逻辑,先让Flash判断任务复杂度,超过5分(我自己定义的评分标准)再转给R1。跑了一个月,200万tokens里80%都消耗在免费模型上,整体成本压到接近零。这套路特别适合那种请求量大但单条逻辑不复杂的业务,比如评...

技巧清单:自部署要算账 + 价格计算器 + 限流坑

第六条:月调用量够大再考虑自部署。我有个朋友用两张4090跑Qwen-32B,单token成本算下来0.0005元/千tokens,比API便宜一半。但前提是你有运维能力,光调显存和并发就够折腾的。我的判断标准是:月调用量超过1000万tokens,自部署才划算。低于这个量,API省心多了,别给自己找事。我自己就吃过亏,有段时间图新鲜部署了个7B模型,结果显卡占用率上不去,吞吐量还不如API,...

💬 你在用什么AI工具?

聊了这么多,我自己现在的组合是:DeepSeek-V3跑常规任务,GLM-4-Flash做免费打底,豆包用在缓存敏感的场景。你用的哪家?有没有踩过什么坑?去AI House排行榜看看真实用户的投票吧,aibunkhouse.com/rankings/,给喜欢的工具投一票,也能看到别人在用什么。评论区聊聊你的API账单故事,我每条都看。...