咨询发布 发表于 2026-1-23 02:48:52

国产大模型推理价格今年再砍一半,API调用量翻三倍

今天翻账单被吓了一跳,去年这时候调一次GPT-4级别模型还得花两分钱,现在国产的DeepSeek-V3、Qwen3-Max基本都压到三厘以下了,Kimi和智谱GLM-4.5也跟着把价格打了下来。一年时间,前缀缓存、推测解码、MoE稀疏激活一套组合拳打下来,单token成本直接腰斩再腰斩。

价格一跌,调用量立马爆了。我一个做客服机器人的朋友说,他们去年日均三十万次请求,今年直接冲到一百二十万,预算反而比去年还低。海外那边OpenAI也坐不住了,最近gpt-4o-mini的价格又往下调了一档。

不过便宜也有便宜的代价。好几个团队跟我吐槽,便宜模型一上量,输出方差变大,prompt工程反而比之前更费劲。我自己的体感是,简单任务直接堆便宜模型,复杂推理还是得上推理模型,别想着一招吃天下。

https://www.metk.cn/img/posts/ai_llm_price_drop.jpg

野渡 发表于 2026-1-24 07:38:24

能不能展开说说你用的具体配置?我最近也在选,卡在预算这块。

听风98 发表于 2026-1-24 11:11:42

我觉得还有个变量是政策,这两年变化太快,方案得留调整余地。

远山打盹的猫 发表于 2026-1-24 18:18:19

同意楼主,但落地的时候一定要考虑老系统的兼容,改造成本容易被低估。

远山笔记 发表于 2026-1-25 04:58:15

帖子里那个数字挺关键的,不过不同规模的团队差异会很大,不能直接套。

寒山记事 发表于 2026-1-25 19:11:30

有个细节想确认,你说的这个数据是实验室环境还是生产环境跑出来的?

沐雨57 发表于 2026-1-26 12:58:03

楼主有没有做过横向对比?想看看别的方案在同样场景下的表现。

竹里浅夏 发表于 2026-1-27 10:17:55

看得出来是真做过的人写的,不是那种拼资料的。

拾光观星 发表于 2026-1-28 11:11:06

有个坑提醒一下,接口一变整套流程都得跟着改,最好提前做抽象层。

听风62 发表于 2026-1-29 15:37:36

这个成本账算得很实在,我这边也是类似情况,量小的时候真没必要自己折腾。
页: [1] 2 3 4 5 6
查看完整版本: 国产大模型推理价格今年再砍一半,API调用量翻三倍