国产大模型推理价格今年再砍一半,API调用量翻三倍
今天翻账单被吓了一跳,去年这时候调一次GPT-4级别模型还得花两分钱,现在国产的DeepSeek-V3、Qwen3-Max基本都压到三厘以下了,Kimi和智谱GLM-4.5也跟着把价格打了下来。一年时间,前缀缓存、推测解码、MoE稀疏激活一套组合拳打下来,单token成本直接腰斩再腰斩。价格一跌,调用量立马爆了。我一个做客服机器人的朋友说,他们去年日均三十万次请求,今年直接冲到一百二十万,预算反而比去年还低。海外那边OpenAI也坐不住了,最近gpt-4o-mini的价格又往下调了一档。
不过便宜也有便宜的代价。好几个团队跟我吐槽,便宜模型一上量,输出方差变大,prompt工程反而比之前更费劲。我自己的体感是,简单任务直接堆便宜模型,复杂推理还是得上推理模型,别想着一招吃天下。
https://www.metk.cn/img/posts/ai_llm_price_drop.jpg 能不能展开说说你用的具体配置?我最近也在选,卡在预算这块。 我觉得还有个变量是政策,这两年变化太快,方案得留调整余地。 同意楼主,但落地的时候一定要考虑老系统的兼容,改造成本容易被低估。 帖子里那个数字挺关键的,不过不同规模的团队差异会很大,不能直接套。 有个细节想确认,你说的这个数据是实验室环境还是生产环境跑出来的? 楼主有没有做过横向对比?想看看别的方案在同样场景下的表现。 看得出来是真做过的人写的,不是那种拼资料的。 有个坑提醒一下,接口一变整套流程都得跟着改,最好提前做抽象层。 这个成本账算得很实在,我这边也是类似情况,量小的时候真没必要自己折腾。