|
|
[相关教程]
用vLLM部署Qwen3-32B:吞吐和首token延迟调优手记
[复制链接]
|
|
|
发表于 2026-8-19 04:00:09
|
显示全部楼层
|
有个细节想确认,你说的这个数据是实验室环境还是生产环境跑出来的? |
|
|
|
|
|
|
|
|
|
|
发表于 2026-8-19 14:12:00
|
显示全部楼层
|
学到了,我原来一直以为这块很简单,看完发现细节全在流程里。 |
|
|
|
|
|
|
|
|
|
|
发表于 2026-8-20 01:25:02
|
显示全部楼层
|
这个成本账算得很实在,我这边也是类似情况,量小的时候真没必要自己折腾。 |
|
|
|
|
|
|
|
|
|
|
发表于 2026-8-20 13:39:15
|
显示全部楼层
|
说实话这个投入产出比确实得看行业,我们做传统制造的,算下来还不如人工。 |
|
|
|
|
|
|
|
|
|
|
发表于 2026-8-21 02:54:40
|
显示全部楼层
|
帖子里那个数字挺关键的,不过不同规模的团队差异会很大,不能直接套。 |
|
|
|
|
|
|
|
|
|
|
发表于 2026-8-21 17:11:16
|
显示全部楼层
|
能不能展开说说你用的具体配置?我最近也在选,卡在预算这块。 |
|
|
|
|
|
|
|
|
|
|
发表于 2026-8-22 08:29:03
|
显示全部楼层
|
楼主写得很克制了,实际落地的坑还要多。我们部门试点三个月,最后砍掉了一半场景。 |
|
|
|
|
|
|
|
|
|
|
发表于 2026-8-23 00:48:01
|
显示全部楼层
|
楼主有没有做过横向对比?想看看别的方案在同样场景下的表现。 |
|
|
|
|
|
|
|
|
|
|
发表于 2026-8-23 18:08:10
|
显示全部楼层
|
感谢分享,正卡在这个问题上,你的经验省了我不少时间。 |
|
|
|
|
|
|
|
|
|
|
发表于 2026-8-24 12:29:30
|
显示全部楼层
|
这个观点有点绝对了,具体还是看团队的技术储备,不是所有人都能接得住。 |
|
|
|
|
|
|
|
|
温馨提示:
1、在论坛里发表的文章仅代表作者本人的观点,与本网站立场无关。
2、论坛的所有内容都不保证其准确性,有效性,时间性。阅读本站内容因误导等因素而造成的损失本站不承担连带责任。
3、当政府机关依照法定程序要求披露信息时,论坛均得免责。
4、若因线路及非本站所能控制范围的故障导致暂停服务期间造成的一切不便与损失,论坛不负任何责任。
5、注册会员通过任何手段和方法针对论坛进行破坏,我们有权对其行为作出处理。并保留进一步追究其责任的权利。
6、网络世界也请遵守我国的法律法规!一旦发现违法行为,将立即封存相关信息并报警处理!