咨询发布 发表于 2026-3-29 14:21:15

多模态大模型到底能干什么:实测GPT-4o和通义千问的图文能力

最近试了几个多模态大模型,说下感受。

之前用纯文本模型,你只能跟它打字聊天。现在GPT-4o、通义千问这些多模态模型,你直接扔张图过去让它分析,或者丢个PDF让它总结,甚至语音对话都行。体验上确实上了一个台阶。

举个实际例子:上周我拍了张快递单的照片,直接扔给模型让它提取收件人信息和地址,几秒钟就识别完了,比OCR准。以前要专门搞OCR引擎,现在一句话搞定。

再比如看财报,几十页的PDF以前要手动翻,现在直接丢给模型问"今年营收增长多少""毛利率有没有下降",它直接从图表里提取数据回答。

但也不是没问题。多模态模型目前最大的短板是视频理解——长视频它处理不了,短视频也容易漏关键信息。另外就是成本,多模态的token消耗是纯文本的好几倍,日常用如果走API,账单涨得挺快。

不过方向肯定是对的。未来模型不只能看能听,还能操作电脑、调用工具,最终变成一个全能助手。现在的多模态只是起步阶段。

https://www.metk.cn/img/posts/ai_multimodal.jpg

慢半拍慢半拍 发表于 2026-3-30 22:28:59

我这边的情况刚好相反,一开始不信,硬着头皮上了半年反而离不开了。

隔壁老王煮酒 发表于 2026-3-31 18:00:12

同意楼主,但落地的时候一定要考虑老系统的兼容,改造成本容易被低估。

拾光观星 发表于 2026-4-2 09:02:38

帖子里那个数字挺关键的,不过不同规模的团队差异会很大,不能直接套。

浅夏笔记 发表于 2026-4-4 19:36:17

这个判断我认同,短期看价格,长期还是看能不能嵌进业务流程里。

阿澈10 发表于 2026-4-8 01:41:10

这个结论我保留意见,至少在我们行业不太成立,可能跟样本有关。

不吃香菜柚子 发表于 2026-4-12 03:17:16

看得出来是真做过的人写的,不是那种拼资料的。

一叶杂谈 发表于 2026-4-17 00:24:35

有个坑提醒一下,接口一变整套流程都得跟着改,最好提前做抽象层。

长夏旧巷 发表于 2026-4-22 17:03:08

有个疑问,你说的这个方案在并发高的时候会不会有明显衰减?我这边测试过不太稳。

半盏 发表于 2026-4-29 05:12:54

这篇看完最大的收获是那句"先算清楚自己的量",很多人上来就冲设备,最后闲置。
页: [1] 2 3
查看完整版本: 多模态大模型到底能干什么:实测GPT-4o和通义千问的图文能力