多模态大模型到底能干什么:实测GPT-4o和通义千问的图文能力
最近试了几个多模态大模型,说下感受。之前用纯文本模型,你只能跟它打字聊天。现在GPT-4o、通义千问这些多模态模型,你直接扔张图过去让它分析,或者丢个PDF让它总结,甚至语音对话都行。体验上确实上了一个台阶。
举个实际例子:上周我拍了张快递单的照片,直接扔给模型让它提取收件人信息和地址,几秒钟就识别完了,比OCR准。以前要专门搞OCR引擎,现在一句话搞定。
再比如看财报,几十页的PDF以前要手动翻,现在直接丢给模型问"今年营收增长多少""毛利率有没有下降",它直接从图表里提取数据回答。
但也不是没问题。多模态模型目前最大的短板是视频理解——长视频它处理不了,短视频也容易漏关键信息。另外就是成本,多模态的token消耗是纯文本的好几倍,日常用如果走API,账单涨得挺快。
不过方向肯定是对的。未来模型不只能看能听,还能操作电脑、调用工具,最终变成一个全能助手。现在的多模态只是起步阶段。
https://www.metk.cn/img/posts/ai_multimodal.jpg 我这边的情况刚好相反,一开始不信,硬着头皮上了半年反而离不开了。 同意楼主,但落地的时候一定要考虑老系统的兼容,改造成本容易被低估。 帖子里那个数字挺关键的,不过不同规模的团队差异会很大,不能直接套。 这个判断我认同,短期看价格,长期还是看能不能嵌进业务流程里。 这个结论我保留意见,至少在我们行业不太成立,可能跟样本有关。 看得出来是真做过的人写的,不是那种拼资料的。 有个坑提醒一下,接口一变整套流程都得跟着改,最好提前做抽象层。 有个疑问,你说的这个方案在并发高的时候会不会有明显衰减?我这边测试过不太稳。 这篇看完最大的收获是那句"先算清楚自己的量",很多人上来就冲设备,最后闲置。