AI Agent自主执行任务到哪了:从Manus到AutoGPT实测
我这半个月都在折腾AI Agent,主要测了Manus、AutoGPT和一个开源的OpenManus。说实在的,进步很大但离"交给它就不用管"还差得远。Manus跑了一个"帮我调研某公司并出报告"的任务,大概花了40分钟,中间自己开了浏览器搜了二十多个网页,最后确实出了个PDF。但仔细看内容,有三四处数据对不上,引用的财报数字明显是它自己编的。后来换了三个任务测,每次都有这种"看起来像但经不起查"的问题。
https://www.metk.cn/img/posts/ai_agent_autonomous_01.jpg
AutoGPT那边更糙,让它规划一个"上线一个小工具"的任务,它绕了半小时一直在写TODO列表和读README,没真正动手写过一行能跑的代码。反而是用GPT-4o加function calling手动搭的工作流,指定三四个工具给它调,执行成功率能到70%以上。
我的判断是:限定工具集加明确步骤拆分的Agent已经能用了,那种"给个目标自己想怎么做"的还差两年。别信demo视频,自己跑一遍就知道了。 为毛老子总也抢不到沙发?!! 这块的进展比想象中快,但离规模化商用还有距离。 关键还是数据质量,模型再强喂垃圾也是白搭。你们的延迟和成本大概什么水平? 我比较看好垂直领域的做法,通用方案竞争太激烈。有对比过同类的其他方案吗? 评估标准不统一的话,各家都说自己效果好,没法比。 我拿它跑过类似任务,前几版效果一般,调完提示词才像样。 有几个坑提醒下,接口一变整套流程都得跟着改,最好提前做抽象层。 这类需求本质是降本,所以定价天花板很容易算出来。 关键还是数据质量,模型再强喂垃圾也是白搭。