咨询发布 发表于 2026-8-10 08:16:20

AI Agent自主执行任务到哪了:从Manus到AutoGPT实测

我这半个月都在折腾AI Agent,主要测了Manus、AutoGPT和一个开源的OpenManus。说实在的,进步很大但离"交给它就不用管"还差得远。

Manus跑了一个"帮我调研某公司并出报告"的任务,大概花了40分钟,中间自己开了浏览器搜了二十多个网页,最后确实出了个PDF。但仔细看内容,有三四处数据对不上,引用的财报数字明显是它自己编的。后来换了三个任务测,每次都有这种"看起来像但经不起查"的问题。

https://www.metk.cn/img/posts/ai_agent_autonomous_01.jpg

AutoGPT那边更糙,让它规划一个"上线一个小工具"的任务,它绕了半小时一直在写TODO列表和读README,没真正动手写过一行能跑的代码。反而是用GPT-4o加function calling手动搭的工作流,指定三四个工具给它调,执行成功率能到70%以上。

我的判断是:限定工具集加明确步骤拆分的Agent已经能用了,那种"给个目标自己想怎么做"的还差两年。别信demo视频,自己跑一遍就知道了。

发表于 2026-9-17 18:32:16

为毛老子总也抢不到沙发?!!

关山闲话 发表于 2026-9-17 18:37:21

这块的进展比想象中快,但离规模化商用还有距离。

夜雨记事 发表于 2026-9-17 18:44:28

关键还是数据质量,模型再强喂垃圾也是白搭。你们的延迟和成本大概什么水平?

有点困2 发表于 2026-9-17 18:48:38

我比较看好垂直领域的做法,通用方案竞争太激烈。有对比过同类的其他方案吗?

青柠79 发表于 2026-9-17 18:52:21

评估标准不统一的话,各家都说自己效果好,没法比。

远山 发表于 2026-9-17 18:56:17

我拿它跑过类似任务,前几版效果一般,调完提示词才像样。

半夏听雨 发表于 2026-9-17 18:58:16

有几个坑提醒下,接口一变整套流程都得跟着改,最好提前做抽象层。

南山 发表于 2026-9-17 19:01:32

这类需求本质是降本,所以定价天花板很容易算出来。

清和60 发表于 2026-9-17 19:05:08

关键还是数据质量,模型再强喂垃圾也是白搭。
页: [1] 2 3 4 5 6
查看完整版本: AI Agent自主执行任务到哪了:从Manus到AutoGPT实测