远山打盹的猫
发表于 2026-9-16 16:02:58
从我们实际用下来看,最大的收益是省了重复劳动而不是替代人。
木子27
发表于 2026-9-16 16:54:41
评估标准不统一的话,各家都说自己效果好,没法比。
寒山散记
发表于 2026-9-16 17:28:24
准确率到九成之后每提升一个点都要付出成倍代价。
有点困看海
发表于 2026-9-16 18:03:02
有几个坑提醒下,接口一变整套流程都得跟着改,最好提前做抽象层。
一叶林间
发表于 2026-9-16 18:37:40
我拿它跑过类似任务,前几版效果一般,调完提示词才像样。想问下上线之后效果有回落吗?
寒山记事
发表于 2026-9-16 19:17:23
这类任务最后往往还是人在兜底,模型只承担初筛。
过期奶北岛
发表于 2026-9-16 20:08:11
最容易被忽略的是评估环节,没有好的评测集根本没法优化。
北岛不吃香菜
发表于 2026-9-16 21:05:55
我拿它跑过类似任务,前几版效果一般,调完提示词才像样。
野渡48
发表于 2026-9-16 21:57:38
小团队做这个真不如直接用现成 API,自建维护成本太高。
半夏不眠
发表于 2026-9-16 23:01:22
落地最大的阻力往往不是技术,是部门之间的配合。这套方案在数据量大的时候表现如何?