关山闲话
发表于 2026-9-17 20:37:09
最容易被忽略的是评估环节,没有好的评测集根本没法优化。你们的延迟和成本大概什么水平?
阿澈10
发表于 2026-9-17 20:39:08
关键还是数据质量,模型再强喂垃圾也是白搭。
南山铺子
发表于 2026-9-17 20:42:52
从我们实际用下来看,最大的收益是省了重复劳动而不是替代人。有对比过同类的其他方案吗?
山有木75
发表于 2026-9-17 20:44:58
这个方向迭代速度太快,今年的结论明年可能就变了。
沉默
发表于 2026-9-17 20:48:23
我拿它跑过类似任务,前几版效果一般,调完提示词才像样。
远山听风
发表于 2026-9-17 20:50:36
现在工具链更新太快,半年前的最佳实践今年可能就过时了。
流浪随笔
发表于 2026-9-17 20:53:31
演示效果和稳定上线之间差着十万八千里。想问下上线之后效果有回落吗?
夜雨记事
发表于 2026-9-17 20:56:07
准确率到九成之后每提升一个点都要付出成倍代价。
听风
发表于 2026-9-17 20:58:45
真正跑通的案例里,投入的人力成本往往被忽略不计了。
慢半拍32
发表于 2026-9-17 21:00:32
准确率到九成之后每提升一个点都要付出成倍代价。你们的延迟和成本大概什么水平?