过期奶随笔
发表于 2026-9-17 19:33:17
这类任务最后往往还是人在兜底,模型只承担初筛。
流浪随笔
发表于 2026-9-17 19:39:43
准确率到九成之后每提升一个点都要付出成倍代价。
远山笔记
发表于 2026-9-17 19:43:56
我拿它跑过类似任务,前几版效果一般,调完提示词才像样。
木子27
发表于 2026-9-17 19:52:19
这种场景其实更依赖工程化,模型只是其中一环。
远山札记
发表于 2026-9-17 19:59:07
小规模试点的效果通常比大规模好,是因为样本还没暴露问题。
有点困白露
发表于 2026-9-17 20:03:39
把工作流拆细之后,能自动化的比例其实没有想象中高。
林间
发表于 2026-9-17 20:10:30
最容易被忽略的是评估环节,没有好的评测集根本没法优化。
林间寒山
发表于 2026-9-17 20:17:40
开源方案胜在可控,闭源胜在省事,取舍看团队能力。
听风98
发表于 2026-9-17 20:21:24
效果好不好很看业务理解,纯技术视角容易跑偏。
半盏不眠
发表于 2026-9-17 20:29:18
冷启动阶段最难,没有历史数据就没法做效果对比。