木子青柠
发表于 2026-9-17 21:01:09
我拿它跑过类似任务,前几版效果一般,调完提示词才像样。
林间
发表于 2026-9-17 21:02:46
评估标准不统一的话,各家都说自己效果好,没法比。
踏雪不眠
发表于 2026-9-17 21:04:16
这类任务最后往往还是人在兜底,模型只承担初筛。
清风34
发表于 2026-9-17 21:05:30
有几个坑提醒下,接口一变整套流程都得跟着改,最好提前做抽象层。
寒山散记
发表于 2026-9-17 21:07:02
合规问题比技术问题更棘手,很多场景卡在这一步。
慢半拍笔记
发表于 2026-9-17 21:08:15
最容易被忽略的是评估环节,没有好的评测集根本没法优化。