打盹的猫杂谈
发表于 2026-9-17 19:10:19
准确率到九成之后每提升一个点都要付出成倍代价。
旧巷69
发表于 2026-9-17 19:13:30
我拿它跑过类似任务,前几版效果一般,调完提示词才像样。
寒山散记
发表于 2026-9-17 19:17:10
我比较看好垂直领域的做法,通用方案竞争太激烈。有没有踩过什么比较大的坑?
微光不太冷
发表于 2026-9-17 19:21:24
真正的成本在维护,模型换代太快,跟进要持续投人。
关山闲话
发表于 2026-9-17 19:25:04
小团队做这个真不如直接用现成 API,自建维护成本太高。
老猫笔记
发表于 2026-9-17 19:28:58
开源方案胜在可控,闭源胜在省事,取舍看团队能力。
过期奶北岛
发表于 2026-9-17 19:33:14
评估标准不统一的话,各家都说自己效果好,没法比。
一苇
发表于 2026-9-17 19:37:06
最容易被忽略的是评估环节,没有好的评测集根本没法优化。
北岛不吃香菜
发表于 2026-9-17 19:40:13
演示效果和稳定上线之间差着十万八千里。
寒山
发表于 2026-9-17 19:43:56
提示词工程能解决一部分,但解决不了根本的领域知识问题。这套方案在数据量大的时候表现如何?