用Ollama+AnythingLLM三步搭好本地RAG知识库
为什么选这两个之前一直用Dify搭RAG,功能多但重,最近帮一家律所搭内部知识库,要求所有文档不能出本机,最后选了Ollama + AnythingLLM的组合,本地跑得飞快。把流程记一下。
[*]Ollama:本地模型运行时,支持GGUF量化模型
[*]AnythingLLM:开源的RAG前端,向量库内建,工作区概念清晰
三步流程
第一步装Ollama,去官网下Windows版安装包,装完命令行跑 ollama pull qwen3:8b 和 ollama pull bge-m3(嵌入模型)。8B模型在中配显卡上能跑,bge-m3中英文混合检索效果最稳。
第二步装AnythingLLM Desktop版,启动后在设置里选Ollama作为LLM provider,嵌入模型也选Ollama的bge-m3。向量库用默认的LanceDB就行,文档量不大不用上Chroma。
第三步建工作区(Workspace),把PDF、Word拖进去,它会自动切块、嵌入、入库。问问题的时候勾选对应工作区,回答就只基于这个工作区的文档。律所那边的反馈是,三万页合同库检索准确率比他们之前用的某商业产品还高。
几个调优点
切块策略上,AnythingLLM默认按段落切,遇到长合同建议手动改成固定500字符+50字符重叠。检索top-k默认4,中文长文档调到6-8更稳。如果回答老是说"未找到相关信息",多半是嵌入模型没切换到bge-m3,默认的all-MiniLM对中文不友好。
https://www.metk.cn/img/posts/rag_ollama_setup.jpg 感谢分享,正卡在这个问题上,你的经验省了我不少时间。 看得出来是真做过的人写的,不是那种拼资料的。 我之前也研究过这个方向,最后放弃了,主要是我这边数据量根本不够。 我觉得还有个变量是政策,这两年变化太快,方案得留调整余地。 这篇讲得比我之前看到的都实在,没那么多虚的,赞一个。 这个成本账算得很实在,我这边也是类似情况,量小的时候真没必要自己折腾。 我关注的另一个点是稳定性,出问题的时候排查链路比传统方案长不少,得有心理准备。 这篇看完最大的收获是那句"先算清楚自己的量",很多人上来就冲设备,最后闲置。 这个思路和我之前想的差不多,关键是别一次性铺太大,小步试错。