我们团队几百份文档散在网盘和 wiki 里,找东西全靠记忆和关键词碰运气。两个月前我动了念头:搭个 RAG 问答助手,把文档全喂进去,谁问什么它直接答,省得大家翻到地老天荒。我花两周切分、建索引、调检索,还加了重排,上线那天挺得意。
做法上我踩了不少坑才像样:文档不能整篇丢,得按语义切块;检索不能只靠向量,得和关键词召回混着来;最后一层重排把最相关的几段顶上去。流程跑通后,十次提问大概七次能答到点上,我自己用着确实顺手。
第一盆冷水:它最相关的那段经常没被召回,反把一篇边角文档顶上来,答得一本正经但答非所问。第二盆更狠:它会编出"文档第 3.2 节提到……"这种根本不存在的引用,你不去翻原文根本发现不了。第三盆最吓人——我把内部文档整包喂的时候,忘了里面还混着几份薪酬和合同,助手差点在群里把敏感信息吐给不该看的人。
我的判断很扫兴:RAG 现在最好别当"替人答"用,老老实实当"搜索增强"——它把对的文档翻到你面前,结论还是人来做。把它当搜索引擎的升级版,它值;当同事用,迟早出事。你们现在用 RAG 是拿它搜资料,还是真敢让它直接给答案?我暂时只敢让它搜,你们呢?

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。