前言
RAG(检索增强生成)是大模型落地企业知识库的主流方案。本文分享 2026 年 RAG 工程实践经验。
一、RAG 的四个阶段
1. 索引阶段:文档切分、向量化、入库。
2. 检索阶段:query 向量化,相似度检索 top-K。
3. 重排阶段:用 cross-encoder 对 top-K 重排,提升相关性。
4. 生成阶段:将上下文拼入 prompt,调用大模型生成回答。
二、切分策略
推荐按语义切分(如 markdown 标题、段落),chunk 大小 500-800 字符,重叠 100 字符。
三、向量库选型
Milvus 适合大规模(亿级),Qdrant 适合中等规模(千万级),pgvector 适合小规模(百万级)。
四、重排的重要性
不重排的 RAG 准确率约 60%,重排后可达 85%。推荐使用 bge-reranker-large。
五、Prompt 工程
关键技巧:明确指出"无法回答时请说不知道",避免大模型胡编乱造。
六、生产部署
1. 索引与查询分离
2. 缓存高频 query 的结果
3. 监控召回率与生成质量
总结
RAG 不是简单的拼接,而是系统工程。每个环节的优化都能带来质量提升。