RAG技术演进:从Naive到Advanced

检索增强生成(RAG)自2023年诞生以来,已从简单的"检索-拼接-生成"范式演进为复杂的多阶段架构体系。2025-2026年,Production RAG的技术栈日趋成熟,涵盖数据预处理、嵌入模型、向量检索、重排序、上下文压缩与生成优化等关键环节。

向量数据库深度选型

从海量候选中筛选主流向量数据库的关键维度:

  • Qdrant:Rust实现的高性能向量数据库,支持Payload过滤与分布式部署,50-100ms延迟区间内可达数万QPS,适合中等规模生产环境
  • Milvus:Zilliz生态的分布式向量数据库,支持万亿级向量存储与距离计算,架构设计侧重高可用与水平扩展
  • Pinecone:全托管服务,零运维成本,适合快速原型开发与Serverless架构
  • Weaviate:内置向量izer与模块化的多模态检索支持,GraphQL API设计优雅
  • pgvector:基于PostgreSQL扩展的轻量级方案,适合已有PG生态且数据量在百万级以内的场景

选型核心考量:数据规模(百万/亿/十亿级)、部署模式(托管/自建)、过滤能力、多模态需求、成本模型。

Advanced RAG:分阶段优化策略

预处理阶段优化

数据分块策略直接影响检索质量。固定长度分块会导致语义断裂,基于语义的分块(Semantic Chunking)通过嵌入向量相似度检测边界,保持段落完整性。递归分块(Recursive Chunking)先按主题划分再细粒度切分,是实践中最稳定的方案。

加入父子文档结构:小块用于精确检索,匹配成功后返回给LLM的是完整的父文档片段,兼顾精度与上下文完整性。

检索阶段优化

混合检索(Hybrid Search)结合稠密向量检索(Dense Retrieval)与稀疏检索(Sparse Retrieval,如BM25),通过RRF(Reciprocal Rank Fusion)融合排序结果,在BEIR benchmark上平均提升5-10%的nDCG@10得分。

查询重写(Query Rewriting)利用LLM将用户原始查询扩展为多个子查询或假设性文档(Hypothetical Document Embeddings),提升召回率。

重排序与压缩阶段

Cross-Encoder重排序模型(如bge-reranker-large)对第一阶段检索的Top-K候选进行精确相关性打分,精度提升显著但延迟代价较高。

上下文压缩(LLM-based Compression)在检索结果送入LLM前,使用小型语言模型过滤无关段落,减少Token消耗与注意力噪声。

生成阶段优化

FLARE(Forward-Looking Active REtrieval)在生成过程中动态判断是否需要补充检索,避免"幻觉"问题的产生。Corrective RAG(CRAG)引入检索结果的可信度评估,对不可靠的内容触发网络检索兜底机制。

RAG评估指标与持续优化

核心评估框架:

  • RAGAS:评估Faithfulness(忠实性)、Answer Relevance(答案相关性)、Context Recall(上下文召回)、Context Precision(上下文精度)
  • ARES:基于LLM Few-shot的自动化评估方法
  • TruLens:端到端的RAG管道Observability监控工具

总结

2026年的RAG架构已进入"端到端优化"时代,每个环节的改进累积产生显著的质变效果。实践中建议从Naive RAG出发,逐阶段评估瓶颈,有针对性引入Advanced RAG组件,而非一次性堆叠所有优化。

点赞(0) 打赏

评论列表 共有 0 条评论

暂无评论
立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部