向量库与 Embedding 检索增强 RAG
阅读 6 评论 0 点赞 0

向量库与 Embedding

Embedding通过编码器将文本压缩为高维稠密向量,实现语义相似度检索(余弦距离);稀疏向量如BM25用于关键词匹配。主流向量库选型需结合场景:Chroma适合中小原型,Weaviate支持原生混合检索(关键词+向量)与多租户隔离,Milvus面向大规模分布式生产,Pinecone提供免运维SaaS服务。性能优化依赖ANN算法(如HNSW),牺牲极小精度换指数级提速。实战中向量化耗时占90%,需预处理题干降维、去无关文本并异步更新。选型核心:Embedding优先中文优化模型,向量库按规模与运维能力匹配。

#向量库#Embedding#语义检索
RAG 检索增强生成 检索增强 RAG
阅读 4 评论 0 点赞 0

RAG 检索增强生成

RAG技术通过将外部知识库与LLM结合,有效缓解模型幻觉。其核心流程分为数据准备(采集、解析、智能分块、向量化)和查询响应(查询理解、混合检索、重排序、上下文构建、生成)。优化方向包括前检索(查询重写、多查询扩展)、中检索(混合检索、多路召回)和后检索(重排序、上下文压缩、拒答兜底)。分块策略推荐500字符/100重叠的滑动窗口,平衡语义完整与检索效率。表格和图片需经OCR或结构化处理后嵌入。混合检索融合向量语义与BM25关键词,RRF或加权归一化可融合排序。Rerank用Cross-Encoder模型精排候选结果。评估采用RAGAS框架的忠实度、答案相关性等指标。进阶范式中GraphRAG支持多跳推理,Self-RAG实现自主决策。工程落地需关注数据治理、检索加速(HNSW索引)和时效性管理。掌握RAG需从流程、优化到量化评估迭代,适配业务场景。

#RAG#检索增强#向量检索