检索增强 RAG
向量库与 Embedding
Embedding通过编码器将文本压缩为高维稠密向量,实现语义相似度检索(余弦距离);稀疏向量如BM25用于关键词匹配。主流向量库选型需结合场景:Chroma适合中小原型,Weaviate支持原生混合检索(关键词+向量)与多租户隔离,Milvus面向大规模分布式生产,Pinecone提供免运维SaaS服务。性能优化依赖ANN算法(如HNSW),牺牲极小精度换指数级提速。实战中向量化耗时占90%,需预处理题干降维、去无关文本并异步更新。选型核心:Embedding优先中文优化模型,向量库按规模与运维能力匹配。
Recently Published
文章
检索增强 RAG
RAG 检索增强生成
RAG技术通过将外部知识库与LLM结合,有效缓解模型幻觉。其核心流程分为数据准备(采集、解析、智能分块、向量化)和查询响应(查询理解、混合检索、重排序、上下文构建、生成)。优化方向包括前检索(查询重写、多查询扩展)、中检索(混合检索、多路召回)和后检索(重排序、上下文压缩、拒答兜底)。分块策略推荐500字符/100重叠的滑动窗口,平衡语义完整与检索效率。表格和图片需经OCR或结构化处理后嵌入。混合检索融合向量语义与BM25关键词,RRF或加权归一化可融合排序。Rerank用Cross-Encoder模型精排候选结果。评估采用RAGAS框架的忠实度、答案相关性等指标。进阶范式中GraphRAG支持多跳推理,Self-RAG实现自主决策。工程落地需关注数据治理、检索加速(HNSW索引)和时效性管理。掌握RAG需从流程、优化到量化评估迭代,适配业务场景。
大模型工程
大模型调用与流式
① OpenAI 兼容接口(标准化,支持流式/FC,广泛支持)② LangChain 接口(ChatOpenAI 封装)③ HTTP 原生(httpx/requests)。所有模型可通过 OpenAI 兼容接口统一调用,切换只改 base_