RAG(Retrieval-Augmented Generation,检索增强生成) 是一种让大语言模型(LLM)在回答问题时,先去外部知识库检索相关信息,再组织答案的技术架构。

一句话总结:给大模型装了一个"知识外挂"

基本架构

用户提问 → [Retrieval 检索] → 外部知识库 → 拼装到 Prompt → [Generation 生成] → 回答
  • Retrieval(检索):把用户问题向量化,去知识库做语义相似度匹配,取回最相关的若干片段(chunks)
  • Generation(生成):把检索到的内容拼进 Prompt,让 LLM 基于"被喂进来的真实资料"作答

(详细流程见 RAG运转流程

RAG 解决的三类核心问题

LLM 自身存在三个结构性短板,RAG 是当下最主流的缓解方案:

问题 含义 RAG 的解法
截断 知识时效性:模型训练数据有截止日期,最新的事不知道 把最新资料放进知识库,检索时即时取用
未知 私有数据:企业内部文档、个人资料模型从未见过 把私有数据向量化入库,专属可查
幻觉 模型幻觉:在不知道答案时倾向于"自信地编" 用检索到的真实资料约束生成,让模型有据可依

常见落地场景

场景 典型形态 知识库来源
智能客服 基于 FAQ、售后政策、产品手册的自动答疑 客服历史、产品文档、政策条款
企业知识管理 接入 Confluence、飞书、PDF、Word,建成统一 AI 知识库 企业内部文档系统
教育培训 把讲义、课件、题库、视频字幕构建为学习助手 课程资料、习题、答疑记录
医疗辅助与智能诊断 整合医学文献、临床指南、电子病历,辅助医生诊断决策 文献库、指南、患者数据

医疗场景对 RAG 的"有据可查"特性尤其关键 —— 不能幻觉、必须可追溯。

与原生 LLM 的关系

RAG 不修改模型本身,是在推理时通过 Prompt 注入外部知识。这让它具备:

  • 快速更新:知识库换一份内容,模型行为立刻跟着变,不用重新训练
  • 成本低:相比微调(Fine-tuning)便宜得多
  • 可追溯:每条回答可以引用检索到的原文出处

代价是:检索质量直接决定回答质量,"垃圾进、垃圾出"在 RAG 里同样适用。

PM 怎么用 / 何时用

  • 当需求涉及"答最新的事、答企业私有资料、不能幻觉"时,对照截断/未知/幻觉三类问题,判断是否该上 RAG 而非微调。
  • 方案设计时,先确认知识库来源(客服历史/企业文档/课件/文献),再定场景形态——知识库决定了产品能答什么。
  • 验收回答质量出问题时,先查检索质量("垃圾进垃圾出"),别急着归因到模型。

相关页面

RAG运转流程六大成熟AI应用场景大模型预训练AI工程集成RAG落地操作指南(可执行版) → AIPM课程 Day6