news 2026/8/23 4:46:01

RAG 入门 学习路径

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
RAG 入门 学习路径

文章目录

  • RAG 检索与排序 必补知识体系(从核心到细节)
    • 1 级:RAG 整体架构(必须最先掌握)
      • 1.1 RAG 基本流程
      • 1.2 两大核心阶段
    • 2 级:文档预处理与分块(Chunking)
      • 2.1 为什么要分块
      • 2.2 常见分块策略
      • 2.3 关键参数
    • 3 级:向量化(Embedding)
      • 3.1 向量模型原理
      • 3.2 向量模型选型
      • 3.3 相似度计算
    • 4 级:召回检索(Retrieval)
      • 4.1 检索类型
      • 4.2 向量检索核心
      • 4.3 主流索引结构
      • 4.4 向量库/工具
      • 4.5 召回参数
    • 5 级:重排序(Rerank)
      • 5.1 为什么需要 Rerank
      • 5.2 重排序模型
      • 5.3 重排流程
      • 5.4 评估指标
    • 6 级:RAG 优化与工程落地(面试加分项)
      • 6.1 检索效果优化
      • 6.2 常见问题解决
      • 6.3 系统性能
    • 7 级:RAG 评估(面试官必问)
      • 7.1 离线评估
      • 7.2 在线评估
    • 8 级:进阶方向(拔高用)
      • 8.1 知识图谱 + RAG(GraphRAG)
      • 8.2 多轮对话 RAG
      • 8.3 自适应检索 / 动态召回
      • 8.4 RAG + 微调

我给你整理一套RAG 检索&排序最硬核、面试必问的知识体系,严格按1级→2级→3级层级,你从顶层往细节啃就行。

RAG 检索与排序 必补知识体系(从核心到细节)

1 级:RAG 整体架构(必须最先掌握)

1.1 RAG 基本流程

  • 文档预处理 → 分块 → 向量化 → 建库 → 用户查询 → 检索 → 重排序 → 大模型生成

1.2 两大核心阶段

  • 召回阶段(Retrieval)
  • 重排序阶段(Rerank)

2 级:文档预处理与分块(Chunking)

2.1 为什么要分块

  • 上下文长度限制
  • 语义完整性
  • 检索精度与召回率平衡

2.2 常见分块策略

  • 固定长度分块
  • 按句子/段落分块
  • 按标题层级分块
  • 基于语义的分块(语义相似聚类)

2.3 关键参数

  • Chunk 大小
  • Overlap 重叠长度
  • 分隔符规则

3 级:向量化(Embedding)

3.1 向量模型原理

  • 稠密向量表示
  • 语义相似度计算

3.2 向量模型选型

  • 通用 Embedding 模型
  • 垂直领域微调模型
  • 长短文本适配

3.3 相似度计算

  • 余弦相似度
  • 内积
  • 欧氏距离

4 级:召回检索(Retrieval)

4.1 检索类型

  • 稀疏检索(关键词匹配)
    • BM25
    • TF-IDF
  • 稠密检索(向量检索)
    • 基于 Embedding 的语义匹配
  • 混合检索(最常用)
    • 稀疏 + 稠密多路召回

4.2 向量检索核心

  • 近似最近邻搜索(ANN)
  • 暴力检索 vs 近似检索

4.3 主流索引结构

  • HNSW
  • IVF
  • PQ 量化

4.4 向量库/工具

  • FAISS
  • Milvus / Qdrant / Chroma 等

4.5 召回参数

  • topK 召回数量
  • 召回策略

5 级:重排序(Rerank)

5.1 为什么需要 Rerank

  • 召回粗排 → 重排精排
  • 提升相关性与答案质量

5.2 重排序模型

  • Cross-Encoder 交叉编码器
  • 双向语义匹配

5.3 重排流程

  • 召回结果输入 → 打分排序 → 取 topN

5.4 评估指标

  • MRR
  • Recall@k
  • Precision@k
  • NDCG

6 级:RAG 优化与工程落地(面试加分项)

6.1 检索效果优化

  • 分块策略优化
  • 向量模型微调
  • 多路召回融合
  • 重排序阈值调整

6.2 常见问题解决

  • 检索不相关
  • 语义漂移
  • 长文档丢失信息
  • 关键词漏召回

6.3 系统性能

  • 检索速度
  • 并发能力
  • 内存/索引大小

7 级:RAG 评估(面试官必问)

7.1 离线评估

  • 召回率、精确率
  • MRR、NDCG

7.2 在线评估

  • 答案准确率
  • hallucination 减少程度
  • 用户满意度

8 级:进阶方向(拔高用)

8.1 知识图谱 + RAG(GraphRAG)

8.2 多轮对话 RAG

8.3 自适应检索 / 动态召回

8.4 RAG + 微调


如果你需要,我可以把每一级整理成「面试必背 3 句话」,你直接背就能应对 90% RAG 检索面试。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/23 4:44:41

Hunyuan-MT-7B模型安全审计与合规性检查指南

Hunyuan-MT-7B模型安全审计与合规性检查指南 1. 引言 在AI模型快速发展的今天,安全审计和合规性检查已经成为模型部署不可或缺的一环。Hunyuan-MT-7B作为腾讯推出的优秀翻译模型,支持33种语言互译,在实际应用中需要特别关注数据隐私、内容安…

作者头像 李华
网站建设 2026/7/14 16:42:48

ShadowDOM实战:用Selenium+JavaScript破解shadow-root元素定位难题

ShadowDOM实战:用SeleniumJavaScript破解shadow-root元素定位难题 现代前端开发中,ShadowDOM技术正变得越来越普遍。这种封装机制为组件化开发带来了便利,却给自动化测试工程师带来了新的挑战。本文将深入剖析ShadowDOM的工作原理&#xff0c…

作者头像 李华
网站建设 2026/7/14 16:42:47

Qwen2.5-VL多模态教程:Ollama部署后支持SVG/PDF矢量图理解

Qwen2.5-VL多模态教程:Ollama部署后支持SVG/PDF矢量图理解 1. 快速了解Qwen2.5-VL的强大能力 Qwen2.5-VL是Qwen家族的最新视觉-语言模型,经过五个月的精心打磨,在Qwen2-VL基础上实现了显著提升。这个模型不仅能看懂图片,还能理解…

作者头像 李华
网站建设 2026/7/14 16:42:51

CosyVoice2-0.5B部署教程:Mac M2/M3芯片原生运行与Metal加速配置

CosyVoice2-0.5B部署教程:Mac M2/M3芯片原生运行与Metal加速配置 1. 学习目标与前置准备 想不想在Mac电脑上,用几秒钟时间就克隆出任何人的声音?无论是给视频配音、制作有声书,还是创造个性化的语音助手,阿里开源的C…

作者头像 李华
网站建设 2026/7/14 16:42:52

构建CI/CD流水线:自动化测试与部署DeOldify模型更新

构建CI/CD流水线:自动化测试与部署DeOldify模型更新 每次给DeOldify模型加个新功能或者修复个bug,你是不是都得手动跑一遍测试,再吭哧吭哧地打包镜像,最后登录服务器去部署?这套流程走下来,半天时间就没了…

作者头像 李华
网站建设 2026/7/14 16:43:04

StructBERT中文语义工具教程:与Elasticsearch语义检索集成

StructBERT中文语义工具教程:与Elasticsearch语义检索集成 1. 项目概述 StructBERT中文语义智能匹配系统是一个基于先进孪生网络模型的本地化部署工具,专门解决中文文本处理中的核心难题。这个系统使用字节跳动生态下的iic/nlp_structbert_siamese-uni…

作者头像 李华