SEO基础

SEO基础

Products

当前位置:首页 > SEO基础 >

RAG系统进化论:RAG发展史如何?

96SEO 2026-09-15 10:36 1


RAG 程序进化论:纵览 RAG 的发展历程

使用者痛点汇总

  • 为什么文档里明明有答案,程序却没有找到?
  • 找到了相似内容,模型还是回答错了?怎么说呢,
  • 产品型号、错误码和专有名词经常检索不到?怎么说呢,
  • 简单问题快。复杂问题却需要多次查询,
  • 知识库没有答案时模型仍然得很确定?
  • Demo 上效果好,换成真实数据后问题不断?

这些痛点是推动 RAG 不断演进的根本原因,也是这篇文章结构设计的出发点。

为什么要写这个系列?

关系。老实说,

刚开始接触向量检索时你会看到 BM25、Hybrid Search 和 RRF;继续往下你会遇到 Reranker、Query Rewrite、GraphRAG、Self-RAG 和 Agentic RAG。

如果只是按名词堆砌,很容易得到一张长长的技术清单。却不清楚:

  • 为什么需要这项技术,它到底解决了什么痛点?

本系列以“阶段+痛点+技术+效果”四大维度展开,让你快速定位每一次升级背后的业务价值。

RAG 到底解决了什么问题?

大中把语言规律和部分世界知识嵌入参数,但面临以下天然限制:

  • 公司制度与内部文档缺失;新知识无法实时更新,单条事实难以单独修改;缺乏证据时易生成听起来合理但错误的答案;难以追踪答案来源,

主要痛点:模型无法随时获取最新公司知识,也无法证明其回答来自何处。

普通生成:问题 → 大模型 → 答案 RAG这方面,问题 → 检索证据 → 将证据加入上下文 → 大模型 → 答案

RAG 的三大动作:

  • Retrieval: 寻找相关证据。不过,
  • Augmented: 把检索结果注入上下文。
  • Generation: 基于证据组织答案。

RAG 为什么会不断演进?

Dora 曾说:把大模型比作开卷考试。即使带上书,也可能答错,说到程序需要决定,

  • “去哪里查?”)
  • “用什么方式查?”)
  • “怎样判断找到的是正确证据?”)
  • “资料不足时是否继续查?”)
  • 关系?”)
  • “什么时候停止并拒绝回答?”)

Coding & Retrieval are just first steps.

主要发展阶段概览

传统信息检索 – “只会找到文件”

  • -倒排索引 -TF-IDF -BM25 -分词器与文本分析器 -Retriever + Reader -稠密向量检索
  • 第一阶段这方面。Naive Rag – 基础闭环

    Load ➜ Split ➜ Embed ➜ Store ➜ Retrieve ➜ Augment ➜ Generate
    
     
    从主要目标来看,让模型能读取私有知识而不重新训练。但 Naïve Rag 存在多处盲区:
    • 语义相似并不等同于能回答——切块可能破坏语义完整性。怎么说呢,
    • 向量检索对编号类数据不敏感——精确匹配难实现。
    • 固定 Top‑K 导致无关内容混入。
    • 无答案时仍返回最相似片段。

      第二阶段的观点是,Advanced Rag – 精准检索提高全流程质量

      检索前
      结构化切块 / 语义切块 / Parent‑Child Retrieval / Metadata / Query Rewrite
      检索中
      BM25 + Dense Retrieval + Metadata Filter + Hybrid Search 从中文例子来看。Elasticsearch + IK + BM25 → Embedding + Vector Search → 融合
      检索后
      MMR + Re‑ranker + 去重 + Context Compression Advanced Rag 的真正价值是:“**从** *近似相似* **变成** *真正支持答案*。说起来,” 但流水线统一化也带来了新的瓶颈——所有请求都走同一条方法。

      说到第三阶段,Modular Rag – 路由化流程匹配需求

      简单问答可直接向量库。订单查询需调用业务 API,统计分析适合 SQL 查询。模块拆分这方面,Router / Conditional Routing / Multi‑source Retrieval / Parallel Retrieval / Result Fusion / Tool Calling / State & Workflow Orchestration 代码示例这方面。ts const route = classify; const evidence = await retrieveByRoute;const answer = await generate;

      痛点这方面。

      • 动态路由仍可能返回错误或不完整证据,需要进一步验证。老实说,

      从第四阶段来看,Corrective / Self‑rag – 自动检查与纠错

      从关键技术来看,

      文档相关性判断 | Evidence Sufficiency | Query Rewrite | Re‑search | External Search fallback | Answer Grounding | No‑answer Detection | Self‑Reflection

      说到逻辑示例。

      text Retrieve -> Check relevance -> If not relevant => Rewrite & Re‑search If insufficient => Continue searching or refuse If sufficient => Generate & Validate answer

      从痛点来看,

      • 验证步骤增加延迟和成本;
      • 多轮循环可能累积错误;老实说,
      • 单块文本虽正确。但缺乏跨实体关系,

      至于第五阶段。Graph rag – 理解跨文档关系

      从文本抽取实体/关系建立图谱,再做图遍历/社区发现/摘要。

      组合示例的观点是,

      text Vector search → Text retrieval Graph search → Entity relation & multi‑hop paths

      从痛点来看。

      • 图谱维护成本高;
      • 对简单事实问答无比较大的优势。

      从第六阶段来看,Multimodal rag – 文本之外的数据支持

      OCR | Layout-aware Parsing | Table Extraction | Image Captioning | Multimodal Embedding | text Page screenshot retrieval -> Vision Language Model -> Region-level citation

      再看痛点。

      • 多模态解析成本高;
      • 决策先查哪种数据源更复杂。

      从第七阶段来看。Agentic rag – 自主多步推理

      Planner + Tool Selection + Multi-step Retrieval + Memory + Checkpointing + Human-in--loop + Budget Control 等,实现开放式任务自组织。

      至于流程示例,

      text Understand goal -> Plan -> Select tool -> Get evidence -> Update plan ...

      痛点这方面。

      • 行为不可预测;

        * 成本和延迟显著上升。

      再看第八阶段,评测与可观测性 — 用数据验证改进

      指标类别 示例指标
      检索 Recall@K,Precision@K,MRR,nDCG
      生成 Correctness,Faithfulness。Answer Relevance
      引用 Citation Accuracy
      拒答 No-answer Accuracy

      再看可观测性要素,

      Trace ↔ Span ↔ Dataset ↔ Experiment ↔ User Feedback ↔ Failure Taxonomy ↔ Latency/Tokens/Costs.

      工具如 LangSmith 可帮助记录调用链并管理实验集。


      第九阶段的观点是,可运营 rag — 长期使用较稳定运行

      从关键环节来看,

      1️⃣ 数据治理 — 增量索引/删除/质量检查/版本管理 2️⃣ 权限安全 — 身份认证・Document ACL・多租户隔离・Prompt Injection 防护 3️⃣ 成本控制 — 缓存・超时・重试・限流·Token 与步骤预算 4️⃣ 发布迭代 — Prompt/model/index version 管理·灰度发布·回滚·线上失败样本反馈至评测集

      至于闭环示意。

      text Data update → Index build → Offline eval → Gradual release → Online monitoring → Collect failures → Update eval set & system


      小结 —— 更复杂不一定更好

      • 若知识量小,可直接使用 Naïve Rag。
      • 产品型号/错误码多,可先加 BM25 或 Hybrid Search。
      • 跨文档关系明显,则 Graph‐rag 必须考虑。
      • 多步骤、多工具协作需求才适合 Agentic Rag。说起来,

      判断是否升级。应先确认:

      1. 当前程序在哪些痛点失效?
      2. 新技术是否针对这些痛点?老实说,
      3. 引入的新复杂度与成本是否值得?
      4. 是否能改进?

      我们始终遵循“先找痛点,再加技术”的原则。


      从下一篇预告来看,《从 Naïve Rag 开始》——深入最小闭环细节

      主要说明的观点是。

      1. “检索提高生成”为何把检索放在首位。
      2. Chunk / Embedding / Vector Store / Top-K 各自解决的问题。
      3. 如何把证据有效融入 Prompt。说起来,
      4. Naïve Rag 常见瓶颈及其后续调整方向。

      理解最小闭环后你才能真正看懂混合检索、查询调整等高级方案为何存在还有它们分别解决哪些痛点。


标签: 进化论

SEO优化服务概述

作为专业的SEO优化服务提供商,我们致力于通过科学、系统的搜索引擎优化策略,帮助企业在百度、Google等搜索引擎中获得更高的排名和流量。我们的服务涵盖网站结构优化、内容优化、技术SEO和链接建设等多个维度。

百度官方合作伙伴 白帽SEO技术 数据驱动优化 效果长期稳定

SEO优化核心服务

网站技术SEO

  • 网站结构优化 - 提升网站爬虫可访问性
  • 页面速度优化 - 缩短加载时间,提高用户体验
  • 移动端适配 - 确保移动设备友好性
  • HTTPS安全协议 - 提升网站安全性与信任度
  • 结构化数据标记 - 增强搜索结果显示效果

内容优化服务

  • 关键词研究与布局 - 精准定位目标关键词
  • 高质量内容创作 - 原创、专业、有价值的内容
  • Meta标签优化 - 提升点击率和相关性
  • 内容更新策略 - 保持网站内容新鲜度
  • 多媒体内容优化 - 图片、视频SEO优化

外链建设策略

  • 高质量外链获取 - 权威网站链接建设
  • 品牌提及监控 - 追踪品牌在线曝光
  • 行业目录提交 - 提升网站基础权威
  • 社交媒体整合 - 增强内容传播力
  • 链接质量分析 - 避免低质量链接风险

SEO服务方案对比

服务项目 基础套餐 标准套餐 高级定制
关键词优化数量 10-20个核心词 30-50个核心词+长尾词 80-150个全方位覆盖
内容优化 基础页面优化 全站内容优化+每月5篇原创 个性化内容策略+每月15篇原创
技术SEO 基本技术检查 全面技术优化+移动适配 深度技术重构+性能优化
外链建设 每月5-10条 每月20-30条高质量外链 每月50+条多渠道外链
数据报告 月度基础报告 双周详细报告+分析 每周深度报告+策略调整
效果保障 3-6个月见效 2-4个月见效 1-3个月快速见效

SEO优化实施流程

我们的SEO优化服务遵循科学严谨的流程,确保每一步都基于数据分析和行业最佳实践:

1

网站诊断分析

全面检测网站技术问题、内容质量、竞争对手情况,制定个性化优化方案。

2

关键词策略制定

基于用户搜索意图和商业目标,制定全面的关键词矩阵和布局策略。

3

技术优化实施

解决网站技术问题,优化网站结构,提升页面速度和移动端体验。

4

内容优化建设

创作高质量原创内容,优化现有页面,建立内容更新机制。

5

外链建设推广

获取高质量外部链接,建立品牌在线影响力,提升网站权威度。

6

数据监控调整

持续监控排名、流量和转化数据,根据效果调整优化策略。

SEO优化常见问题

SEO优化一般需要多长时间才能看到效果?
SEO是一个渐进的过程,通常需要3-6个月才能看到明显效果。具体时间取决于网站现状、竞争程度和优化强度。我们的标准套餐一般在2-4个月内开始显现效果,高级定制方案可能在1-3个月内就能看到初步成果。
你们使用白帽SEO技术还是黑帽技术?
我们始终坚持使用白帽SEO技术,遵循搜索引擎的官方指南。我们的优化策略注重长期效果和可持续性,绝不使用任何可能导致网站被惩罚的违规手段。作为百度官方合作伙伴,我们承诺提供安全、合规的SEO服务。
SEO优化后效果能持续多久?
通过我们的白帽SEO策略获得的排名和流量具有长期稳定性。一旦网站达到理想排名,只需适当的维护和更新,效果可以持续数年。我们提供优化后维护服务,确保您的网站长期保持竞争优势。
你们提供SEO优化效果保障吗?
我们提供基于数据的SEO效果承诺。根据服务套餐不同,我们承诺在约定时间内将核心关键词优化到指定排名位置,或实现约定的自然流量增长目标。所有承诺都会在服务合同中明确约定,并提供详细的KPI衡量标准。

SEO优化效果数据

基于我们服务的客户数据统计,平均优化效果如下:

+85%
自然搜索流量提升
+120%
关键词排名数量
+60%
网站转化率提升
3-6月
平均见效周期

行业案例 - 制造业

  • 优化前:日均自然流量120,核心词无排名
  • 优化6个月后:日均自然流量950,15个核心词首页排名
  • 效果提升:流量增长692%,询盘量增加320%

行业案例 - 电商

  • 优化前:月均自然订单50单,转化率1.2%
  • 优化4个月后:月均自然订单210单,转化率2.8%
  • 效果提升:订单增长320%,转化率提升133%

行业案例 - 教育

  • 优化前:月均咨询量35个,主要依赖付费广告
  • 优化5个月后:月均咨询量180个,自然流量占比65%
  • 效果提升:咨询量增长414%,营销成本降低57%

为什么选择我们的SEO服务

专业团队

  • 10年以上SEO经验专家带队
  • 百度、Google认证工程师
  • 内容创作、技术开发、数据分析多领域团队
  • 持续培训保持技术领先

数据驱动

  • 自主研发SEO分析工具
  • 实时排名监控系统
  • 竞争对手深度分析
  • 效果可视化报告

透明合作

  • 清晰的服务内容和价格
  • 定期进展汇报和沟通
  • 效果数据实时可查
  • 灵活的合同条款

我们的SEO服务理念

我们坚信,真正的SEO优化不仅仅是追求排名,而是通过提供优质内容、优化用户体验、建立网站权威,最终实现可持续的业务增长。我们的目标是与客户建立长期合作关系,共同成长。

提交需求或反馈

Demand feedback