RAGFlow 学习地图:官方文档 112 篇导航与阅读顺序

RAGFlow封面

RAGFlow 是 InfiniFlow 团队开源的 RAG(Retrieval-Augmented Generation,检索增强生成)引擎。它擅长的正是 RAG 里最费劲的一环——深度文档理解:把 PDF、Word、Excel、PPT、图片扫描件这类版式复杂的文档解析出来、切成合适的块、配上引用,让大模型回答问题时有据可依,少说瞎话。围绕这条主线,它长成了一台完整的机器:数据集与分块模板、对话助手、Agent 画布、摄取管道、记忆、团队权限,外加一整套 HTTP/Python API。

官方文档(ragflow.io/docs)写得相当细,但有两个门槛:全英文,而且体量惊人——七大板块 110 多页,从 30 秒能读完的小页到 231KB 的 API 巨页都有,从首页进去容易迷路。这篇文章把官方文档 2026-09-16 快照(对应 v0.27.x 时期) 的全部 112 篇收齐并精翻成中文:每篇给出中文译名(点击直达英文原文)和一句话说明——这篇讲什么、什么时候需要读。

阅读方式:点击任意条目,会从右侧滑出双栏浮层——左边英文原文、右边中文译文,逐段水平对齐,带目录和上/下一篇导航,可以直接顺着读下去。三篇长页——HTTP API(231KB)、Python API(73KB)、更新日志(79KB)——各拆成了若干部分,拆分条目在清单里标注了(一)(二)……拆开后内容一篇不少。

不必从头读到尾。可以先扫一遍分组找到自己关心的部分,或者直接跳到文末的建议阅读顺序按路线走。

一、快速开始(1 篇)

1. 快速开始

从 Docker 启动服务、配模型、建数据集、解析文件到跑起第一场对话的完整走场。硬件门槛(4 核/16GB/50GB 磁盘)、vm.max_map_count 这类必踩的坑都在这一页。第一次接触 RAGFlow 只读它就够了。

二、基础概念(2 篇)

这一组回答「RAGFlow 眼里的世界是什么样的」。

2. RAG 是什么?

RAGFlow 的 RAG 观点文:为什么检索增强是大模型落地的关键路径,RAGFlow 在解析、分块、检索、生成这条链路上的取舍。理解了它,后面所有功能文档都有了主线。

3. Agent 上下文引擎是什么?

RAGFlow 的另一条腿:不只做「检索后回答」,而是把检索变成可编排的上下文供给,给 Agent 画布上的工作流喂料。这篇讲清 Agent 与 RAG 的关系。

三、功能指南(82 篇)

官方 Guides 板块,按功能域分成 11 组。RAGFlow 的主体用法都在这里。

数据集(11 篇)

数据集(dataset,旧称 knowledge base)是 RAGFlow 的地基:文档进来、切块、索引、被检索,全发生在这里。

4. 数据集概览

数据集是什么、能干什么:上传文件、解析分块、维护元数据、验证召回,再被对话/搜索/Agent 消费。整个数据集板块的导读页。

5. 数据集列表与创建

列表页的信息含义与新建数据集的入口操作。

6. 数据集配置

数据集的心脏:选嵌入模型(选定后不可换)、选分块模板(chunk template)。RAGFlow 按文档形态提供了多种模板——通用/法律/书籍/论文/简历/图片/表格等,这篇附完整参数表。

7. 文件:数据集文档管理

数据集里的文件怎么管:上传、解析状态、批量操作。

8. 检索测试

建好数据集后先别急着开对话——用检索测试直接提问,看召回的块和相关度分数,判断分块模板与参数是否调对了。调优 RAGFlow 的核心工作台。

9. 分块:解析结果与知识片段管理

RAGFlow 的招牌能力「可视化干预」:查看每个块的原文快照,手动改块文字、加关键词、添问题,直接提升该块的召回排名。

10. 元数据管理

给数据集/文档打自定义元数据字段,检索时可作过滤条件。

11. 日志

数据集的解析与操作日志在哪看、看什么。

12. 注意事项与常见问题

数据集板块的 FAQ 汇总:解析卡住、召回不理想这类高频问题。

13. 知识工件生成与管理

从数据集生成「知识工件」——把沉淀的知识整理成可复用的产物。

14. 最佳实践:加速索引

大批量文档入库太慢怎么办:任务并发、批量开关与硬件配置的取舍。

文件(4 篇)

文件板块是「还没进数据集的原料区」:先上传到文件库,再按需关联到数据集。

15. 文件与文件夹

文件库总览:文件夹组织、与数据集的关系。

16. 文件操作

重命名、移动、预览等单文件操作。

17. 批量移动与删除

多选文件批量整理。

18. 关联知识库

把文件库里的文件挂到数据集(知识库)触发解析——文件板块与数据集板块的接缝。

数据源(4 篇)

数据源让 RAGFlow 不止「等你上传」:直连网盘与代码仓库,增量同步进知识库。

19. 数据源概览与页面管理

数据源功能版图与列表页管理。

20. 数据源分类与选择

支持哪些外部数据源、各自适合什么场景。

21. 数据源配置

全板块最厚的一篇:GitHub、Google Drive、SharePoint、Box、Dropbox 等每个数据源的权限要求、OAuth/凭证配置和同步参数,逐个手把手。接入哪个翻哪节。

22. 加入知识库并同步

配好的数据源如何挂进知识库、增量同步与删除同步的行为。

对话(4 篇)

对话助手是面向终端用户的问答界面。

23. 功能概览与创建

对话助手是什么、怎么新建一个。

24. 对话配置

对话的参数面板:选模型、绑数据集、Empty response(检索不到时是拒答还是自由发挥)、System prompt、引用展示等。把「有据可依」调到位的关键一篇。

25. 使用对话会话

会话管理:多轮对话、引用溯源、点赞反馈。

26. 多模型对比

同一问题让多个模型同台作答对比效果。

对话渠道(4 篇)

把 RAGFlow 对话助手作为服务发布到 IM 渠道(Slack、微信等)。

27. 对话渠道概览

渠道功能是什么、支持哪些平台。

28. 渠道接入与配置

各渠道的接入步骤与凭证配置,按平台分节。

29. 连接对话渠道

渠道与具体对话助手的绑定关系。

30. 对话渠道常见问题

渠道接入的踩坑记录。

搜索(3 端)

不做对话、只要搜索框?RAGFlow 也能当内网搜索引擎用。

31. 创建搜索

新建一个搜索应用。

32. 搜索设置

搜索范围、相似度阈值、结果展示等设置。

33. 搜索常见问题

搜索板块 FAQ。

Agent 与工作流(18 篇)

Agent 是 RAGFlow 从「问答机器」迈向「任务机器」的部分:在画布上拖组件、连线,编排检索、推理、工具调用。

Agent(5 篇)

34. Agent 概览

Agent 能做什么、与其他功能的关系,进入画布前的必读页。

35. Agent 的创建与管理

新建、复制、删除 Agent 的入口操作。

36. 理解画布

画布的交互模型:组件、连线、变量在节点间的流动。看懂画布,后面所有组件文档才有意义。

37. 导入与导出 Agent

Agent 以 DSL 文件形式导入导出,团队复用与版本管理。

38. 嵌入网页

把做好的 Agent 以 iframe/脚本嵌到自己的网站。

Agent 工作流组件(5 篇)

39. 流程组件

工作流组件的四大类(流程/对话/基础/数据操作/工具)总览与分类逻辑。

40. 对话组件

面向交互的组件:聊天框、提问、表单类输入。

41. 基础组件

画布的通用件:开始/结束、Agent 节点、消息、开关、变量赋值等。

42. 数据操作组件

对数据做加工的组件:分类、提取、模板填充、代码执行、HTTP 请求等。

43. 工具组件

最厚的一组:检索、网页搜索、数据库查询、邮件、各类第三方工具组件的逐个用法手册。

摄取管道(8 篇)

摄取管道(ingestion pipeline)是「用画布的方式编排入库流程」:解析→分块→转换→索引组装成可复用的流水线。

44. 创建摄取管道

新建一条摄取管道。

45. 理解核心摄取管道组件

四类核心组件的分工总览。

46. 配置解析器组件

解析器参数。

47. 配置分块器组件

分块器参数。

48. 配置转换器组件

转换器参数。

49. 配置索引器组件

索引器参数。

50. 管道接入知识库

管道产出去向:挂到知识库供检索。

51. 测试运行

画布上点 Run 跑一遍示例文件,逐步看结果。

记忆(4 篇)

记忆(memory)让对话助手记住用户的偏好与事实,跨会话生效。

52. 创建记忆

新建一条记忆库。

53. 配置记忆

记忆的参数配置。

54. 连接到 Agent

把记忆库接到对话助手或 Agent 上生效。

55. 消息页面

记忆的消息视图。

知识编译(6 篇)

知识编译(knowledge compilation)把「检索原文」升级为「编译出成品知识」——按模板把数据集内容整理成结构化文档。

56. 知识编译概览

功能定位与核心概念。

57. 基本信息配置

新建编译任务的 基本信息 配置。

58. 知识编译运行时配置

运行时参数。

59. 应用知识编译模板

给任务套模板。

60. 内置模板与专用配置

全部内置模板的逐个说明与专用参数,选模板前查这页。

61. 知识编译常见问题

板块 FAQ。

模型(3 篇)

62. 配置模型 API Key

接入大模型的第一步:在 Model providers 里配各家的 API Key、设默认模型。启动后必读。

63. 本地部署模型

不想用云上 API?用 Ollama/Xinference/LocalAI 把模型跑在本地再接给 RAGFlow。

64. 模型提供商

支持的模型/提供商全家福清单,按厂商列出兼容的对话、嵌入、重排序模型。

团队(21 篇)

多人与权限:RAGFlow 的团队体系把资源(Agent/知识库/记忆)按团队与共享范围管理。这组多为短页,按需查阅。

65. 权限系统概览

权限模型总图:团队、成员、资源三层关系。先读它再读后面二十篇。

66. 团队与资源权限

权限的两条轴:团队维度的角色权限与资源维度的操作权限。

67. 团队成员管理

成员角色与管理动作。

68. 资源共享范围

资源可以共享给谁:范围等级的定义。

69. 资源操作权限

对资源能做什么:操作粒度的权限表。

70. 权限生效规则

多条权限叠加时谁说了算:生效优先级。

71. 共享范围配置

动手改共享范围的入口。

72. 开源版共享范围配置

开源版的共享范围行为差异。

73. 共享 Agent

把 Agent 共享给团队。

74. 共享知识库

把知识库共享给团队。

75. 共享记忆

把记忆共享给团队。

76. 团队管理

团队管理板块导读。

77. 进入团队页面

入口路径。

78. 查看当前工作区成员

看当前空间里有谁。

79. 邀请成员

发邀请。

80. 接受或拒绝邀请

受邀方视角的操作。

81. 移除成员

移出团队。

82. 退出已加入的团队

主动退出。

83. 查看已加入的团队

列出自己加入的团队。

84. 团队视角的资源共享

从团队侧看资源被怎么共享。

85. 团队管理常见问题

板块 FAQ。

四、参考资料(16 篇)

86. 术语表

RAGFlow 全部概念的官方词典(Agent/Agentic Retrieval/Auto keyword/……按字母序)。读文档卡在某个词上时回来查。

下面两套 API 参考是给程序员的:HTTP API 覆盖数据集/检索/对话/Agent/文件全部 REST 接口,Python SDK 是它的封装。原文各是一篇巨页,这里按章节拆成了多份双语阅读单元,顺号读即是完整原文。

87. HTTP API 参考(一)

错误码、已弃用端点别名与 OpenAI 兼容 API:HTTP 状态码与业务码的双层判读、旧端点对照表,以及两个 OpenAI 兼容端点(对话补全 / Agent 补全)。

88. HTTP API 参考(二)

数据集管理接口:数据集的创建/更新/删除(含批量)/列出。

89. HTTP API 参考(三)

数据集内文件管理接口:文件的上传/下载/解析/停止解析/更新等。

90. HTTP API 参考(四)

数据集内分块管理接口:分块的增删改查与检索。

91. HTTP API 参考(五)

对话助手管理接口:创建/更新/获取/部分更新/删除(含批量)/列出对话助手。

92. HTTP API 参考(六)

会话管理接口:会话的创建/列出/删除,向助手提问(含流式回答)与引用。

93. HTTP API 参考(七)

Agent 管理接口:Agent 的创建/更新/删除/列出。

94. HTTP API 参考(八)

记忆管理接口:记忆的增删改查。

95. HTTP API 参考(九)

系统接口:系统健康检查等。

96. HTTP API 参考(十)

文件管理接口(文件库层):文件/文件夹的上传、移动、下载等。

97. HTTP API 参考(十一)

搜索应用管理接口:搜索应用的创建/配置/删除等。

98. Python API 参考(一)

SDK 初始化、错误码、OpenAI 兼容 API,以及数据集(含数据集内文件)的对象方法。

99. Python API 参考(二)

数据集内分块管理与对话助手管理方法。

100. Python API 参考(三)

会话管理与 Agent 管理方法。

101. Python API 参考(四)

记忆管理方法。

五、开发(6 篇)

给改代码、读源码的人。

102. 获取 RAGFlow API Key

调 API 前先拿 Key:在哪生成、怎么用。

103. 从源码启动服务

不用 Docker 镜像,从源码把前后端各服务拉起来(开发调试场景)。

104. 构建 RAGFlow Docker 镜像

自己打镜像:ARM 平台、改动源码后的镜像构建。

105. 切换文档引擎

文档引擎(Elasticsearch/Infinity)怎么换。

106. 在 DeepWiki 上探索 RAGFlow

用 DeepWiki 对着 RAGFlow 仓库问答、理解源码的官方指路。

107. 贡献指南

给 RAGFlow 提 PR 的规范流程。

六、开发 · MCP(3 篇)

RAGFlow 官方实现了 MCP 服务器,把检索、数据集列表等能力以 MCP 工具暴露——配合之前那篇 MCP 学习地图食用更佳。

108. 启动 RAGFlow MCP 服务器

拉起 RAGFlow 自带的 MCP server,接入 Claude 等客户端。

109. RAGFlow MCP 工具

提供了哪几个 MCP 工具、各自参数。

110. RAGFlow MCP 客户端示例

官方客户端调用示例代码。

七、管理(13 篇)

自部署运维向:后台、配置、迁移。

111. 链路追踪

接入 OpenTelemetry 观测服务调用链。

112. 升级 RAGFlow

版本升级步骤与数据兼容注意。

113. 管理服务

admin 服务是什么、怎么开。

114. RAGFlow CLI

命令行管理工具全命令手册:用户/团队/系统管理动作的 CLI 化。

115. 开始之前

管理后台(admin UI)启用前置条件。

116. 查看系统状态

后台里看服务与组件健康度。

117. 管理用户账户

后台的用户增删改与封禁。

118. 配置代码执行沙箱

Agent 里「代码执行」组件背后的沙箱:gVisor 隔离、资源限额与安全边界。

119. 系统配置

服务配置项总览:conf 目录、环境变量与常用开关。

120. 配置 SSL 证书

给服务挂 HTTPS 证书。

121. 沙箱快速开始

代码执行沙箱的最短启用路径。

122. 备份与迁移

数据备份与实例迁移。

123. 数据库结构与迁移

数据库 schema 与版本间迁移机制。

八、常见问题(1 篇)

124. 常见问题

全站 FAQ 大合集:部署、解析、检索、对话各环节的高频问题与官方解答。遇到怪问题先来这页搜。

九、更新日志(5 篇)

官方 Releases 页按版本记录了每个版本的新特性、改进与修复,每条都附对应 PR 链接。想知道某个功能哪个版本加的、升级会带来什么,按版本范围对号入座;版本太老的部分当编年史翻翻即可。

125. 更新日志(一)

v0.27.2 ~ v0.26.2:最新五个版本。升级前扫一遍这份数变化最全。

126. 更新日志(二)

v0.26.1 ~ v0.25.2。

127. 更新日志(三)

v0.25.1 ~ v0.19.1。

128. 更新日志(四)

v0.19.0 ~ v0.10.0。

129. 更新日志(五)

v0.9.0 ~ v0.5.0:项目早期的版本记录。

建议阅读顺序

三条主线,按你的目标挑一条:

路线 A:快速上手(半天)。想尽快跑起来看效果:1 快速开始 → 62 配置模型 API Key → 4~8 数据集主线(概览/创建/配置/文件/检索测试)→ 23~25 建对话助手。跑通「上传文档→提问→带引用的回答」闭环后,再用 8 检索测试9 分块管理 调质量。

路线 B:吃透检索质量(持续)。已经能跑,想回答得更准:2 RAG 是什么 → 6 数据集配置(分块模板细读)→ 8 检索测试 → 9 分块管理(人工干预)→ 10 元数据 → 24 对话配置,配合 124 FAQ 里检索相关条目。

路线 C:Agent 与自动化(进阶)。想做的不只是问答:3 Agent 上下文引擎 → 34~36 Agent 入门三篇 → 39~43 工作流组件(当手册查)→ 44~51 摄取管道 → 52~55 记忆,需要对外暴露成服务时看 108~110 MCP 三篇27~30 对话渠道

程序员与运维另有两条短线:二次开发走 102 → 86 → 87~101(两套 API 参考);自部署运维走 111~123 管理板块 + 105 切换文档引擎

写在最后

三点说明:

  1. 版本快照:本文收录的是 2026-09-16 抓取的官方文档(源码仓库 infiniflow/ragflow-docs 的 main 分支,对应 v0.27.x 时期)。RAGFlow 迭代很快,个别界面与参数可能与最新版有出入,以官方站为准。
  2. 更新日志按版本切成五份收录(第 125~129 条)。它是本次快照中时效性最强的部分——官方每发一版就会追加,需要最新版本的变化时以官方原文为准。
  3. 译文由 AI 精翻(分析→初译→评审→修订→润色)并与英文原文逐段对齐排版;术语尽量贴合 RAGFlow 中文社区的惯用译法。发现译得不妥的地方,欢迎在原文与译文的对照下自行甄别。