RAGFlow知识库与PDF文件管理

SkillDocs & knowledge

Guides users on how to process literature in PDF format and manage their personal literature using the RAGFlow vector knowledge base framework. Use this skill immediately when the user mentions how to use RAGFlow, how to upload PDFs to a RAGFlow knowledge base, or how to process long documents for h

Instructions available. Your AI can read the instructions. Execution depends on the setup they require.

Add ahel to your AI once: Claude, ChatGPT, Cursor, Claude Code or Codex. Then ask it to use this.

Then ask your AI: use the RAGFlow知识库与PDF文件管理 skill

What this skill tells your AI

The instructions your AI receives, as published by hepai-lab/drsai in skills/skills_hepai/ragflow-knowledge/SKILL.md and read by ahel’s review.

何时使用

  1. 用户需要学习RAGFlow知识库的构建与配置过程。
  2. 需要将本地PDF、Markdown文件等文件上传到RAGFlow知识库、更新知识库文档与元数据。
  3. 需要处理PDF论文、PDF手册、长文档手册,上传到RAGFlow知识库进行长文档混合检索等操作。

核心功能与工作流程

功能1:RAGFlow知识库的构建与配置

指导RAGFlow知识库的构建与配置过程,具体见references目录下的ragflow_config.md。

功能2:PDF文件的清洗与上传处理

在用户需要将PDF文件的解析为markdown文本、清洗后上传到RAGFlow知识库进行混合检索时,可以使用此功能。具体的工作流程为:

  1. 询问用户的PDF文件的清洗需求:是直接解析整篇文档作为一个文件进行混合检索,还是需要长文档的分逐页割,按照逐页进行解析后检索。
  2. 用户说明了解析清洗要求后,必须阅读见references目录下的pdf_process.md文件,根据用户的分割解析需求,使用合适的脚本进行处理。
  3. PDF分割清洗后先确认分割后文件的绝对路径,以便后面进行处理。
  4. 使用对应的脚本进行分割后PDF文件的解析,转化为对应的markdown文件。因为使用Mineru模型进行解析,速度较慢,因此都推荐使用后台模式进行解析。
  5. 要求用户构建对应的目录文件,方便后面进行目录摘要的总结,具体目录文件的构建方法阅读references目录下的content_process.md文件。这一步通常需要要求用户来仔细核对,确定文件总结的具体参数。
  6. 然后参考ragflow_config.md,上传到RAGFlow知识库,进行检索测试。

功能3:markdown文件的清洗与上传处理

如果是纯markdown文件格式长文档,有明确的页数对应,则可以参考功能2,直接跳过1-4,直接构建目录文件,然后进行上传和检索。

Signals

GitHub stars
24
Forks
5
Last commit
Sep 2026
Advanced
Item type
skill
Key
ragflow-knowledge
Source
github.com/hepai-lab/drsai