> ## Documentation Index
> Fetch the complete documentation index at: https://docs.xpertai.cn/llms.txt
> Use this file to discover all available pages before exploring further.

# 知识库概览

> 将企业文档转化为可管理、可检索、可引用的 Agent 知识。

XpertAI 知识库将企业文档、网页和业务资料转化为可供数字专家与工作流使用的可信知识。系统负责内容解析、分块、向量化、结构化过滤、召回和引用，让 Agent 的回答建立在可追溯的原始资料上。

知识库既可以作为 Agent 自主调用的工具，也可以作为工作流中的明确检索步骤。一个知识库可以服务多个专业场景，并通过每个 Agent—知识库绑定上的固定条件和 Agent 动态条件控制实际检索范围。

## 核心能力

| 能力                                                                    | 产品价值                                                                  |
| --------------------------------------------------------------------- | --------------------------------------------------------------------- |
| 多来源文档接入                                                               | 上传 PDF、DOCX、Markdown、TXT、HTML、XLSX、PPTX、CSV 等文件，或从网页和知识流水线导入内容。       |
| 文档解析与分块                                                               | 清洗内容并按可配置策略生成分块，支持父子上下文，兼顾定位精度与语义完整性。                                 |
| PDF 版式解析与联动预览                                                         | 通过文档转换插件识别页面、表格、图片、公式与坐标，在原 PDF 和解析块之间双向定位。                           |
| 语义向量检索                                                                | 理解用户问题的语义，而不仅依赖完全一致的关键词。                                              |
| 智能过滤检索                                                                | 按文件名、逻辑文件夹、文件类型、MIME 和业务 metadata 缩小 Vector、Graph 或 Hybrid 候选，再排序与合并。 |
| 类型化元数据                                                                | 为文档或分块定义字符串、枚举、数值、日期时间、布尔、数组和对象字段。                                    |
| Agent 自主检索                                                            | Agent 可以判断何时查询知识库，并在管理员固定边界内按问题生成动态过滤条件。                              |
| [知识图谱与 GraphRAG](/zh-Hans/ai/knowledge-base/knowledge-graph-graphrag) | 抽取带证据的实体与关系，浏览和治理图谱，并将图谱发现转为带引用的分块检索。                                 |
| 测试、引用与审计                                                              | 查看召回片段、原文来源、有效过滤条件、候选数量、命中数量和检索耗时。                                    |
| 实时维护                                                                  | 文件名、逻辑目录和 metadata 变更后立即用于过滤，无需重新计算 embedding。                        |

## 从文档到回答

1. **接入内容**：上传文件、抓取网页，或通过知识流水线连接业务文档源。
2. **解析与分块**：提取文本、清洗内容，并生成适合检索的文档分块。
3. **嵌入与索引**：使用配置的嵌入模型将分块转换为向量并写入向量数据库。
4. **限定候选范围**：应用权限边界、启用状态、固定条件和 Agent 动态条件。
5. **按需探索关系**：知识库启用 GraphRAG 时，Agent 可先发现实体和关系，再组织最终检索词。
6. **语义排序**：对范围内分块进行向量相似度排序，并应用 TopK 与相似度阈值。
7. **生成与引用**：将命中内容交给下游模型，生成回答并保留可追溯的文档来源。

<img src="https://mintcdn.com/xpertai/CUk-Ab9Rv7YWeJmd/public/img/ai/rag_indexing.png?fit=max&auto=format&n=CUk-Ab9Rv7YWeJmd&q=85&s=2ddfab0b1b1e89f3ab49dfb39bb89465" alt="RAG indexing" width="2583" height="1299" data-path="public/img/ai/rag_indexing.png" />

## PDF 处理与原文联动

对于扫描件、工程图文手册、合同和复杂表格 PDF，XpertAI 可以通过百度 PaddleOCR‑VL 文档转换器保存分页版式、表格、图片、坐标和来源映射。处理完成后，文档详情提供双栏解析预览：左侧显示原始 PDF 与版式边界，右侧显示 Markdown、结构、表格、图片和 JSON；滚动、页码和解析块选择可以双向联动。

百度 Unlimited‑OCR 面向长文档 Markdown 解析；MinerU 同时支持官方精准解析 API 和自托管服务，可配置 OCR、公式、表格以及 VLM/pipeline 模型；Pdfium “PDF 转 Markdown”工具则供 Agent 临时处理任务附件。不同能力的适用位置和配置方式参阅[PDF 处理与解析联动预览](/zh-Hans/ai/knowledge-base/pdf-processing-and-preview)。

## 智能过滤：让一个知识库服务多个领域

当工程、水利、物流等资料保存在同一个知识库时，仅在全库做语义匹配容易召回相似但不适用的内容。XpertAI 可以在向量检索前先应用结构化条件：

* 管理员配置**固定过滤条件**，定义 Agent 不可修改的领域、项目、目录或文档状态边界；
* 开启**允许 Agent 自动过滤**后，Agent 可以从问题中识别年份、文件格式、地区或关键词，并生成临时条件；
* 两类条件始终按 `AND` 合并，Agent 只能缩小范围，不能绕过固定边界；
* Agent 无法判断时不添加动态条件，仍然受固定条件约束。

例如，管理员将报价 Agent 固定到“水利 + 有效文档”，用户再询问“2025 年 PDF 定额”时，Agent 可以附加 `文件扩展名 = pdf`、`生效年份 = 2025` 和 `文件名包含定额`。

详细字段、操作符、配置步骤和支持范围请参阅[智能过滤检索](/zh-Hans/ai/knowledge-base/intelligent-filtering)。

## 文档与元数据管理

XpertAI 自动维护以下系统属性：

* 文件名和知识库逻辑文件夹路径；
* 文件扩展名与 MIME 类型；
* 文档类别和来源类型；
* 创建时间与更新时间。

团队还可以通过 metadata schema 定义业务字段，并在上传、单文档编辑、分块编辑或批量维护时录入类型正确的值。文档级字段适用于整份文档，分块级字段用于区分同一文档中的不同章节或内容类别。

文件重命名、移动或 metadata 更新会同步更新检索属性，但不会重新生成向量，因此日常分类维护可以更快生效。参阅[维护文档](/zh-Hans/ai/knowledge-base/maintain-documents)。

## 检索方式

| 方式                      | 适合场景                                         |
| ----------------------- | -------------------------------------------- |
| Agent 知识库工具             | 让 Agent 根据对话自主决定是否检索，以及是否添加动态条件。             |
| 工作流知识检索节点               | 在明确步骤中执行检索，将命中分块传给后续模型、判断或格式化节点。             |
| 项目共享知识                  | 让项目中的多个 Agent 基于统一资料执行问答、分析和内容生成。            |
| Knowledgebase Workbench | 在同一工作台中浏览目录、预览文档、提问并追溯引用来源。                  |
| 外部知识库连接                 | 复用 RAGFlow、Dify、FastGPT 等已有知识服务。可用能力取决于外部接口。 |

参阅[使用知识库的方式](/zh-Hans/ai/knowledge-base/ways-to-use-knowledge-base)和[知识库 Workbench](/zh-Hans/ai/knowledge-base/knowledge-workbench)。

## 测试与可观测性

召回测试用于在发布前验证查询、过滤条件、TopK 和相似度阈值。调试视图可以区分固定条件、测试条件和 Agent 动态条件，并展示最终条件、候选文档数、候选分块数、命中数、后端和耗时。

检索日志沿用知识库访问权限，不记录文档正文。普通 Agent 回答默认只展示答案和引用，不向最终用户展示内部过滤策略。参阅[召回测试](/zh-Hans/ai/knowledge-base/recall-test)。

## 当前支持范围

智能过滤支持 **Vector**、**Graph** 和 **Hybrid**。向量分支正式支持 PGVector 和 Milvus，Milvus Server 需要 2.6.2 或更高版本。Graph 会过滤种子实体资格、关系扩展和证据分块；Hybrid 在合并前过滤两个分支，图谱失败时也只能回退到已过滤的 Vector 分支。Chroma 和 Weaviate 对新的向量过滤条件仍会明确报错，不会静默退化为全库搜索。

## 推荐阅读顺序

1. [维护文档与元数据](/zh-Hans/ai/knowledge-base/maintain-documents)
2. [PDF 处理与解析联动预览](/zh-Hans/ai/knowledge-base/pdf-processing-and-preview)
3. [构建和使用知识图谱与 GraphRAG](/zh-Hans/ai/knowledge-base/knowledge-graph-graphrag)
4. [智能过滤检索](/zh-Hans/ai/knowledge-base/intelligent-filtering)
5. [召回测试](/zh-Hans/ai/knowledge-base/recall-test)
6. [使用知识库的方式](/zh-Hans/ai/knowledge-base/ways-to-use-knowledge-base)
7. [通过知识流水线创建知识库](/zh-Hans/ai/knowledge-base/create-knowledge-base-via-pipeline/step-1-create-pipeline)
