核心能力
从文档到回答
- 接入内容:上传文件、抓取网页,或通过知识流水线连接业务文档源。
- 解析与分块:提取文本、清洗内容,并生成适合检索的文档分块。
- 嵌入与索引:使用配置的嵌入模型将分块转换为向量并写入向量数据库。
- 限定候选范围:应用权限边界、启用状态、固定条件和 Agent 动态条件。
- 按需探索关系:知识库启用 GraphRAG 时,Agent 可先发现实体和关系,再组织最终检索词。
- 语义排序:对范围内分块进行向量相似度排序,并应用 TopK 与相似度阈值。
- 生成与引用:将命中内容交给下游模型,生成回答并保留可追溯的文档来源。

PDF 处理与原文联动
对于扫描件、工程图文手册、合同和复杂表格 PDF,XpertAI 可以通过百度 PaddleOCR‑VL 文档转换器保存分页版式、表格、图片、坐标和来源映射。处理完成后,文档详情提供双栏解析预览:左侧显示原始 PDF 与版式边界,右侧显示 Markdown、结构、表格、图片和 JSON;滚动、页码和解析块选择可以双向联动。 百度 Unlimited‑OCR 面向长文档 Markdown 解析;MinerU 同时支持官方精准解析 API 和自托管服务,可配置 OCR、公式、表格以及 VLM/pipeline 模型;Pdfium “PDF 转 Markdown”工具则供 Agent 临时处理任务附件。不同能力的适用位置和配置方式参阅PDF 处理与解析联动预览。智能过滤:让一个知识库服务多个领域
当工程、水利、物流等资料保存在同一个知识库时,仅在全库做语义匹配容易召回相似但不适用的内容。XpertAI 可以在向量检索前先应用结构化条件:- 管理员配置固定过滤条件,定义 Agent 不可修改的领域、项目、目录或文档状态边界;
- 开启允许 Agent 自动过滤后,Agent 可以从问题中识别年份、文件格式、地区或关键词,并生成临时条件;
- 两类条件始终按
AND合并,Agent 只能缩小范围,不能绕过固定边界; - Agent 无法判断时不添加动态条件,仍然受固定条件约束。
文件扩展名 = pdf、生效年份 = 2025 和 文件名包含定额。
详细字段、操作符、配置步骤和支持范围请参阅智能过滤检索。
文档与元数据管理
XpertAI 自动维护以下系统属性:- 文件名和知识库逻辑文件夹路径;
- 文件扩展名与 MIME 类型;
- 文档类别和来源类型;
- 创建时间与更新时间。
检索方式
参阅使用知识库的方式和知识库 Workbench。