界面状态说明
进入知识流水线编排界面时,你会看到:- 标签页状态:Documents(文档)、Retrieval Test(召回测试)和 Settings(设置)标签页处于灰色不可用状态。
- 前置要求:需完成知识流水线的配置、调试与发布后,才能上传文件并进行召回测试。
知识流水线总体流程
在正式配置前,我们先理解知识流水线中数据的流转过程:
- 数据源配置:导入原始内容(本地文件、Notion、网页、网盘等)。
- 文档转换节点:将原始文件转换为标准化结构数据(支持文本与图片提取)。
- 分块处理节点:对结构化内容进行智能分块,生成适合索引的内容片段。
- 知识库节点:定义树状结构与索引策略。
- 触发器节点配置:设定输入参数,以便触发流水线运行。
- 测试与发布:验证处理流程后正式启用知识库。
步骤一:数据源配置
在 XpertAI 中,你可以同时选择多个数据源进行知识提取。每个数据源都可独立配置参数,支持本地上传、在线文档和网页爬取等形式。 目前支持的数据源包括:- 本地文件上传
- 在线文档(如 Notion)
- 在线网盘(Google Drive、Dropbox、OneDrive)
- 网页爬虫(Firecrawl 等)
更多数据源可通过 XpertAI 插件市场(Plugin Marketplace)获取。
步骤二:配置数据处理节点
数据处理节点是知识流水线的核心。它负责将原始文件解析、转换、清洗并分块,形成结构化语义单元。 XpertAI 的数据处理分为两大部分:文档转换器(Document Transformer) 与 分块器(Chunker)。文档转换器 (Document Transformer)
文档转换器负责将 PDF、Word、Excel 等多种格式文件转化为可供模型理解的结构化内容。 它支持图片、表格、文本等多模态内容的抽取,是知识流中的“第一道工序”。 你可以选择 XpertAI 内置转换器 或 插件市场(Marketplace) 中的其他转换器(如 Unstructured、MinerU 等)。特点
- 支持多格式输入(PDF、DOCX、XLSX、PPTX、TXT、Markdown 等);
- 自动提取图片并生成可用的 URL;
- 支持异步任务和批量转换;
- 支持 OCR 与结构化表格抽取。
分块器 (Chunker)
文档经过转换后,仍然过于庞大,无法直接用于向量化与检索。分块器将内容拆解为语义完整的小块(Chunk),以便后续索引与召回。 XpertAI 提供多种分块策略,包括:通用分块器
配置项说明
输入输出
父子分块器
父子分块器生成了 Tree 结构的分块树(Parent-Child Tree),这是 XpertAI 独创的分块体系,统一管理父子块之间的层级关系。 与传统的“分段结构(Chunk Structure)”不同,XpertAI 采用树状结构存储分块,支持任意层级的溯源与聚合。 特点- 自动维护上下文关联;
- 支持父块语义检索与子块精准匹配;
- 可扩展为混合图谱(Graph Structure)。
问答处理器 (Q&A Processor) — 开发中
问答处理器融合了提取与分块功能,用于从 CSV 或 Excel 中抽取问答对(Question / Answer)。 该节点目前处于开发阶段,将支持结构化问答型知识的批量处理。步骤三:配置知识库节点
知识库节点是流水线的终点,负责构建可检索的知识索引结构。 XpertAI 的知识库采用 树状分块结构(Tree Structure) 管理分块层级,每个节点(Chunk)都可关联向量、图片、来源信息及上下文节点。核心特性
步骤四:配置触发器节点(用户输入参数)
在 XpertAI 中,用户输入参数通过 触发器节点(Trigger Node) 来实现。 触发器节点允许你定义流水线运行的输入参数(如上传文件、URL、分隔符、自定义变量等),这些参数将在运行时注入到上游节点。 优势- 统一参数管理;
- 与其他节点自动绑定;
- 可视化配置与默认值支持。