Skip to main content
工作流

文档解析节点

文档解析节点用于提取输入文档的结构化参数。配置文件类型和解析器后,根据文档内容生成结构化的输出变量,适用于文档内容提取、表格数据解析、文档信息统计等场景。该节点暂不计费。

使用示例

以解析文档并生成摘要为例,该工作流接收一份文档文件,通过文档解析节点提取文档内容,再由大模型节点生成文档摘要。

节点接入

方法1:使用+按钮添加

  • 将鼠标悬停在画布上任意节点上(如开始节点),节点右侧自动显示 + 按钮。
  • 点击 + 按钮,在弹出的节点列表中选择数据文档解析,节点将自动添加到画布并与上游节点建立连线。

方法2:从节点库拖拽添加

  • 在左侧节点库中选择数据文档解析。
  • 拖拽节点到画布合适位置,从上游节点边缘拖拽连线到文档解析节点。

核心配置

文件类型

指定待解析文档的类型。
选项适用格式输出变量
其他.pdf、.doc、.docx、.wps、.ppt、.pptx、.md、.txt输出 layout 数组,包含 markdown 格式内容
Excel.xlsx、.xls、.xlsm输出 cells 数组,包含单元格信息

输入

指定待解析的文档。支持输入 String 类型的 URL 或开始节点的 File 类型变量。 当引用开始节点的 File 类型变量时,实际传入的是一个 JSON 对象(包含mimeType、name、size、source、type、url 字段),本地上传的文件会先被上传到 OSS,然后以临时链接形式传入节点。 文件限制说明:
  • 单文件大小不超过 150 MB,页数不超过 1.5 万页。
  • 仅支持单文件解析,不支持列表文件解析。

解析器选择

指定用于解析文档的解析器,不同解析器在解析效果和速度上有所差异。可选的解析器因文件类型不同而有所差异: 文件类型为其他时:
解析器类型解析效果解析速度说明
大模型文档解析较好较快通过内置大模型实现解析,不支持修改提示词。
文档智能解析较好较快平衡解析效果和速度。
电子文档解析中等最快适用于快速解析场景。
文件类型为 Excel 时:
解析器类型解析效果解析速度说明
大模型文档解析较好较快通过内置大模型实现解析。
电子文档解析中等最快适用于快速解析场景。

节点输出

文档解析节点根据选择的文件类型输出不同的变量结构。以下为通用输出变量。
变量名类型说明
docIdString文档id
totalPagesNumber总页数
wordCountNumber字数
docTypeString文件类型
当文件类型选择”其他”时,额外输出 layoutCount 和 layout 数组:
变量名类型说明
layoutCountNumber段落数量
layoutArray<Object>输出结果数组,每个元素为一个段落对象,子字段如下。
layout[].uniqueId String 段落唯一标识 layout[].markdownContent String 段落的 markdown 格式内容 layout[].pageNum Number 段落所在页码 当文件类型选择“Excel”时,额外输出 cells 数组:
变量名类型说明
cellsArray<Object>输出结果数组,每个元素为一个单元格对象,子字段如下
cells[].cellUniqueIdString单元格唯一标识
cells[].verticalString列索引
cells[].horizontalString行索引
cells[].textString单元格内容

常见用法

配合节点常见用法
开始节点 → 文档解析节点在开始节点设置 File 类型的自定义变量用于上传文档文件,并在后续的文档解析节点中解析内容
文档解析节点 → 大模型节点文档解析节点输出结构化内容(如 markdownContent),大模型节点基于解析结果生成摘要、回答问题或提取信息
文档解析节点 → 条件判断节点根据文档解析结果(如 docType、totalPages、wordCount)进行条件分支处理
文档解析节点 → 变量处理节点提取文档解析结果中的特定字段进行格式转换或数据处理
文档解析节点 → 批处理节点将 layout 数组传入批处理节点,并行处理每个文档段落(如逐段翻译、逐段总结)

常见问题

使用链接方式提供文档URL解析失败?

请确保提供的是文档文件的直接下载链接(如以 .pdf、.docx、.txt 等扩展名结尾的 URL),而非网页链接。网页URL不是有效的文档文件,会导致解析失败。