文档解析节点用于提取输入文档的结构化参数。配置文件类型和解析器后,根据文档内容生成结构化的输出变量,适用于文档内容提取、表格数据解析、文档信息统计等场景。该节点暂不计费。
使用示例
以解析文档并生成摘要为例,该工作流接收一份文档文件,通过文档解析节点提取文档内容,再由大模型节点生成文档摘要。
节点接入
方法1:使用+按钮添加
- 将鼠标悬停在画布上任意节点上(如开始节点),节点右侧自动显示 + 按钮。
- 点击 + 按钮,在弹出的节点列表中选择数据文档解析,节点将自动添加到画布并与上游节点建立连线。
方法2:从节点库拖拽添加
- 在左侧节点库中选择数据文档解析。
- 拖拽节点到画布合适位置,从上游节点边缘拖拽连线到文档解析节点。
核心配置
文件类型
指定待解析文档的类型。
| 选项 | 适用格式 | 输出变量 |
|---|---|---|
| 其他 | .pdf、.doc、.docx、.wps、.ppt、.pptx、.md、.txt | 输出 layout 数组,包含 markdown 格式内容 |
| Excel | .xlsx、.xls、.xlsm | 输出 cells 数组,包含单元格信息 |
输入
指定待解析的文档。支持输入 String 类型的 URL 或开始节点的 File 类型变量。
当引用开始节点的 File 类型变量时,实际传入的是一个 JSON 对象(包含mimeType、name、size、source、type、url 字段),本地上传的文件会先被上传到 OSS,然后以临时链接形式传入节点。
文件限制说明:
- 单文件大小不超过 150 MB,页数不超过 1.5 万页。
- 仅支持单文件解析,不支持列表文件解析。
解析器选择
指定用于解析文档的解析器,不同解析器在解析效果和速度上有所差异。可选的解析器因文件类型不同而有所差异:
文件类型为其他时:
| 解析器类型 | 解析效果 | 解析速度 | 说明 |
|---|---|---|---|
| 大模型文档解析 | 较好 | 较快 | 通过内置大模型实现解析,不支持修改提示词。 |
| 文档智能解析 | 较好 | 较快 | 平衡解析效果和速度。 |
| 电子文档解析 | 中等 | 最快 | 适用于快速解析场景。 |
| 文件类型为 Excel 时: |
| 解析器类型 | 解析效果 | 解析速度 | 说明 |
|---|---|---|---|
| 大模型文档解析 | 较好 | 较快 | 通过内置大模型实现解析。 |
| 电子文档解析 | 中等 | 最快 | 适用于快速解析场景。 |
节点输出
文档解析节点根据选择的文件类型输出不同的变量结构。以下为通用输出变量。
| 变量名 | 类型 | 说明 |
|---|---|---|
| docId | String | 文档id |
| totalPages | Number | 总页数 |
| wordCount | Number | 字数 |
| docType | String | 文件类型 |
| 当文件类型选择”其他”时,额外输出 layoutCount 和 layout 数组: |
| 变量名 | 类型 | 说明 |
|---|---|---|
| layoutCount | Number | 段落数量 |
| layout | Array<Object> | 输出结果数组,每个元素为一个段落对象,子字段如下。 |
| 变量名 | 类型 | 说明 |
|---|---|---|
| cells | Array<Object> | 输出结果数组,每个元素为一个单元格对象,子字段如下 |
| cells[].cellUniqueId | String | 单元格唯一标识 |
| cells[].vertical | String | 列索引 |
| cells[].horizontal | String | 行索引 |
| cells[].text | String | 单元格内容 |
常见用法
| 配合节点 | 常见用法 |
|---|---|
| 开始节点 → 文档解析节点 | 在开始节点设置 File 类型的自定义变量用于上传文档文件,并在后续的文档解析节点中解析内容 |
| 文档解析节点 → 大模型节点 | 文档解析节点输出结构化内容(如 markdownContent),大模型节点基于解析结果生成摘要、回答问题或提取信息 |
| 文档解析节点 → 条件判断节点 | 根据文档解析结果(如 docType、totalPages、wordCount)进行条件分支处理 |
| 文档解析节点 → 变量处理节点 | 提取文档解析结果中的特定字段进行格式转换或数据处理 |
| 文档解析节点 → 批处理节点 | 将 layout 数组传入批处理节点,并行处理每个文档段落(如逐段翻译、逐段总结) |