Skip to main content
工作流

音频解析节点

音频解析节点用于将音频文件解析为结构化文本,输出语音识别(ASR)文本及其对应的时间坐标信息。解析结果可供大模型节点等下游节点进一步处理和分析。该功能暂不计费。

使用示例

以解析音频并生成内容摘要为例,该工作流接收一段音频文件,通过音频解析节点提取语音识别文本和时间信息,再由大模型节点生成音频内容摘要。

节点接入

方法1:使用+按钮添加

  • 将鼠标悬停在画布上任意节点上(如开始节点),节点右侧自动显示 + 按钮。
  • 点击 + 按钮,在弹出的节点列表中选择数据音频解析,节点将自动添加到画布并与上游节点建立连线。

方法2:从节点库拖拽添加

  • 在左侧节点库中选择数据音频解析。
  • 拖拽节点到画布合适位置,从上游节点边缘拖拽连线到音频解析节点。

核心配置

输入

指定待解析的音频,支持直接输入 URL 或引用上游节点变量。通过引用方式下拉框选择输入方式:
方式说明使用场景
引用引用上游节点变量音频来自上游节点的 String 类型的 URL 或开始节点的 File 类型文件。
输入直接输入音频 URL音频 URL 固定或从外部获取。
限制说明:
  • 单文件大小不超过 512 MB
  • 仅支持单文件解析,不支持列表文件解析
  • 支持格式:.aac、.amr、.flac、.flv、.m4a、.mp3、.mpeg、.ogg、.opus、.wav、.webm、.wma

解析器选择

解析器类型计费说明
大模型音视频解析暂不计费通过内置大模型实现解析,不支持修改提示词。

输出变量

音频解析节点根据音频内容输出结构化的语音识别结果,包含文件类型和按时间段组织的语音识别文本。
变量名类型说明
fileTypeString文件类型(如 "wav"、"mp3" 等)。
segmentsArray<Object>输出结果数组,按时间段组织音频内容,每个元素代表一个音频段落。
segments 数组元素结构:
字段名类型说明
audioFramesArray<Object>音频帧数组,包含该段落内的语音识别详情。
startTimeNumber段落开始时间(单位:毫秒)。
endTimeNumber段落结束时间(单位:毫秒)。
indexNumber段落索引,从 0 开始计数。
audioFrames 数组元素结构:
字段名类型说明
ASRInfoString语音识别文本(ASR 信息)。
startTimeNumber音频帧开始时间(单位:毫秒)。
endTimeNumber音频帧结束时间(单位:毫秒)。

常见用法

配合节点常见用法
开始节点 → 音频解析节点开始节点提供音频文件(File 类型的文件或 String 类型的文件 URL),音频解析节点解析音频内容。
音频解析节点 → 大模型节点音频解析节点输出结构化内容(如 segments 中的 ASR 文本),大模型节点基于解析结果生成摘要、回答问题或提取信息
音频解析节点 → 变量处理节点提取音频解析结果中的特定字段进行格式转换或数据处理(如提取所有 ASRInfo 拼接为完整文本)。