音频解析节点用于将音频文件解析为结构化文本,输出语音识别(ASR)文本及其对应的时间坐标信息。解析结果可供大模型节点等下游节点进一步处理和分析。该功能暂不计费。
使用示例
以解析音频并生成内容摘要为例,该工作流接收一段音频文件,通过音频解析节点提取语音识别文本和时间信息,再由大模型节点生成音频内容摘要。
节点接入
方法1:使用+按钮添加
- 将鼠标悬停在画布上任意节点上(如开始节点),节点右侧自动显示 + 按钮。
- 点击 + 按钮,在弹出的节点列表中选择数据音频解析,节点将自动添加到画布并与上游节点建立连线。
方法2:从节点库拖拽添加
- 在左侧节点库中选择数据音频解析。
- 拖拽节点到画布合适位置,从上游节点边缘拖拽连线到音频解析节点。
核心配置
输入
指定待解析的音频,支持直接输入 URL 或引用上游节点变量。通过引用方式下拉框选择输入方式:
| 方式 | 说明 | 使用场景 |
|---|---|---|
| 引用 | 引用上游节点变量 | 音频来自上游节点的 String 类型的 URL 或开始节点的 File 类型文件。 |
| 输入 | 直接输入音频 URL | 音频 URL 固定或从外部获取。 |
- 单文件大小不超过 512 MB
- 仅支持单文件解析,不支持列表文件解析
- 支持格式:.aac、.amr、.flac、.flv、.m4a、.mp3、.mpeg、.ogg、.opus、.wav、.webm、.wma
解析器选择
| 解析器类型 | 计费 | 说明 |
|---|---|---|
| 大模型音视频解析 | 暂不计费 | 通过内置大模型实现解析,不支持修改提示词。 |
输出变量
音频解析节点根据音频内容输出结构化的语音识别结果,包含文件类型和按时间段组织的语音识别文本。
| 变量名 | 类型 | 说明 |
|---|---|---|
| fileType | String | 文件类型(如 "wav"、"mp3" 等)。 |
| segments | Array<Object> | 输出结果数组,按时间段组织音频内容,每个元素代表一个音频段落。 |
| 字段名 | 类型 | 说明 |
|---|---|---|
| audioFrames | Array<Object> | 音频帧数组,包含该段落内的语音识别详情。 |
| startTime | Number | 段落开始时间(单位:毫秒)。 |
| endTime | Number | 段落结束时间(单位:毫秒)。 |
| index | Number | 段落索引,从 0 开始计数。 |
| 字段名 | 类型 | 说明 |
|---|---|---|
| ASRInfo | String | 语音识别文本(ASR 信息)。 |
| startTime | Number | 音频帧开始时间(单位:毫秒)。 |
| endTime | Number | 音频帧结束时间(单位:毫秒)。 |
常见用法
| 配合节点 | 常见用法 |
|---|---|
| 开始节点 → 音频解析节点 | 开始节点提供音频文件(File 类型的文件或 String 类型的文件 URL),音频解析节点解析音频内容。 |
| 音频解析节点 → 大模型节点 | 音频解析节点输出结构化内容(如 segments 中的 ASR 文本),大模型节点基于解析结果生成摘要、回答问题或提取信息 |
| 音频解析节点 → 变量处理节点 | 提取音频解析结果中的特定字段进行格式转换或数据处理(如提取所有 ASRInfo 拼接为完整文本)。 |