多模态生成节点用于调用阿里云多模态模型,根据配置的提示词和参数生成图像、视频或音频内容,适用于内容创作、营销素材制作、短视频生成、配音合成等场景。
使用示例
图像生成模式
选择图像生成类模型(如千问-Image、万相2.6-图像生成),配置正向提示词描述目标图像内容,设置图像尺寸和风格等参数,即可生成符合要求的图片。
视频生成模式
选择视频生成类模型(如万相2.6-文生视频、万相2.6-图生视频等),配置正向提示词或上传参考图片,设置视频分辨率和时长,即可生成动态视频内容。
音频合成模式
选择音频生成模型(千问3-TTS-Flash),输入需要合成的文本内容,选择语言类型和音色,即可生成自然流畅的音频。
接入节点
方式一:通过加号按钮添加
- 点击画布上任意节点末尾的加号按钮。
- 在弹出的节点列表中,选择基础分类下的多模态生成节点。
- 节点自动添加到画布并与上游节点建立连线。
方式二:拖拽节点
- 在左侧节点库的基础分类中找到多模态生成节点。
- 将节点拖拽到画布上的目标位置。
- 手动将节点连接到上游节点(拖拽上游节点的输出端到多模态生成节点的输入端)。
核心配置
模型选择
从模型选择下拉框中选择目标多模态生成模型。模型按功能分为三类:
图像生成、视频生成和音频生成。
模型列表会根据平台能力持续更新,实际可选模型以界面显示为准。模型选型请参考百炼控制台
,模型调用价格请参考
。
参数配置
不同模型支持的配置参数存在显著差异,配置面板会根据选择的具体模型动态显示相应的配置项。
图像生成配置
选择图像生成类模型后,需配置以下参数。不同模型支持的参数不同,请以实际界面显示为准。
| 参数 | 必选 | 描述 |
|---|---|---|
| 正向提示词 | 是 | 描述目标图像的内容、风格、构图等要素。支持直接输入文本或输入 / 插入上游节点的输出变量。 |
| 逆向提示词 | 否 | 描述不希望在图像中出现的内容,如模糊、水印等。支持直接输入文本或输入 / 插入上游节点的输出变量。 |
| size/分辨率 | 是 | 图像尺寸。 |
| prompt_extend | 否 | 开启后,系统会使用大模型对输入 prompt 进行智能改写,仅对正向提示词有效。对于较短的输入prompt生成效果提升明显,但会增加3-4秒耗时。 |
| 添加水印 | 否 | 水印开关,默认关闭。开启后生成的图像会添加阿里云水印标识。 |
| 参考图片 | 否 | 上传参考图片,用于指导图像生成风格或内容。支持传入开始节点的 File 类型变量或公网链接。 |
| 图片数量 | 否 | 一次生成的图片数量,默认值为 1。 |
| 提示词智能改写 | 否 | 开启后会使用大模型对输入 prompt 进行智能改写,仅对正向提示词有效。对于较短的输入 prompt 生成效果提升明显,但会增加图片生成耗时。 |
| enable_interleave | 否 | 关闭(默认):图像编辑模式,基于1~4张输入图像进行编辑、风格迁移或主体一致性生成。开启:图文混排输出模式,可根据图片或纯文本固定生成 1 个包含文本和图像的混合内容块。 |
| 随机种子 | 是 | 用于控制生成结果的随机性(默认1234),相同的种子值和提示词会生成相似的图像。 |
| 智能思考 | 否 | 开启时,大模型会进行推理思考及 prompt 改写,会提升模型的生成效果,同时也会增加模型生成耗时。 |
视频生成配置
选择视频生成类模型后,需配置以下参数。不同模型支持的参数不同,以实际界面显示为准。
| 参数 | 必选 | 描述 |
|---|---|---|
| 正向提示词 | 是 | 描述目标视频的场景、动作、风格等要素。支持直接输入文本或输入 / 插入上游节点的输出变量。 |
| 逆向提示词 | 否 | 描述不希望在视频中出现的内容,如模糊、水印等。支持直接输入文本或输入 / 插入上游节点的输出变量。 |
| 分辨率 | 是 | 视频清晰度,不同模型支持的分辨率选项不同。 |
| 视频时长 | 是 | 生成视频的时长,不同模型支持的时长选项不同。 |
| 随机种子 | 是 | 用于控制生成结果的随机性,相同的种子值和提示词会生成相似的视频。 |
| 智能扩写 | 否 | 开启后,系统会使用大模型对输入 prompt 进行智能改写,以提升视频生成效果。仅对正向提示词有效。 |
| 智能多镜 | 否 | 选择多镜头后,输出视频采用多分镜形式呈现。 |
| 生成音频 | 否 | 开启后,可提供音频文件URL,用于为视频配音。仅支持公网可访问 URL。 |
| 参考图片 | 是,仅图生视频模型 | 提供一张参考图片作为视频的首帧,模型会基于此图片生成视频。支持传入开始节点的 File 类型变量或公网链接。 |
音频生成配置
| 参数 | 必选 | 描述 |
|---|---|---|
| 合成文本 | 是 | 需要转换为语音的文本内容。支持直接输入文本或输入 / 插入上游节点的输出变量。 |
| 语言类型 | 否 | 合成语音的语言(默认中文)。支持的语言包括:中文、英文、德语、意大利语、葡萄牙语、西班牙语、日语、韩语、法语、俄语。 |
| 音色 | 否 | 合成语音的音色风格。 |
节点输出
多模态生成节点执行完成后,会输出以下变量:
| 变量名 | 类型 | 说明 | 示例 |
|---|---|---|---|
| output | Object | 完整的输出对象,包含任务状态、执行时间、生成结果等信息 | - |
| output.task_status | String | 任务状态,如 "SUCCEEDED"(成功)、"FAILED"(失败) | SUCCEEDED |
| output.submit_time | String | 任务提交时间,格式:YYYY-MM-DD HH:mm:ss.SSS | 2026-01-22 10:54:44.200 |
| output.end_time | String | 任务结束时间,格式:YYYY-MM-DD HH:mm:ss.SSS | 2026-01-22 10:54:51.685 |
| output.task_id | String | 任务唯一标识符 | e36c2221-b7fd-xxxx |
| output.scheduled_time | String | 任务调度时间,格式:YYYY-MM-DD HH:mm:ss.SSS | 2026-01-22 10:54:44.251 |
| output.results | Array<Object> | 生成结果数组,包含生成的文件信息 | - |
| output.results[].orig_prompt | String | 原始提示词(用户输入的提示词) | 一只可爱的小猫坐在窗台上 |
| output.results[].actual_prompt | String | 实际使用的提示词(经过模型扩展后的提示词) | 一只可爱的白色小猫,毛发蓬松柔软... |
| output.results[].url | String | 生成文件的 URL 地址 | https://dashscope-result... |
| usage | Object | 模型使用量统计信息 | - |
| usage.image_count | Number | 生成的图片数量(图像生成模式) | 1 |
| urls | Array<String> | 生成文件的 URL 列表,可直接访问或下载生成的图像/视频/音频文件 | ["https://dashscope-result..."] |
常见用法
| 配合节点 | 常见用法 |
|---|---|
| 开始节点 → 多模态生成节点 | 接收用户输入的文本描述(如 query 变量)作为正向提示词,生成对应的图像、视频或音频。 |
| 大模型节点 → 多模态生成节点 | 将大模型生成的文本内容作为正向提示词或合成文本,实现文本到多模态内容的转换。 |
| 多模态生成节点 → 流程输出节点 | 将生成的多模态文件 URL 输出给用户,或在工作流中间节点展示生成结果。 |
| 多模态生成节点 → API节点 | 将生成的文件 URL 传递给外部 API 进行后续处理,如上传到 OSS 存储或发送到消息平台。 |
常见问题
正向提示词应该如何编写?
正向提示词应清晰描述目标内容的关键要素:
- 图像生成
- 视频生成