Skip to main content
工作流

多模态生成节点

多模态生成节点用于调用阿里云多模态模型,根据配置的提示词和参数生成图像、视频或音频内容,适用于内容创作、营销素材制作、短视频生成、配音合成等场景。

使用示例

图像生成模式

选择图像生成类模型(如千问-Image、万相2.6-图像生成),配置正向提示词描述目标图像内容,设置图像尺寸和风格等参数,即可生成符合要求的图片。

视频生成模式

选择视频生成类模型(如万相2.6-文生视频、万相2.6-图生视频等),配置正向提示词或上传参考图片,设置视频分辨率和时长,即可生成动态视频内容。

音频合成模式

选择音频生成模型(千问3-TTS-Flash),输入需要合成的文本内容,选择语言类型和音色,即可生成自然流畅的音频。

接入节点

方式一:通过加号按钮添加

  • 点击画布上任意节点末尾的加号按钮。
  • 在弹出的节点列表中,选择基础分类下的多模态生成节点。
  • 节点自动添加到画布并与上游节点建立连线。

方式二:拖拽节点

  • 在左侧节点库的基础分类中找到多模态生成节点。
  • 将节点拖拽到画布上的目标位置。
  • 手动将节点连接到上游节点(拖拽上游节点的输出端到多模态生成节点的输入端)。

核心配置

模型选择

从模型选择下拉框中选择目标多模态生成模型。模型按功能分为三类: 图像生成、视频生成和音频生成。 模型列表会根据平台能力持续更新,实际可选模型以界面显示为准。模型选型请参考百炼控制台 ,模型调用价格请参考 。

参数配置

不同模型支持的配置参数存在显著差异,配置面板会根据选择的具体模型动态显示相应的配置项。

图像生成配置

选择图像生成类模型后,需配置以下参数。不同模型支持的参数不同,请以实际界面显示为准。
参数必选描述
正向提示词描述目标图像的内容、风格、构图等要素。支持直接输入文本或输入 / 插入上游节点的输出变量。
逆向提示词描述不希望在图像中出现的内容,如模糊、水印等。支持直接输入文本或输入 / 插入上游节点的输出变量。
size/分辨率图像尺寸。
prompt_extend开启后,系统会使用大模型对输入 prompt 进行智能改写,仅对正向提示词有效。对于较短的输入prompt生成效果提升明显,但会增加3-4秒耗时。
添加水印水印开关,默认关闭。开启后生成的图像会添加阿里云水印标识。
参考图片上传参考图片,用于指导图像生成风格或内容。支持传入开始节点的 File 类型变量或公网链接。
图片数量一次生成的图片数量,默认值为 1。
提示词智能改写开启后会使用大模型对输入 prompt 进行智能改写,仅对正向提示词有效。对于较短的输入 prompt 生成效果提升明显,但会增加图片生成耗时。
enable_interleave关闭(默认):图像编辑模式,基于1~4张输入图像进行编辑、风格迁移或主体一致性生成。开启:图文混排输出模式,可根据图片或纯文本固定生成 1 个包含文本和图像的混合内容块。
随机种子用于控制生成结果的随机性(默认1234),相同的种子值和提示词会生成相似的图像。
智能思考开启时,大模型会进行推理思考及 prompt 改写,会提升模型的生成效果,同时也会增加模型生成耗时。

视频生成配置

选择视频生成类模型后,需配置以下参数。不同模型支持的参数不同,以实际界面显示为准。
参数必选描述
正向提示词描述目标视频的场景、动作、风格等要素。支持直接输入文本或输入 / 插入上游节点的输出变量。
逆向提示词描述不希望在视频中出现的内容,如模糊、水印等。支持直接输入文本或输入 / 插入上游节点的输出变量。
分辨率视频清晰度,不同模型支持的分辨率选项不同。
视频时长生成视频的时长,不同模型支持的时长选项不同。
随机种子用于控制生成结果的随机性,相同的种子值和提示词会生成相似的视频。
智能扩写开启后,系统会使用大模型对输入 prompt 进行智能改写,以提升视频生成效果。仅对正向提示词有效。
智能多镜选择多镜头后,输出视频采用多分镜形式呈现。
生成音频开启后,可提供音频文件URL,用于为视频配音。仅支持公网可访问 URL。
参考图片是,仅图生视频模型提供一张参考图片作为视频的首帧,模型会基于此图片生成视频。支持传入开始节点的 File 类型变量或公网链接。

音频生成配置

参数必选描述
合成文本需要转换为语音的文本内容。支持直接输入文本或输入 / 插入上游节点的输出变量。
语言类型合成语音的语言(默认中文)。支持的语言包括:中文、英文、德语、意大利语、葡萄牙语、西班牙语、日语、韩语、法语、俄语。
音色合成语音的音色风格。

节点输出

多模态生成节点执行完成后,会输出以下变量:
变量名类型说明示例
outputObject完整的输出对象,包含任务状态、执行时间、生成结果等信息-
output.task_statusString任务状态,如 "SUCCEEDED"(成功)、"FAILED"(失败)SUCCEEDED
output.submit_timeString任务提交时间,格式:YYYY-MM-DD HH:mm:ss.SSS2026-01-22 10:54:44.200
output.end_timeString任务结束时间,格式:YYYY-MM-DD HH:mm:ss.SSS2026-01-22 10:54:51.685
output.task_idString任务唯一标识符e36c2221-b7fd-xxxx
output.scheduled_timeString任务调度时间,格式:YYYY-MM-DD HH:mm:ss.SSS2026-01-22 10:54:44.251
output.resultsArray<Object>生成结果数组,包含生成的文件信息-
output.results[].orig_promptString原始提示词(用户输入的提示词)一只可爱的小猫坐在窗台上
output.results[].actual_promptString实际使用的提示词(经过模型扩展后的提示词)一只可爱的白色小猫,毛发蓬松柔软...
output.results[].urlString生成文件的 URL 地址https://dashscope-result...
usageObject模型使用量统计信息-
usage.image_countNumber生成的图片数量(图像生成模式)1
urlsArray<String>生成文件的 URL 列表,可直接访问或下载生成的图像/视频/音频文件["https://dashscope-result..."]

常见用法

配合节点常见用法
开始节点 → 多模态生成节点接收用户输入的文本描述(如 query 变量)作为正向提示词,生成对应的图像、视频或音频。
大模型节点 → 多模态生成节点将大模型生成的文本内容作为正向提示词或合成文本,实现文本到多模态内容的转换。
多模态生成节点 → 流程输出节点将生成的多模态文件 URL 输出给用户,或在工作流中间节点展示生成结果。
多模态生成节点 → API节点将生成的文件 URL 传递给外部 API 进行后续处理,如上传到 OSS 存储或发送到消息平台。

常见问题

正向提示词应该如何编写?

正向提示词应清晰描述目标内容的关键要素:
  • 图像生成
:描述主体、场景、构图、风格、光照等。例如:“一只可爱的橘猫坐在窗台上,阳光从窗外洒进来,温馨的室内场景,柔和的光影效果”。
  • 视频生成
:描述动作、场景、镜头运动、时间、风格等。例如:“海边日落时分,海浪拍打着礁石,镜头缓慢推进,温暖的黄昏色调”。 推荐使用节点自带的提示词智能改写功能或参考 百炼自定义Prompt模板 来优化提示词。