百炼对应用调用按应用与账号两个维度设置限流。超出阈值的请求会被拒绝并返回 HTTP 429,错误码为 Throttling.AllocationQuota,通常在一分钟内自动恢复。
业务上量前建议提前申请扩容:预计业务并发或调用量将大幅上涨时,建议提前联系阿里云对接商务经理评估并申请扩容。已触发限流时也可通过同一渠道申请提额。
工作流应用中的大模型类节点(大模型节点、问题分类节点、参数提取节点、多模态生成节点、带检索的大模型节点等)会直接调用大模型,受所调用模型自身的 RPM/TPM 配额约束。该约束与应用维度限流相互独立,任一触发均会导致请求失败。
HTTP 状态码为
通常在一分钟内自动恢复。期间客户端应停止重试以避免持续触发。
错误码同样为
限流规则
- 单应用并发:按应用 ID(
app_id)统计的每秒请求数,默认上限 100 QPS。 - 账号总流量:同一阿里云主账号维度统计的每分钟请求数,默认上限 15000 QPM。
- 异步任务与同步调用共享:工作流异步任务的提交请求与同步调用共享单应用 QPS 配额,提交频率同样受限。
工作流应用的模型限流
工作流应用中的大模型类节点(大模型节点、问题分类节点、参数提取节点、多模态生成节点、带检索的大模型节点等)会直接调用大模型,受所调用模型自身的 RPM/TPM 配额约束。该约束与应用维度限流相互独立,任一触发均会导致请求失败。
FAQ
如何判断请求被限流?
HTTP 状态码为 429,响应错误码为 Throttling.AllocationQuota。SDK 调用时会抛出对应的限流异常。
遇到限流后多久恢复?
通常在一分钟内自动恢复。期间客户端应停止重试以避免持续触发。
如何避免限流?
- 指数退避重试:捕获
429后等待一段时间再重试,每次失败后等待时间翻倍(如 1s、2s、4s、8s),并设置最大重试次数与最长等待时间。 - 客户端削峰:在调用方增加请求队列或令牌桶限速,将瞬时高峰平摊到时间窗口内,避免短时间集中调用。
- 多应用分流:单应用 QPS 配额是独立维度,可将业务按场景拆分到多个应用,分摊单应用并发压力;同时注意账号总流量上限仍合并计算。
- 备选应用 fallback:业务侧维护备选应用列表,主应用触发限流时切换到备选应用继续处理,降低失败率。
- 异步化与批处理:无需实时响应的请求改用工作流异步任务或批量处理,避开同步调用的瞬时并发压力。
- 提前申请扩容:预计业务将有明显增长时,联系阿里云对接商务经理申请提额,避免正式上量时被限流。
工作流报模型限流怎么办?
错误码同样为 Throttling.AllocationQuota,但触发位置是工作流节点调用的模型,与应用维度限流无关。请按对应模型的 RPM/TPM 配额排查。