Skip to main content
应用调用

应用限流

百炼对应用调用按应用与账号两个维度设置限流。超出阈值的请求会被拒绝并返回 HTTP 429,错误码为 Throttling.AllocationQuota,通常在一分钟内自动恢复。

业务上量前建议提前申请扩容:预计业务并发或调用量将大幅上涨时,建议提前联系阿里云对接商务经理评估并申请扩容。已触发限流时也可通过同一渠道申请提额。

限流规则

  • 单应用并发:按应用 ID(app_id)统计的每秒请求数,默认上限 100 QPS
  • 账号总流量:同一阿里云主账号维度统计的每分钟请求数,默认上限 15000 QPM
  • 异步任务与同步调用共享:工作流异步任务的提交请求与同步调用共享单应用 QPS 配额,提交频率同样受限。
以上维度独立生效,任一触发都会返回限流错误。

工作流应用的模型限流

工作流应用中的大模型类节点(大模型节点、问题分类节点、参数提取节点、多模态生成节点、带检索的大模型节点等)会直接调用大模型,受所调用模型自身的 RPM/TPM 配额约束。该约束与应用维度限流相互独立,任一触发均会导致请求失败。

FAQ

如何判断请求被限流?

HTTP 状态码为 429,响应错误码为 Throttling.AllocationQuota。SDK 调用时会抛出对应的限流异常。

遇到限流后多久恢复?

通常在一分钟内自动恢复。期间客户端应停止重试以避免持续触发。

如何避免限流?

  1. 指数退避重试:捕获 429 后等待一段时间再重试,每次失败后等待时间翻倍(如 1s、2s、4s、8s),并设置最大重试次数与最长等待时间。
  2. 客户端削峰:在调用方增加请求队列或令牌桶限速,将瞬时高峰平摊到时间窗口内,避免短时间集中调用。
  3. 多应用分流:单应用 QPS 配额是独立维度,可将业务按场景拆分到多个应用,分摊单应用并发压力;同时注意账号总流量上限仍合并计算。
  4. 备选应用 fallback:业务侧维护备选应用列表,主应用触发限流时切换到备选应用继续处理,降低失败率。
  5. 异步化与批处理:无需实时响应的请求改用工作流异步任务或批量处理,避开同步调用的瞬时并发压力。
  6. 提前申请扩容:预计业务将有明显增长时,联系阿里云对接商务经理申请提额,避免正式上量时被限流。

工作流报模型限流怎么办?

错误码同样为 Throttling.AllocationQuota,但触发位置是工作流节点调用的模型,与应用维度限流无关。请按对应模型的 RPM/TPM 配额排查。