Skip to main content
RAG API

Rate Limiting

Request rate limits for each API endpoint

To ensure service stability, each API endpoint enforces a request rate limit (QPS — queries per second). Requests exceeding the limit return HTTP status code 429 Too Many Requests.

Knowledge Base Management APIs

APIEndpointMax QPS
Retrieval/rag/index/retrieve2,000
Query Index Job Status/rag/index_job/status20
List Documents/rag/index/files15
Get File Details/rag/list/index/file/details10
Create Knowledge Base & Import/rag/index/create_v210
Submit Import Job/rag/index/job/create10
List Knowledge Bases/rag/index/list10
Update Knowledge Base/rag/index/update10
Delete Knowledge Base/rag/index/delete10
Delete Document/rag/index/delete_file10
List Chunks/pipeline/{id}/chunklist10
Update Chunk/rag/index/chunk/update10
Delete Chunk/rag/index/chunk/delete10
Retrieve Monitoring Data/rag/index/monitor1

Data Ingestion APIs

APIEndpointMax QPS
Get File Details/describeFile10
Delete File/deleteFile10
Apply for File Upload Lease/applyFileUploadLease10
Register File/addFile10
List Categories/listCategory5
Add Category/addCategory5
Delete Category/deleteCategory5
List Files/listFile5
Get Connector/getConnector5
Batch Update File Tags/batchUpdateFileTag5
Add Connector/addConnector2
Bulk Import from Authorized OSS/addFilesFromAuthorizedOss5

Knowledge Retrieval & Question Answering

Rate limiting rules for knowledge retrieval (/knowledge/search) and knowledge Q&A (/knowledge/chat) are not yet published and will be updated later.

Handling Rate Limit Exceedance

When rate limiting is triggered, the API returns:
{
  "code": "Throttling",
  "status_code": 429,
  "message": "Requests rate limit exceeded, please try again later.",
  "request_id": "xxxxxxxx-xxxx-xxxx-xxxx-xxxxxxxxxxxx"
}
Recommendations:
  • Upon receiving a 429, implement exponential backoff retries (e.g., retry after 1s → 2s → 4s).
  • For batch operations, control concurrency to avoid traffic spikes.
  • For low-QPS endpoints such as monitoring data retrieval, consider client-side caching to reduce call frequency.
If the current rate limits do not meet your business needs, submit a support ticket to request a quota increase.
Overview
Managed Agent API
Sandbox API
Memory API
Flow Agent API
RAG API
Connector API
Framework Integration
Assistant API (Deprecating)
  • Overview