限制
客户端应遵守所选模型的上下文与请求限制。
调用限制可能来自模型、API Key、账号、钱包、请求速率或客户端配置。遇到限制时,先判断限制属于哪个层级。
限制类型
| 层级 | 需要检查的内容 |
|---|---|
| 模型能力 | 上下文、最大输出、输入类型、媒体大小和数量 |
| API Key | 预算、有效期、模型范围、单次费用和来源限制 |
| 账号与钱包 | 账号状态、可用余额和服务可用性 |
| 请求速率 | 单位时间请求量、Token 量或并发限制 |
| 客户端 | 超时、连接数、重试次数和请求队列 |
发送前检查
- 从模型说明获取实际限制值。
- 同时计算历史消息、当前输入和预留输出。
- 检查媒体文件和总请求体大小。
- 确认 API Key 的预算、有效期和模型范围。
- 在应用中设置合理的超时、并发和重试上限。
不要把一个模型的限制复制给所有模型。
限制触发后的处理
| 问题 | 处理方式 |
|---|---|
| 输入过长 | 删除不必要历史,压缩或拆分内容 |
| 输出上限无效 | 使用模型支持的字段和值 |
| Key 到期或预算不足 | 检查 Key 设置并按控制台流程处理 |
| 请求过多 | 排队、降低频率并减少并发 |
| 模型访问受限 | 核对账号、Key 和模型可用性 |
| 客户端超时 | 核对 Requests 中的原请求状态 |
充值不一定提高速率限制,也不会绕过模型能力和 API Key 策略。
申请调整限制
联系支持时,提供 Model ID、预计请求量、并发、平均输入和输出、业务时段以及 Request ID 示例。提交需求不表示限制已经调整,使用前请等待明确结果。