Claude Platform on AWS: 本页的速率限制适用于 Claude Platform on AWS,但计费和限制管理有所不同。计费通过 AWS Marketplace 进行(而非 Anthropic 积分购买)。Claude Platform on AWS 上的组织被置于 Start 层级,并且不会在使用层级之间自动移动。要申请更高的限制,请联系您的 Anthropic 客户代表或 Anthropic 支持;Request rate limit increase 流程不可用。支出限制在 Settings > Billing 中设置,而不是 Settings > Limits。按工作区的速率限制配置和快速模式在 Claude Platform on AWS 上不可用。有关详细信息,请参阅 Claude Platform on AWS 上的速率限制和配额。
限制有两种类型:
API 在组织级别强制执行服务配置的限制,但您也可以为组织的工作区设置用户可配置的限制。
Claude Platform on AWS: 支出限制在 Claude Platform on AWS 上的工作方式有所不同。请在 Settings > Billing 中设置支出限制,而不是 Settings > Limits。请参阅 Claude Platform on AWS 上的支出限制,了解支出上限和自行设置的支出限制如何适用于您的组织。
Start、Build 和 Scale 层级各自都有每月支出上限,即您的组织每个日历月可在 API 上花费的最大金额。一旦达到您层级的支出上限,API 使用将暂停至下个月,除非您申请更高的限制。您可以在 Limits 页面上查看您组织的每月支出上限。
| 使用层级 | 每月支出上限 |
|---|---|
| Start | $500 美元 |
| Build | $1,000 美元 |
| Scale | $200,000 美元 |
Custom 层级的组织没有每月支出上限;限制由其客户团队安排。
您还可以设置低于您层级上限的自定义支出限制来控制成本:
导航到 Limits 页面
在 Claude Console 中转到 Settings > Limits。
打开支出限制编辑器
在 Spend limits 部分,点击 Change Limit(如果当前未设置限制,则点击 Set spend limit)。
调整您的支出限制
输入新值。您的支出限制不能超过当前层级的上限。
Messages API 的速率限制按每个模型类别以每分钟请求数(RPM)、每分钟输入令牌数(ITPM)和每分钟输出令牌数(OTPM)来衡量。
如果您超过任何速率限制,您将收到 429 错误,说明超过了哪个速率限制,并附带一个 retry-after 标头,指示需要等待多长时间。
如果您的组织使用量急剧增加,您也可能因 API 上的加速限制而遇到 429 错误。为避免触发加速限制,请逐步增加流量并保持一致的使用模式。
许多 API 提供商使用合并的"每分钟令牌数"(TPM)限制,可能包括所有令牌,无论是缓存的还是未缓存的、输入还是输出。**对于大多数 Claude 模型,只有未缓存的输入令牌计入您的 ITPM 速率限制。**这是一个关键优势,使速率限制实际上比最初看起来更高。
ITPM 速率限制在每个请求开始时进行估算,并在请求期间调整估算值以反映实际使用的输入令牌数。
以下是计入 ITPM 的内容:
input_tokens(最后一个缓存断点之后的令牌)✓ 计入 ITPMcache_creation_input_tokens(正在写入缓存的令牌)✓ 计入 ITPMcache_read_input_tokens(从缓存读取的令牌)✗ 对于大多数模型不计入 ITPMinput_tokens 字段仅代表出现在最后一个缓存断点之后的令牌,而不是请求中的所有输入令牌。要计算总输入令牌数:
total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens这意味着当您有缓存内容时,input_tokens 通常会比您的总输入小得多。例如,对于一个 200k 令牌的缓存文档和一个 50 令牌的用户问题,即使总输入是 200,050 个令牌,您也会看到 input_tokens: 50。
就大多数模型的速率限制而言,只有 input_tokens + cache_creation_input_tokens 计入您的 ITPM 限制,这使得提示缓存成为提高有效吞吐量的有效方法。
**示例:**在 2,000,000 ITPM 限制和 80% 缓存命中率的情况下,您实际上每分钟可以处理 10,000,000 个总输入令牌(2M 未缓存 + 8M 缓存),因为缓存的令牌不计入您的速率限制。
Claude Haiku 3.5(在以下速率限制表中标有 †)也会将 cache_read_input_tokens 计入 ITPM 速率限制。
对于所有没有 † 标记的模型,缓存的输入令牌不计入速率限制,并按折扣价计费(基础输入令牌价格的 10%)。这意味着您可以通过使用提示缓存实现显著更高的有效吞吐量。
OTPM 速率限制在生成输出令牌时实时评估,仅计算实际生成的令牌。max_tokens 参数不会影响 OTPM 速率限制的计算,因此设置更高的 max_tokens 值不会对速率限制产生不利影响。
速率限制对每个模型分别应用;因此您可以同时使用不同的模型,直至各自的限制。 您可以在 Claude Console 的 Limits 页面上查看当前的速率限制和行为,或使用 Rate Limits API 以编程方式读取配置的限制。
速率限制目前在所有 inference_geo 值之间共享。带有 inference_geo: "us" 和 inference_geo: "global" 的请求从同一个速率限制池中扣除。
| 模型 | 每分钟最大请求数(RPM) | 每分钟最大输入令牌数(ITPM) | 每分钟最大输出令牌数(OTPM) |
|---|---|---|---|
| Claude Fable 5 | 1,000 | 500,000 | 100,000 |
| Claude Opus 5 | 1,000 | 2,000,000 | 400,000 |
| Claude Opus 4.x* | 1,000 | 2,000,000 | 400,000 |
| Claude Sonnet 5 | 1,000 | 2,000,000 | 400,000 |
| Claude Sonnet 4.x** | 1,000 | 2,000,000 | 400,000 |
| Claude Haiku 4.5 | 1,000 | 2,000,000 | 400,000 |
| Claude Haiku 3.5(已停用,Bedrock 和 Google Cloud 除外) | 1,000 | 100,000† | 20,000 |
* Opus 速率限制是一个总限制,适用于 Claude Opus 4.8、Opus 4.7、Opus 4.6 和 Opus 4.5 的合并流量。Claude Opus 5 有单独的速率限制,不属于此合并桶。
** Sonnet 4.x 速率限制是一个总限制,适用于 Sonnet 4.6 和 Sonnet 4.5 的合并流量。Claude Sonnet 5 有单独的速率限制,不属于此合并桶。
† 该限制将 cache_read_input_tokens 计入 ITPM 使用量。
Message Batches API 有自己的一套速率限制,在所有模型之间共享。这些限制包括对所有 API 端点的每分钟请求数(RPM)限制,以及对可同时处于处理队列中的批处理请求数量的限制。这里的"批处理请求"是指 Message Batch 的一部分。您可以创建一个包含数千个批处理请求的 Message Batch,每个请求都计入此限制。当批处理请求尚未被模型成功处理时,它被视为处理队列的一部分。
| 每分钟最大请求数(RPM) | 处理队列中的最大批处理请求数 | 每批次最大批处理请求数 |
|---|---|---|
| 1,000 | 200,000 | 100,000 |
Claude 托管代理端点按组织进行速率限制。这些限制与上述 Messages API 速率限制是分开的。
| 操作 | 限制 |
|---|---|
| 创建端点(例如,代理、会话和环境) | 每分钟 300 个请求 |
| 读取端点(例如,检索、列出和流式传输) | 每分钟 1,200 个请求 |
在 Claude Opus 5、Opus 4.8 或 Opus 4.7 上使用带有 speed: "fast" 的快速模式(研究预览版)时,将应用与标准 Opus 速率限制分开的专用速率限制。当超过快速模式速率限制时,API 会返回带有 retry-after 标头的 429 错误。快速模式在 Claude Opus 4.6 上不可用:对 claude-opus-4-6 发出的带有 speed: "fast" 的请求将以标准速度运行。请参阅快速模式。
响应包含 anthropic-fast-* 标头,指示您的快速模式速率限制状态。有关这些标头的详细信息,请参阅快速模式速率限制。
您可以在 Claude Console 的 Usage 页面上监控您的速率限制使用情况。
除了提供令牌和请求图表外,Usage 页面还提供两个单独的速率限制图表。使用这些图表可以查看您还有多少增长空间、识别何时可能达到使用峰值、了解应申请哪些速率限制,以及学习如何提高缓存率。这些图表可视化给定速率限制(例如,按模型)的多项指标:
要申请更高的速率限制或更高的每月支出上限,请使用 Limits 页面上的 Request rate limit increase。
支持团队也可以提高限制。如有紧急需求,请联系 Anthropic 支持。
Claude Platform on AWS: Request rate limit increase 流程不可用。请联系您的 Anthropic 客户代表或 Anthropic 支持,并提供您需要提高限制的模型、每个模型的峰值每分钟输入和输出令牌数,以及您的输入中大致有多少比例是缓存或重复的上下文。请参阅 Claude Platform on AWS 上的速率限制和配额。
有关工作区的更多信息,请参阅工作区。
为了保护您组织中的工作区免受潜在的过度使用,您可以为每个工作区设置自定义的支出和速率限制。
示例:如果您组织的限制是每分钟 40,000 个输入令牌和每分钟 8,000 个输出令牌,您可以将某个工作区限制为每分钟 30,000 个输入令牌。这可以保护其他工作区免受潜在的过度使用,并确保资源在整个组织中更公平地分配。剩余的未使用的每分钟令牌数(如果该工作区未用完限制,则更多)可供其他工作区使用。
注意:
要以编程方式读取您当前的组织和工作区速率限制,请使用 Rate Limits API。
API 响应包含的标头会向您显示强制执行的速率限制、当前使用量以及限制何时重置。
返回以下标头:
| 标头 | 描述 |
|---|---|
retry-after | 在可以重试请求之前需要等待的秒数。提前重试将会失败。 |
anthropic-ratelimit-requests-limit | 在任何速率限制周期内允许的最大请求数。 |
anthropic-ratelimit-requests-remaining | 在被速率限制之前剩余的请求数。 |
anthropic-ratelimit-requests-reset | 请求速率限制将完全补充的时间,以 RFC 3339 格式提供。 |
anthropic-ratelimit-tokens-limit | 在任何速率限制周期内允许的最大令牌数。 |
anthropic-ratelimit-tokens-remaining | 在被速率限制之前剩余的令牌数(四舍五入到最接近的千位)。 |
anthropic-ratelimit-tokens-reset | 令牌速率限制将完全补充的时间,以 RFC 3339 格式提供。 |
anthropic-ratelimit-input-tokens-limit | 在任何速率限制周期内允许的最大输入令牌数。 |
anthropic-ratelimit-input-tokens-remaining | 在被速率限制之前剩余的输入令牌数(四舍五入到最接近的千位)。 |
anthropic-ratelimit-input-tokens-reset | 输入令牌速率限制将完全补充的时间,以 RFC 3339 格式提供。 |
anthropic-ratelimit-output-tokens-limit | 在任何速率限制周期内允许的最大输出令牌数。 |
anthropic-ratelimit-output-tokens-remaining | 在被速率限制之前剩余的输出令牌数(四舍五入到最接近的千位)。 |
anthropic-ratelimit-output-tokens-reset | 输出令牌速率限制将完全补充的时间,以 RFC 3339 格式提供。 |
anthropic-priority-input-tokens-limit | 在任何速率限制周期内允许的最大 Priority Tier 输入令牌数。(仅限 Priority Tier) |
anthropic-priority-input-tokens-remaining | 在被速率限制之前剩余的 Priority Tier 输入令牌数(四舍五入到最接近的千位)。(仅限 Priority Tier) |
anthropic-priority-input-tokens-reset | Priority Tier 输入令牌速率限制将完全补充的时间,以 RFC 3339 格式提供。(仅限 Priority Tier) |
anthropic-priority-output-tokens-limit | 在任何速率限制周期内允许的最大 Priority Tier 输出令牌数。(仅限 Priority Tier) |
anthropic-priority-output-tokens-remaining | 在被速率限制之前剩余的 Priority Tier 输出令牌数(四舍五入到最接近的千位)。(仅限 Priority Tier) |
anthropic-priority-output-tokens-reset | Priority Tier 输出令牌速率限制将完全补充的时间,以 RFC 3339 格式提供。(仅限 Priority Tier) |
anthropic-ratelimit-tokens-* 标头显示当前生效的最严格限制的值。例如,如果您超过了工作区的每分钟令牌限制,标头将包含工作区每分钟令牌速率限制的值。如果工作区限制不适用,标头将返回剩余的总令牌数,其中总数是输入和输出令牌的总和。这种方法确保您能够了解当前 API 使用中最相关的约束。
Was this page helpful?