Claude Platform on AWS: 本頁的速率限制適用於 Claude Platform on AWS,但計費和限制管理有所不同。計費是透過 AWS Marketplace(而非 Anthropic 點數購買)。Claude Platform on AWS 上的組織會被置於 Start 層級,且不會在用量層級之間自動移動。若要申請更高的限制,請聯繫您的 Anthropic 客戶代表或 Anthropic 支援;Request rate limit increase 流程不可用。支出限制是在 Settings > Billing 中設定,而非 Settings > Limits。每個工作區的速率限制設定和快速模式在 Claude Platform on AWS 上不可用。詳情請參閱 Claude Platform on AWS 上的速率限制與配額。
限制有兩種類型:
API 在組織層級強制執行服務設定的限制,但您也可以為組織的工作區設定使用者可配置的限制。
Claude Platform on AWS: 支出限制在 Claude Platform on AWS 上的運作方式不同。請在 Settings > Billing 中設定支出限制,而非 Settings > Limits。請參閱 Claude Platform on AWS 上的支出限制,了解支出上限和自行設定的支出限制如何適用於您的組織。
Start、Build 和 Scale 層級各自都有每月支出上限,這是您的組織每個日曆月在 API 上可以花費的最高金額。一旦達到您層級的支出上限,API 使用將暫停至下個月,除非您申請更高的限制。您可以在 Limits 頁面上查看您組織的每月支出上限。
| 用量層級 | 每月支出上限 |
|---|---|
| Start | $500 美元 |
| Build | $1,000 美元 |
| Scale | $200,000 美元 |
Custom 層級的組織沒有每月支出上限;限制由其客戶團隊安排。
您也可以設定低於您層級上限的自訂支出限制來控制成本:
前往 Limits 頁面
前往 Claude Console 中的 Settings > Limits。
開啟支出限制編輯器
在 Spend limits 區段中,點擊 Change Limit(如果目前未設定限制,則點擊 Set spend limit)。
調整您的支出限制
輸入新的值。您的支出限制不能超過您目前層級的上限。
Messages API 的速率限制是以每個模型類別的每分鐘請求數(RPM)、每分鐘輸入 token 數(ITPM)和每分鐘輸出 token 數(OTPM)來衡量的。
如果您超過任何速率限制,您將收到 429 錯誤,說明超過了哪個速率限制,以及一個 retry-after 標頭,指示需要等待多長時間。
如果您的組織用量急劇增加,您也可能因為 API 上的加速限制而遇到 429 錯誤。為避免達到加速限制,請逐步增加您的流量並保持一致的使用模式。
許多 API 供應商使用合併的「每分鐘 token 數」(TPM)限制,可能包括所有 token,無論是快取或未快取、輸入或輸出。對於大多數 Claude 模型,只有未快取的輸入 token 會計入您的 ITPM 速率限制。 這是一個關鍵優勢,使速率限制實際上比最初看起來更高。
ITPM 速率限制在每個請求開始時進行估算,並在請求期間調整估算值以反映實際使用的輸入 token 數量。
以下是計入 ITPM 的項目:
input_tokens(最後一個快取斷點之後的 token)✓ 計入 ITPMcache_creation_input_tokens(正在寫入快取的 token)✓ 計入 ITPMcache_read_input_tokens(從快取讀取的 token)✗ 對於大多數模型不計入 ITPMinput_tokens 欄位僅代表出現在您最後一個快取斷點之後的 token,而非請求中的所有輸入 token。要計算總輸入 token 數:
total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens這表示當您有快取內容時,input_tokens 通常會比您的總輸入小得多。例如,對於一個 200k token 的快取文件和一個 50 token 的使用者問題,即使總輸入是 200,050 個 token,您也會看到 input_tokens: 50。
就大多數模型的速率限制而言,只有 input_tokens + cache_creation_input_tokens 計入您的 ITPM 限制,這使得提示快取成為提高有效吞吐量的有效方法。
範例: 在 2,000,000 ITPM 限制和 80% 快取命中率的情況下,您實際上每分鐘可以處理 10,000,000 個總輸入 token(2M 未快取 + 8M 快取),因為快取的 token 不計入您的速率限制。
Claude Haiku 3.5(在以下速率限制表格中以 † 標記)也會將 cache_read_input_tokens 計入 ITPM 速率限制。
對於所有沒有 † 標記的模型,快取的輸入 token 不計入速率限制,並以較低的費率計費(基本輸入 token 價格的 10%)。這表示您可以透過使用提示快取來實現顯著更高的有效吞吐量。