Pour savoir comment la « zero data retention » (rétention zéro des données), ou ZDR, s'applique à cette fonctionnalité, consultez API et rétention des données.
Le paramètre effort vous permet de contrôler le nombre de tokens que Claude dépense lorsqu'il répond aux requêtes. Vous pouvez arbitrer entre l'exhaustivité des réponses et l'efficacité en tokens avec un seul modèle. Le paramètre effort est disponible sur les modèles suivants sans en-tête bêta requis.
Le paramètre effort est pris en charge par Claude Fable 5, Claude Mythos 5, Claude Opus 5, Claude Opus 4.8, Claude Mythos Preview, Claude Opus 4.7, Claude Opus 4.6, Claude Sonnet 5, Claude Sonnet 4.6 et Claude Opus 4.5.
Pour savoir comment l'effort interagit avec la réflexion et quel contrôle privilégier, consultez Réflexion et effort. Lorsque la réflexion adaptative est disponible, l'effort est le moyen recommandé pour contrôler la profondeur de réflexion.
Par défaut, Claude utilise un effort élevé, dépensant autant de tokens que nécessaire pour obtenir d'excellents résultats. Vous pouvez augmenter le niveau d'effort à max pour la capacité la plus élevée possible, ou le réduire pour être plus économe dans l'utilisation des tokens, en optimisant la vitesse et le coût tout en acceptant une certaine réduction de capacité.
Définir effort sur "high" produit exactement le même comportement que l'omission complète du paramètre effort.
Le paramètre effort affecte tous les tokens de la réponse, y compris :
Cette approche présente deux avantages majeurs :
| Niveau | Description | Cas d'usage typique |
|---|---|---|
max | Capacité maximale absolue sans contrainte sur la dépense en tokens. Disponible sur Claude Fable 5, Claude Mythos 5, Claude Opus 5, Claude Opus 4.8, Claude Mythos Preview, Claude Opus 4.7, Claude Opus 4.6, Claude Sonnet 5 et Claude Sonnet 4.6. | Tâches nécessitant le raisonnement le plus profond possible et l'analyse la plus approfondie |
xhigh | Capacité étendue pour le travail de longue haleine. Disponible sur Claude Fable 5, Claude Mythos 5, Claude Opus 5, Claude Opus 4.8, Claude Opus 4.7 et Claude Sonnet 5. | Tâches agentiques et de codage de longue durée (plus de 30 minutes) avec des budgets de tokens se comptant en millions |
high | Capacité élevée. Équivalent à ne pas définir le paramètre. | Raisonnement complexe, problèmes de codage difficiles, tâches agentiques |
medium | Approche équilibrée avec des économies de tokens modérées. | Tâches agentiques nécessitant un équilibre entre vitesse, coût et performance |
low | Le plus efficace. Économies de tokens significatives avec une certaine réduction de capacité. | Tâches plus simples nécessitant la meilleure vitesse et les coûts les plus bas, comme les sous-agents |
xhigh est un niveau plus récent ; certains modèles qui prennent en charge max ne prennent pas en charge xhigh.
L'effort est un signal comportemental, pas un budget de tokens strict. Aux niveaux d'effort inférieurs, Claude réfléchira toujours sur des problèmes suffisamment difficiles, mais il réfléchira moins qu'il ne le ferait à des niveaux d'effort supérieurs pour le même problème.
Claude Sonnet 5 utilise par défaut l'effort high sur l'API Claude et Claude Code.
Sonnet 4.6 utilise par défaut l'effort high. Définissez explicitement l'effort lorsque vous utilisez Sonnet 4.6 pour éviter une latence inattendue :
Commencez avec xhigh pour les cas d'usage de codage et agentiques, et utilisez high comme minimum pour la plupart des charges de travail sensibles à l'intelligence. Descendez à medium pour les charges de travail sensibles aux coûts, ou montez à max uniquement lorsque vos évaluations montrent une marge de progression mesurable à xhigh.
La valeur par défaut de l'API est high. Pour utiliser xhigh, définissez effort explicitement ; la valeur que vous transmettez remplace la valeur par défaut.
| Effort | Recommandations pour Claude Opus 4.7 |
|---|---|
low | Efficace, mais idéal pour les tâches courtes et bien délimitées. Associez low à des listes de contrôle explicites si votre tâche comporte plusieurs sections. |
medium | La solution toute prête pour le flux de travail moyen où vous souhaitez de bons résultats tout en réduisant les coûts. |
high | Cas d'usage avancés qui nécessitent encore un équilibre entre intelligence et consommation de tokens. C'est souvent le meilleur équilibre entre qualité et efficacité en tokens. |
xhigh | Le point de départ recommandé pour le travail de codage et agentique, et pour les tâches exploratoires telles que les appels d'outils répétés, la recherche web détaillée et la recherche dans des bases de connaissances. Attendez-vous à une utilisation de tokens nettement supérieure à high. |
max | À réserver aux problèmes véritablement à la pointe. Sur la plupart des charges de travail, max ajoute un coût significatif pour des gains de qualité relativement faibles, et sur certaines tâches de sortie structurée ou moins sensibles à l'intelligence, il peut conduire à une réflexion excessive. |
Claude Opus 4.7 respecte également les niveaux d'effort plus strictement que Claude Opus 4.6, en particulier à low et medium. Aux niveaux d'effort inférieurs, le modèle limite son travail à ce qui a été demandé plutôt que d'en faire plus que nécessaire. Si vous observez un raisonnement superficiel sur des problèmes complexes avec Claude Opus 4.7, augmentez l'effort plutôt que de contourner le problème par le prompt. Si vous devez maintenir un effort faible pour la latence, ajoutez des indications ciblées comme « Cette tâche implique un raisonnement en plusieurs étapes. Réfléchissez attentivement avant de répondre. »
Lorsque vous exécutez Claude Opus 4.7 à l'effort xhigh ou max, définissez un max_tokens élevé afin que le modèle ait la place de réfléchir et d'agir à travers les sous-agents et les appels d'outils. Commencer à 64k tokens et ajuster à partir de là est une valeur par défaut raisonnable.
Les recommandations pour Claude Opus 4.7 s'appliquent également à Claude Opus 4.8. Commencez avec xhigh pour les cas d'usage de codage et agentiques, utilisez high pour la plupart des autres charges de travail sensibles à l'intelligence, et descendez à medium ou low uniquement lorsque vous avez mesuré que le niveau inférieur maintient la qualité sur vos évaluations.
La valeur par défaut de l'API est high. Définissez effort explicitement pour utiliser un niveau différent ; la valeur que vous transmettez remplace la valeur par défaut.
Lorsque vous exécutez Claude Opus 4.8 à l'effort xhigh ou max, définissez un max_tokens élevé afin que le modèle ait la place de réfléchir et d'agir à travers les sous-agents et les appels d'outils. Commencer à 64k tokens et ajuster à partir de là est une valeur par défaut raisonnable.
Claude Opus 5 prend en charge les cinq niveaux d'effort. Commencez avec high, la valeur par défaut, et ajustez en fonction de vos évaluations : montez à xhigh pour le travail de codage et agentique exigeant, ou à max lorsqu'une tâche justifie une dépense en tokens sans contrainte, et utilisez low et medium librement comme contrôle principal du coût en tokens et du temps de réponse partout où vos évaluations montrent que la qualité se maintient. Si vous avez repris des réglages d'effort d'un modèle antérieur, effectuez un nouveau balayage d'effort sur vos évaluations plutôt que de les réutiliser.
L'effort contrôle le volume de réflexion, pas la longueur visible de la réponse : sur Claude Opus 5, modifier l'effort ne raccourcit pas les réponses de manière fiable, donc utilisez le prompt pour contrôler la longueur à la place.
La valeur par défaut de l'API est high. Définissez effort explicitement pour utiliser un niveau différent ; la valeur que vous transmettez remplace la valeur par défaut.
Sur Claude Opus 5, la réflexion ne peut pas être désactivée à l'effort xhigh ou max : les requêtes qui définissent thinking: {"type": "disabled"} à ces niveaux renvoient une erreur 400. Consultez Effort avec réflexion.
Lorsque vous exécutez Claude Opus 5 à l'effort xhigh ou max, définissez un max_tokens élevé afin que le modèle ait la place de réfléchir et d'agir à travers les sous-agents et les appels d'outils. Commencer à 64k tokens et ajuster à partir de là est une valeur par défaut raisonnable.
L'effort est le contrôle principal pour arbitrer entre intelligence, latence et coût sur Claude Fable 5. Commencez avec high, la valeur par défaut, pour la plupart des tâches, utilisez xhigh pour les charges de travail les plus sensibles à la capacité, et descendez à medium ou low pour le travail de routine. Les réglages d'effort inférieurs sur Claude Fable 5 restent performants et dépassent souvent les performances de xhigh sur les modèles précédents. À high et xhigh, définissez un max_tokens élevé : c'est une limite stricte sur la sortie totale, réflexion plus texte de réponse. Consultez Contrôle des coûts.
Réduisez l'effort si une tâche se termine mais prend plus de temps que nécessaire, ou si vous souhaitez un style de travail plus rapide et plus interactif. Les mêmes recommandations s'appliquent à Claude Mythos 5. Pour des recommandations plus complètes, consultez Prompting Claude Fable 5.
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-opus-5",
max_tokens=4096,
messages=[
{
"role": "user",
"content": "Analyze the trade-offs between microservices and monolithic architectures",
}
],
output_config={"effort": "medium"},
)
for block in response.content:
if block.type == "text":
print(block.text)Lors de l'utilisation d'outils, le paramètre effort affecte à la fois les explications autour des appels d'outils et les appels d'outils eux-mêmes. Les niveaux d'effort inférieurs ont tendance à :
Les niveaux d'effort supérieurs peuvent :
Le paramètre thinking contrôle si Claude réfléchit dans des blocs de réflexion avant de répondre ; le paramètre effort contrôle la quantité de travail que Claude consacre à l'ensemble de la réponse, ce qui, en mode adaptatif, inclut la fréquence et la profondeur de sa réflexion. Ne passez pas adaptive comme valeur d'effort : adaptive est un mode de réflexion, pas un niveau d'effort.
Aux niveaux d'effort supérieurs, Claude réfléchit sur la plupart des requêtes et plus longuement ; aux niveaux inférieurs, il peut ignorer complètement la réflexion pour les problèmes plus simples. Consultez Réflexion et effort pour des recommandations complètes sur la manière dont les deux contrôles fonctionnent ensemble.
Sur Claude Opus 4.5, le seul modèle à réflexion étendue uniquement qui prend en charge l'effort, celui-ci fonctionne conjointement avec budget_tokens : définissez le niveau d'effort pour votre tâche, puis définissez le budget de tokens de réflexion en fonction de la profondeur de raisonnement dont la tâche a besoin.
Pour la disponibilité de la réflexion par modèle, consultez le tableau de configuration par modèle. L'effort fonctionne avec ou sans réflexion ; consultez Comment fonctionne l'effort.
output_config.effort est un paramètre au niveau de la requête : chaque requête porte sa propre valeur, donc pour exécuter une partie ultérieure d'une conversation à un niveau d'effort différent, définissez la nouvelle valeur sur la requête suivante. Le niveau d'effort s'applique à l'ensemble de la requête. Comme l'effort façonne le prompt rendu, le modifier entre les requêtes ne préserve pas les préfixes mis en cache des tours précédents ; si vous comptez sur la mise en cache des prompts sur une longue session, choisissez un niveau d'effort au début et gardez-le constant.
high par défaut, mais le bon point de départ dépend de votre modèle et de votre charge de travail.Donnez à Claude un budget de tokens indicatif pour l'ensemble de la boucle agentique afin d'aider le modèle à s'autoréguler sur les longues tâches agentiques.
Comprenez la réflexion adaptative, où Claude décide quand et combien réfléchir, et orientez-la avec l'effort et le prompting.
Comprenez comment fonctionne la réflexion, quand Claude réfléchit par défaut, et comment la réflexion interagit avec l'effort.
Was this page helpful?