Anthropic lance Claude Opus 5, au tarif de son prédécesseur (Opus 4.8), quelques semaines après avoir officialisé le très puissant Claude Fable 5 et le très capable Sonnet 5. L’intérêt et les limites de ce nouveau modèle émergent d’une lecture attentive de sa System Card. Derrière les records de performance, le document décrit un modèle conçu pour l’ère agentique et le pilotage des agents IA mais qui hallucine davantage, réinterprète parfois ses consignes et voit ses capacités offensives progresser sans avoir été entraîné pour.
Un mois et demi après Fable 5 et Mythos 5, Anthropic livre son Claude Opus 5 qui succède à Opus 4.8, son ancien modèle « frontière » sorti en mai dernier avant l’introduction de la classe « Mythos » dont Fable 5 fait partie. Dit autrement, « Opus » n’est plus le sommet absolu de l’IA chez l’éditeur. Ce rôle revient désormais à Claude Fable 5, plus performant mais aussi deux fois plus cher. Opus 5 devient plutôt le modèle premium destiné à un usage quotidien en entreprise : une intelligence proche de Fable, au prix de son prédécesseur Opus 4.8, soit 5 dollars le million de jetons en entrée, 25 en sortie, la moitié de celui de Fable 5.Il est d’ores et déjà disponible sur l’assistant Claude AI et via l’API Claude mais aussi sur AWS Bedrock, Google Cloud et Microsoft Foundry. Le modèle devient l’option par défaut de l’abonnement Max et le plus puissant accessible sur l’abonnement Pro de Claude AI.Du côté de l’API, un mode rapide (« Fast »), environ deux fois et demie plus véloce, se facture au double du tarif de base.
Opus 5 dispose d’une fenêtre contextuelle d’un million de jetons, peut produire jusqu’à 128 000 jetons par réponse et active désormais son raisonnement adaptatif par défaut. Son niveau d’effort peut être réglé de « low » à « max », avec des conséquences directes sur la qualité, la consommation de jetons et la latence. Anthropic avertit d’ailleurs les développeurs que les limites de sortie doivent être revues, puisqu’elles englobent maintenant le raisonnement interne et la réponse visible. Ce changement n’est pas anodin. Opus 5 n’est pas simplement un modèle qui répond mieux. Il est entraîné pour enquêter, utiliser des outils, déléguer à des sous-agents, contrôler ses résultats puis poursuivre son travail jusqu’à obtenir un résultat exploitable. Anthropic recommande même de supprimer des anciens prompts les instructions demandant explicitement une vérification finale : Opus 5 vérifie déjà spontanément son travail et risque sinon de tomber dans la sur-vérification.
Les mesures publiées par l’éditeur justifient que l’on accorde au modèle toute notre attention. Sur SWE-bench Verified...
[Courte citation de 8% de l'article original]