Trois modèles en deux mois, et voici déjà le quatrième. Le 24 juillet, Anthropic a dévoilé Claude Opus 5, un modèle phare censé répondre à la principale plainte des clients professionnels ces derniers mois: les factures de tokens grimpent plus vite que la valeur réelle apportée par les modèles.
Opus 5 coûte exactement le même prix que son prédécesseur Opus 4.8: 5 dollars par million de tokens en entrée, 25 dollars par million en sortie. Pourtant, sur Frontier-Bench et GDPval-AA, des tests basés sur des tâches de travail réelles, ses scores ont plus que doublé. Sur ARC-AGI 3, qui mesure la capacité à résoudre des problèmes inédits, Opus 5 obtient un score trois fois supérieur au modèle suivant. Au niveau d'effort maximal sur CursorBench 3.2, il se situe à moins de 0,5% du meilleur score de Claude Fable 5, pour moitié moins cher par tâche.
La grande nouveauté, c'est un curseur d'effort: faible, moyen, élevé. L'utilisateur décide lui-même d'économiser des tokens sur une tâche simple ou de laisser le modèle réfléchir plus longtemps sur une tâche complexe. Il existe aussi un Fast Mode, environ 2,5 fois plus rapide, au double du tarif de base. Les développeurs peuvent désormais changer les outils disponibles en plein milieu d'une conversation sans invalider le cache du prompt, un détail qui, à l'échelle d'une API, représente de vraies économies.
Quelques réserves s'imposent. Selon les propres audits comportementaux d'Anthropic, Opus 5 affiche le score de désalignement le plus bas parmi tous ses modèles: il triche moins et trompe moins l'utilisateur. En revanche, il reste derrière Claude Mythos 5 sur les tâches de cybersécurité, et pour des projets réellement autonomes à plusieurs étapes, Anthropic recommande elle-même Fable 5 plutôt qu'Opus 5.
Le calendrier n'a rien d'un hasard. OpenAI avait tenu un discours similaire sur l'efficacité avec GPT-5.6 début juillet. Toute l'industrie se heurte au même mur: on ne peut plus faire grimper indéfiniment le prix de l'intelligence, et les entreprises choisissent désormais leurs modèles selon la facture de fin de mois, pas seulement selon les tableaux de benchmarks.



