Anthropic lance Claude Opus 5 : plus fort que Fable 5 sur les benchmarks, deux fois moins cher

Infographie des benchmarks de Claude Opus 5 d Anthropic illustration RoboActu

Anthropic a lancé Claude Opus 5 le 24 juillet 2026. Le modèle sort seulement deux mois après Opus 4.8 (disponible depuis le 28 mai) et deux semaines après la série Fable. Ce calendrier serré illustre le rythme des releases chez Anthropic, et Opus 5 arrive avec des benchmarks qui devraient faire réfléchir ceux qui pensaient que Fable 5 était le modèle de référence pour tous les usages.

Mieux que Fable 5 sur les tâches de travail réel, deux fois moins cher par tâche

Sur Frontier-Bench v0.1, un benchmark de génie logiciel, Opus 5 dépasse tous les autres modèles et double les performances d’Opus 4.8 pour un coût par tâche inférieur. Sur CursorBench 3.2 en effort maximal, il se situe à 0,5 % du meilleur score de Fable 5, mais à la moitié du prix par tâche.

La même tendance se répète sur d’autres évaluations. Sur ARC-AGI 3, un test de raisonnement sur des problèmes nouveaux, Opus 5 score trois fois plus haut que le deuxième meilleur modèle. Sur Zapier AutomationBench, un benchmark de complétion de tâches métier, son taux de réussite est 1,5 fois supérieur au suivant pour le même coût. Sur OSWorld 2.0, un benchmark d’utilisation d’ordinateur, il dépasse Fable 5 à seulement un tiers du coût de ce dernier.

Le modèle qui vérifie son travail avant de conclure

Anthropic met en avant une capacité particulière d’Opus 5 : il vérifie son propre travail et itère jusqu’à réussir. En test interne, le modèle a reçu un dessin incomplet d’une pièce mécanique et a été chargé d’écrire un pipeline de vision par ordinateur complet. Il a identifié les ambiguïtés du brief, a demandé des clarifications ciblées, puis a produit un code fonctionnel. Ce comportement « proactif » distingue Opus 5 des modèles qui s’arrêtent au premier obstacle ou supposent les paramètres manquants.

En sciences de la vie, les améliorations sont chiffrées : 10,2 points de pourcentage supplémentaires par rapport à Opus 4.8 en chimie organique (inférence de structures moléculaires à partir de données de spectroscopie), et 7,7 points en biologie des protéines (prédiction de l’effet de mutations sur la fonction protéique).

Moins de restrictions, une nouvelle fonction « Automatic Fallbacks »

Fable 5 avait posé des problèmes à certains développeurs en raison de ses restrictions très fréquentes. Opus 5 corrige ce point : ses classifieurs de sécurité s’activent 85 % moins souvent que ceux de Fable. Il n’est pas soumis non plus à la politique de rétention de données de 30 jours qui s’applique à Fable et Mythos, un point sensible pour les usages professionnels.

Nouvelle fonctionnalité bêta en accompagnement : « Automatic Fallbacks ». Quand un prompt déclenche un classifieur de sécurité, l’API redirige automatiquement la requête vers un modèle moins puissant plutôt que de renvoyer une erreur. Les développeurs obtiennent une réponse fonctionnelle, pas un blocage. C’est un changement pratique pour les applications de production qui ne peuvent pas se permettre de gérer des rejets inattendus.

Nouveau modèle par défaut sur Claude Pro et Claude Max

Opus 5 devient le nouveau modèle par défaut sur Claude Max et le plus puissant disponible sur Claude Pro. Le prix est inchangé par rapport à Opus 4.8, ce qui signifie en pratique une réduction du coût à performance équivalente. Avec Fable 5, Mythos 5, Sonnet 5 et maintenant Opus 5 dans la famille 5, seul Haiku attend encore sa mise à jour vers la série 5.

Le briefing RoboActu

L’essentiel de la robotique, une fois par semaine.

Une sélection courte des annonces, usages et robots à suivre.

Continuer sur ce sujet

Comparer les robots