Alors que les capacités d’agent d’expédition deviennent un enjeu de table parmi les entreprises modèles de base, Anthropic lance Claude Sonnet 5, une version plus puissante et plus agentique du modèle de taille moyenne du laboratoire.
« Il peut faire des plans, utiliser des outils tels que des navigateurs et des terminaux, et fonctionner de manière autonome à un niveau qui, il y a quelques mois à peine, nécessitait des modèles plus grands et plus coûteux », a déclaré Anthropic dans un article de blog.
Ce cadre reflète ce qu’OpenAI et Google ont dit à propos de leurs propres versions récentes. Le GPT-5.6 Sol d’OpenAI a été lancé en avant-première la semaine dernière, et il s’agit également du modèle le plus agentique de l’entreprise à ce jour, permettant aux utilisateurs de répartir le travail entre sous-agents pour des tâches autonomes plus longues. Gemini 3.5 Flash de Google, lancé en mai, a été présenté comme un passage d’un chatbot conversationnel à un outil agent qui planifie, construit et itère sur un travail réel avec une intervention humaine minimale.
L’argumentaire de Sonnet 5 confirme que la capacité agentique est la nouvelle attente de base à chaque niveau de prix. Désormais, le différenciateur ne résidera pas dans la capacité à effectuer le mieux le travail agent, mais dans la mesure où ils peuvent le faire à moindre coût et avec quelle fiabilité sans surveillance humaine.
Le Sonnet 5 promet des performances proches de celles de l’Opus 4.8, mais pour des coûts bien inférieurs. À partir de mardi, Claude Sonnet 5 sera le modèle par défaut pour les forfaits gratuits et Pro et est disponible pour chaque abonnement.
Au lancement, Sonnet 5 coûte 2 $ par million de jetons d’entrée et 10 $ par million de jetons de sortie jusqu’au 31 août, après quoi le prix passera à 3 $ par million de jetons d’entrée et 15 $ par million de jetons de sortie. Cela rend Sonnet 5 moins cher que l’Opus 4.8, ainsi que le GPT-5.5 d’OpenAI et le Gemini 3.1 Pro de Google. (C’est toujours plus cher que Gemini 3.5 Flash.)
Le nouveau modèle démontre également des améliorations significatives par rapport à son prédécesseur Sonnet 4.6, sorti en février, sur les performances agentiques telles que le raisonnement, l’utilisation d’outils, le codage de logiciels et le travail de connaissances, selon Anthropic.
Par exemple, sur un benchmark, Sonnet 5 obtient un score de 63,2 % en matière de codage agent, contre 69,2 % pour Opus 4.8 et 58,1 % pour Sonnet 4.6. Sur un benchmark de travail de connaissances, Sonnet 5 surpasse en fait légèrement l’Opus 4.8, qui est connu pour gagner dans la résolution des problèmes les plus difficiles comme le jugement subtil et la recherche approfondie.
« Opus 4.8 reste le modèle de choix pour une plus grande précision sur ces tâches, mais Sonnet 5 offre aux développeurs des options moins chères et d’une qualité bien supérieure à celle disponible auparavant », explique Anthropic. « Entre Sonnet 5 et Opus 4.8, les utilisateurs peuvent ajuster le niveau d’effort pour trouver le bon équilibre entre coût et performances. »
Selon les testeurs cités dans le billet de blog, Sonnet 5 excelle également dans l’exécution de tâches complexes là où les versions précédentes du modèle se seraient arrêtées net et « vérifie sa propre sortie sans qu’on le lui demande explicitement ».
« Nous avons confié à Claude Sonnet 5 un travail en deux parties : mettre à jour les niveaux de compte Salesforce, envoyer une annonce de lancement aux contacts de l’entreprise – et tout s’est terminé de bout en bout », a déclaré Daniel Shepard, ingénieur senior chez Zapier, dans un communiqué. « Auparavant, cela bloquait à mi-chemin. Pour l’automatisation quotidienne, c’est une évidence. »
En matière de sécurité, Sonnet 5 démontre également un taux plus faible de « comportements indésirables » comme la coopération avec une mauvaise utilisation et des déceptions que son prédécesseur, ce qui rend son utilisation plus sûre dans des contextes agents. Il est plus efficace pour refuser les demandes malveillantes et éviter les tentatives de détournement lors d’attaques par injection rapide. Il hallucine également et se livre à un comportement de flagornerie à un rythme inférieur à celui de Sonnet 4.6.
Cela dit, ce n’est pas au même niveau que Opus 4.8 et Claude Mythos Preview en termes de comportement désaligné. « Les évaluations montrent également qu’il a une capacité bien inférieure à effectuer des tâches de cybersécurité dangereuses que nos modèles Opus actuels », peut-on lire sur le blog.
Le co-fondateur de Lovable, Fabian Hedin, a déclaré dans un communiqué que Claude Sonnet 5 « refuse les demandes dangereuses de manière propre et cohérente ».
« Chez Lovable, nous mettons des outils puissants entre les mains de millions de constructeurs », a déclaré Hedin. « Un modèle qui sait dire non est tout aussi important qu’un modèle qui sait construire. »
Mise à jour pour corriger le fait que le prix des jetons de sortie est de 15 $ par million de jetons de sortie après le 31 août.
Lorsque vous achetez via des liens dans nos articles, nous pouvons gagner une petite commission. Cela n’affecte pas notre indépendance éditoriale.

