Découvrez Claude Sonnet 5 : Le modèle Sonnet le plus agentic à ce jour

Anthropic a publié Claude Sonnet 5, un modèle de nouvelle génération conçu pour être le Sonnet le plus agentic à ce jour. Il peut établir des plans, utiliser des outils comme les navigateurs et les terminaux, et fonctionner de manière autonome à un niveau qui nécessitait auparavant des modèles plus grands et plus coûteux.
Nous sommes ravis d'annoncer que Claude Sonnet 5 est désormais en ligne sur VEGA AI. Voici les raisons pour lesquelles cette mise à jour constitue une étape majeure tant pour les développeurs que pour les professionnels.
Réduire l'écart avec Opus
Pendant longtemps, les gains les plus nets en matière d'exécution autonome étaient réservés aux modèles phares Opus. Sonnet 5 réduit cet écart : ses performances sont proches de celles d'Opus 4.8, mais au tarif inférieur de Sonnet. C'est une amélioration stricte par rapport à Sonnet 4.6 sur des repères agentic importants comme le raisonnement, l'utilisation des outils, le codage et le travail de connaissance.
Points forts et gains sur les benchmarks
Les premiers testeurs constatent régulièrement que Sonnet 5 est beaucoup plus autonome et résilient :
- Codage en continu : Sonnet 5 gère des tâches de programmation complexes, écrit des tests et refactorise du code legacy dificile avec aisance. Il peut remonter jusqu'à la cause racine d'une défaillance et proposer une correction durable en une seule passe.
- Utilisation d'outils en plusieurs étapes : Qu'il s'agisse de naviguer dans un navigateur ou d'écrire des commandes en terminal, Sonnet 5 reste sur la voie et exécute des séquences complexes d'actions avec une grande précision.
- Auto-correction : Le modèle vérifie lui-même ses sorties sans y être invité, identifiant et corrigeant les erreurs avant de livrer le résultat final.
Sécurité renforcée
Les évaluations de sécurité montrent que Sonnet 5 a un taux de comportements indésirables inférieur à celui de Sonnet 4.6, ce qui le rend plus sûr à déployer dans des contextes d'agents autonomes. Il refuse proprement et de manière cohérente les demandes non sécurisées tout en maintenant une grande utilité pour les tâches légitimes.