Claude Opus 5 surpasse GPT-5.6 Sol sur ARC-AGI-3
Claude Opus 5 d'Anthropic établit un nouveau record sur le benchmark ARC-AGI-3 avec 30,2%, loin devant GPT-5.6 Sol (7,8%). Le modèle a résolu 5 environnements inédits et démontre des capacités de raisonnement inédites, comme la traduction de tâches en notation algébrique.
« Opus 5 solved five previously unsolved environments, four of them at or above human level. » — The Decoder
Que faut-il retenir ?
- Claude Opus 5 score 30,2% sur ARC-AGI-3, contre 7,8% pour GPT-5.6 Sol.
- Le modèle a résolu 5 environnements inédits, dont 4 au niveau humain.
- Opus 5 a traduit des tâches en notation algébrique pour la première fois.
- Sur ARC-AGI-2 et ARC-AGI-1, Opus 5 obtient respectivement 90,4% et 97,5%.
Pourquoi cette nouvelle compte-t-elle ?
Ces résultats montrent une avancée significative dans le raisonnement autonome des IA, crucial pour les applications nécessitant une adaptation à des tâches nouvelles. La performance d'Opus 5 ouvre la voie à des systèmes plus capables sans assistance externe, impactant directement le développement de l'AGI.
30,2% de score sur ARC-AGI-3 par Claude Opus 5
💬 Greg Kamradt, Chercheur derrière ARC-AGI-3
Public concerné : développeurs, entreprises
Qu'est-ce qui explique la performance supérieure de Claude Opus 5 sur ARC-AGI-3 ?
Les chercheurs attribuent cette avancée à un meilleur raisonnement logique, permettant une exploration autonome et la résolution de tâches inédites. Des techniques comme le renforcement learning et l'étiquetage ciblé des données pourraient aussi avoir joué un rôle.
🔧 Outils mentionnés