Claude Opus 5 d'Anthropic a obtenu un score de 30,2 % sur le benchmark ARC-AGI-3, soit près de quatre fois le précédent record de GPT-5.6 Sol de 7,8 %, et les développeurs du benchmark ont indiqué que le modèle avait formulé indépendamment des équations de réflexion lors de l'évaluation.