Le modèle GPT-5.6 Sol d'OpenAI a post-entraîné de manière autonome le modèle Luna plus petit après une seule « invite assez peu spécifiée » et a surpassé GPT-5.5 de 16,2 points sur un benchmark interne d'auto-amélioration récursive ; OpenAI a rapporté que Sol a obtenu un score de 59 sur un indice agrégé, un point derrière Fable 5 d'Anthropic, tout en coûtant environ un tiers par tâche, et a été livré avec cinq niveaux de raisonnement plus les modes « Max » et « Ultra ».