Microsoft Research a lancé Lens, un modèle de conversion texte-image de 3,8 milliards de paramètres qui a égalé des concurrents beaucoup plus importants sur les tests de performance tout en s'entraînant à un coût bien moindre, en utilisant 800 millions de légendes d'images détaillées générées par GPT-4.1, et a publié le code et les poids sous une licence open-source.