L'entreprise Google a publié une importante mise à jour Gemini 3 Deep Think — une plateforme basée sur une intelligence artificielle réflexive, conçue pour résoudre des problèmes pertinents dans les domaines de la science et de l'ingénierie.

Le développement de la nouvelle version de Google Gemini 3 Deep Think a été réalisé en collaboration avec des chercheurs — ce service est destiné à résoudre des problèmes de recherche complexes, dont les aspects pourraient ne pas avoir de limites claires ou de solution unique, et les données associées peuvent être incomplètes ou désorganisées. La plateforme mise à jour Deep Think est une tentative d’aller au-delà de la théorie abstraite et de parvenir à une application pratique. Le nouveau mode est directement accessible dans l'application Gemini, mais seuls les abonnés à Google AI Ultra peuvent en profiter ; l'entreprise ouvrira également pour la première fois l'accès au service via l'API Gemini — les ingénieurs, chercheurs et entreprises devront soumettre une demande correspondante.
Dans le test Humanity’s Last Exam, la plateforme Google Gemini 3 Deep Think a obtenu 48,4 % sans utiliser d'outils externes ; le résultat dans le benchmark ARC-AGI-2 a atteint un incroyable 84,6 %. Dans le test de programmation Codeforces, le classement Elo était de 3455 ; dans les problèmes de l'Olympiade internationale de mathématiques 2025, le système a montré un niveau de médaille d'or, le même résultat ayant été atteint dans la résolution de problèmes d'olympiades de chimie et de physique. Dans le test CMT-Benchmark, le mode Google Gemini 3 Deep Think a démontré un haut niveau de maîtrise en physique théorique avec un résultat de 50,5 %.

Le modèle Gemini 3 Deep Think a donné naissance à un agent IA, qui dans le laboratoire Google DeepMind a été nommé Aletheia. Il inclut un outil de vérification des hypothèses formulées en langage naturel pour identifier les défauts dans les solutions proposées ; un processus itératif de génération et de correction des solutions est prévu. Il est important que l'agent puisse reconnaître son incapacité à répondre à une demande. Pour travailler sur des recherches complexes, il se connecte au moteur de recherche Google et aux outils de navigation web — lors de la préparation de synthèses de la littérature publiée, il ne fournit pas de liens inexistants et s'efforce d'éviter les inexactitudes dans les calculs.
Les niveaux de réalisation effectifs et prospectifs d'Aletheia, développés par Google, ont été répartis en cinq catégories. En mode presque entièrement autonome, l'agent IA a esquissé des voies pour résoudre trois problèmes ouverts formulés par le mathématicien Pál Erdős, cette recherche étant évaluée à un niveau nul, correspondant à une « nouveauté insignifiante ». Dans le même mode, il a proposé une solution à un autre problème du même ensemble, atteignant le premier niveau ou « nouveauté minimale ». Au deuxième niveau, « publiable », Aletheia a montré des résultats en mode autonome, en collaboration avec un humain et en mode d'outil d'assistance. Les troisième (« percée significative ») et quatrième (« percée marquante ») niveaux n'ont pas encore été conquis par l'agent IA.
Selon la tâche assignée, Aletheia a analysé 700 problèmes mathématiques non résolus d'Erdős et a réussi à en maîtriser 13. Cependant, pour 9 problèmes, une solution existait déjà, et seuls 4 problèmes semblent avoir été réellement résolus pour la première fois. De plus, parmi les 212 solutions fournies par l'IA, seulement 6,5 % étaient « substantiellement correctes ». Les autres présentaient soit des défauts fondamentaux (68,5 %), soit résolvaient des versions mal interprétées des problèmes d'origine par l'agent (31,5 %).
En conséquence, les développeurs ont reconnu que leur IA démontrait une « tendance à mal comprendre la question de manière à ce qu'il soit plus facile d'y répondre » et restait « extrêmement sujette aux erreurs par rapport aux humains ». En d'autres termes, l'IA ne peut pas encore remplacer les mathématiciens.
Sources :
Source : 3dnews.ru
