Google heeft een grote update uitgebracht Gemini 3 Deep Think — een platform op basis van redenerende kunstmatige intelligentie dat is ontworpen om actuele problemen in de wetenschap en techniek op te lossen.

De ontwikkeling van de nieuwe versie van Google Gemini 3 Deep Think is uitgevoerd in samenwerking met wetenschappers; de service is bedoeld om complexe onderzoeksproblemen op te lossen, waarvan de aspecten misschien geen duidelijke grenzen of een enkel juist antwoord hebben, en de bijbehorende gegevens incompleet of onsystematisch kunnen zijn. Het vernieuwde Deep Think-platform is een poging om de abstracte theorie te overstijgen en over te gaan naar praktische toepassingen. De nieuwe modus is direct toegankelijk in de Gemini-app, maar kan alleen worden gebruikt door abonnees van Google AI Ultra; het bedrijf zal ook voor het eerst toegang tot de service via de Gemini API openen — ingenieurs, onderzoekers en bedrijven moeten een overeenkomstige aanvraag indienen.
In de test Humanity’s Last Exam behaalde het Google Gemini 3 Deep Think-platform 48,4 % zonder gebruik van externe tools; het resultaat in de benchmark ARC-AGI-2 was een ongekende 84,6 %. In de programmeertest Codeforces had de Elo-rating 3455; in de problemen van de Internationale Wiskunde Olympiade 2025 bereikte het systeem een gouden medaille-niveau, hetzelfde resultaat werd behaald in het oplossen van problemen van de chemie- en natuurkunde-olympiades. In de CMT-Benchmark test toonde de modus van Google Gemini 3 Deep Think een hoog niveau van begrip van de theoretische natuurkunde met een resultaat van 50,5 %.

Het model Gemini 3 Deep Think vormt de basis voor een AI-agent die in het Google DeepMind-laboratorium de naam Aletheia. heeft gekregen. Het omvat een hulpmiddel voor het verifiëren van hypothesen die in natuurlijke taal zijn geformuleerd, om tekortkomingen in de voorgestelde oplossingen te identificeren; er is een iteratief proces voor de generatie en aanpassing van oplossingen. Belangrijk is dat de agent in staat is zijn onvermogen om een antwoord te geven op een verzoek te erkennen. Voor het werken met complexe onderzoeken maakt hij gebruik van de Google-zoekdienst en webnavigatie-tools — bij het voorbereiden van samenvattingen van gepubliceerde literatuur geeft hij geen niet-bestaande links en streeft hij ernaar onnauwkeurigheden bij berekeningen te vermijden.
De feitelijke en toekomstige niveaus van prestaties zijn door de ontwikkelaars van Aletheia onderverdeeld in vijf graden. In een vrijwel volledig autonome modus heeft de AI-agent oplossingen geschetst voor drie openstaande problemen, geformuleerd door de wiskundige Pál Erdős — dit onderzoek werd gewaardeerd op een nulniveau, wat overeenkomt met 'weinig nieuwheid'. In dezelfde modus stelde hij een oplossing voor een ander probleem uit dezelfde set voor, waarmee hij het eerste niveau of 'minimale nieuwheid' bereikte. Op het tweede niveau, 'publiceerbaar', toonde Aletheia resultaten in autonome modus, in samenwerking met mensen en in ondersteunende rol. De derde ('significante doorbraak') en vierde ('opmerkelijke doorbraak') zijn voor de AI-agent nog niet bereikt.
Op verzoek van de ontwikkelaars heeft Aletheia 700 nog niet opgeloste wiskundige vraagstukken van Erdős geanalyseerd en 13 ervan opgelost. Van deze 13 bleken echter 9 vraagstukken al een bestaand antwoord te hebben, en slechts 4 vraagstukken lijken daadwerkelijk voor het eerst te zijn opgelost. Bovendien was slechts 6,5 % van de 212 oplossingen die de AI heeft gegenereerd 'inhoudelijk correct'. De overige oplossingen hadden ofwel fundamentele tekortkomingen (68,5 %), ofwel verschilden ze in een verkeerd geïnterpreteerde versie van de oorspronkelijke vraagstukken (31,5 %).
Als gevolg hiervan stemden de ontwikkelaars ermee in dat hun AI een 'neiging vertoont om vragen verkeerd te begrijpen op een manier die het gemakkelijker maakt om te antwoorden' en extrem onderhevig blijft aan fouten in vergelijking met mensen. Met andere woorden, de AI kan wiskundigen op dit moment nog niet vervangen.
Bronnen:
Bron: 3dnews.ru
