Die Google GmbH hat ein umfangreiches Update veröffentlicht Gemini 3 Deep Think â eine Plattform auf der Grundlage von denkendem kĂŒnstlichem Intellekt, die darauf ausgelegt ist, aktuelle Herausforderungen in Wissenschaft und Ingenieurwesen zu meistern.

Die Entwicklung der neuen Version Google Gemini 3 Deep Think erfolgte in Zusammenarbeit mit Wissenschaftlern â der Dienst soll komplexe Forschungsprobleme lösen, deren Aspekte möglicherweise keine klaren Grenzen oder eine einzige richtige Lösung haben und begleitende Daten unvollstĂ€ndig oder unsystematisch sein können. Die aktualisierte Plattform Deep Think ist der Versuch, ĂŒber abstrakte Theorien hinauszugehen und in den Bereich der praktischen Anwendung zu gelangen. Der neue Modus ist direkt in der Gemini-App verfĂŒgbar, kann jedoch nur von Abonnenten von Google AI Ultra genutzt werden; das Unternehmen wird auch erstmals den Zugang zu dem Dienst ĂŒber die API Gemini ermöglichen â Ingenieure, Forscher und Unternehmen mĂŒssen einen entsprechenden Antrag stellen.
Im Test Humanityâs Last Exam erreichte die Plattform Google Gemini 3 Deep Think 48,4 % ohne die Verwendung externer Tools; das Ergebnis im Benchmark ARC-AGI-2 betrug beispiellose 84,6 %. Im Programmier-Test Codeforces betrug die Elo-Bewertung 3455; bei den Aufgaben der Internationalen Mathematik-Olympiade 2025 zeigte das System ein Niveau einer Goldmedaille, dasselbe Ergebnis erzielte es bei den Aufgaben der Chemie- und Physik-Olympiade. Im CMT-Benchmark demonstrierte der Modus Google Gemini 3 Deep Think ein hohes Niveau im VerstĂ€ndnis der theoretischen Physik mit einem Ergebnis von 50,5 %.

Das Modell Gemini 3 Deep Think bildete die Grundlage fĂŒr einen KI-Agenten, der im Labor von Google DeepMind den Namen Aletheia. trĂ€gt. Er umfasst ein Werkzeug zur ĂberprĂŒfung von Hypothesen, die in natĂŒrlicher Sprache formuliert sind, um SchwĂ€chen in den vorgeschlagenen Lösungen zu identifizieren; es wurde ein iterativer Prozess zur Generierung und Anpassung von Lösungen vorgesehen. Wichtig ist, dass der Agent seine UnfĂ€higkeit, auf eine Anfrage zu antworten, anerkennen kann. Um mit komplexen Forschungen zu arbeiten, greift er auf den Google-Suchdienst und Web-Navigationsmittel zurĂŒck â bei der Erstellung von Zusammenfassungen der veröffentlichten Literatur gibt er keine nicht existierenden Links aus und bemĂŒht sich, Ungenauigkeiten bei Berechnungen zu vermeiden.
Die tatsĂ€chlichen und zukĂŒnftigen Leistungsstufen von Aletheia wurden von den Google-Entwicklern in fĂŒnf Kategorien unterteilt. In einem nahezu vollstĂ€ndig autonomen Modus hat der KI-Agent Wege zur Lösung von drei offenen Problemen, die vom Mathematiker PĂĄl ErdĆs formuliert wurden, skizziert â diese Untersuchung wurde mit dem Nullniveau bewertet, das âgeringe Neuheitâ entspricht. Im selben Modus schlug er auch eine Lösung fĂŒr ein weiteres Problem aus demselben Set vor und erreichte das erste Niveau oder âminimale Neuheitâ. Auf dem zweiten Niveau, âveröffentlicht tauglichâ, zeigte Aletheia Ergebnisse im autonomen Modus, im Modus der Zusammenarbeit mit Menschen und im Modus als Hilfswerkzeug. Der dritte (âsignifikanter Durchbruchâ) und der vierte (âbedeutender Durchbruchâ) sind fĂŒr den KI-Agenten bisher noch unerreichbar.
Auf Anweisung der Entwickler analysierte Aletheia 700 bisher ungelöste mathematische Probleme von ErdĆs und bewĂ€ltigte 13 davon. Allerdings hatte bei 9 der Probleme bereits eine bestehende Lösung gefunden, und tatsĂ€chlich als erstmals gelöst erscheinen nur 4 Probleme. DarĂŒber hinaus waren von 212 Lösungen, die die KI bereitstellte, nur 6,5 % âinhaltlich richtigâ. Die ĂŒbrigen hatten entweder grundlegende MĂ€ngel (68,5 %) oder lösten fĂ€lschlicherweise vom Agenten interpretierte Versionen der ursprĂŒnglichen Probleme (31,5 %).
Infolgedessen stimmten die Entwickler zu, dass ihre KI eine âNeigung hat, Fragen falsch zu verstehen, um sie leichter beantworten zu könnenâ, und bleibt âextrem anfĂ€llig fĂŒr Fehler im Vergleich zu Menschenâ. Mit anderen Worten, KI kann Mathematiker bisher nicht ersetzen.
Quellen:
Quelle: 3dnews.ru
