Google presentó Gemini 3 Deep Think: una poderosa IA para la ciencia que aún sigue "ajustando" tareas a las respuestas

La empresa Google ha lanzado una gran actualización Gemini 3 Deep Think — una plataforma basada en inteligencia artificial razonadora, diseñada para abordar problemas relevantes en ciencia e ingeniería.

Google presentó Gemini 3 Deep Think: una poderosa IA para la ciencia que aún sigue "ajustando" tareas a las respuestas

El desarrollo de la nueva versión Google Gemini 3 Deep Think se realizó en colaboración con científicos; el servicio está destinado a resolver complejas tareas de investigación, cuyos aspectos pueden no tener límites claros o una única solución correcta, y los datos relacionados pueden ser incompletos o no sistemáticos. La renovada plataforma Deep Think es un intento de ir más allá de la teoría abstracta y entrar en el ámbito de la aplicación práctica. El nuevo modo está disponible directamente en la aplicación Gemini, pero solo pueden usarlo los suscriptores de Google AI Ultra; la compañía también abrirá por primera vez el acceso al servicio a través de API Gemini — los ingenieros, investigadores y empresas deberán presentar la solicitud correspondiente.

En la prueba Humanity’s Last Exam, la plataforma Google Gemini 3 Deep Think obtuvo un 48,4 % sin utilizar herramientas externas; el resultado en el benchmark ARC-AGI-2 fue un 84,6 % sin precedentes. En la prueba de programación Codeforces, la calificación Elo fue de 3455; en las tareas de la Olimpiada Internacional de Matemáticas 2025, el sistema mostró un nivel de medalla de oro, el mismo resultado que logró en la resolución de problemas de las olimpiadas de química y física. En la prueba CMT-Benchmark, el modo Google Gemini 3 Deep Think demostró un alto nivel de dominio en física teórica con un resultado del 50,5 %.

Google presentó Gemini 3 Deep Think: una poderosa IA para la ciencia que aún sigue "ajustando" tareas a las respuestas

El modelo Gemini 3 Deep Think ha dado lugar a un agente de IA, que en el laboratorio Google DeepMind recibió el nombre de Aletheia. Incluye una herramienta para verificar hipótesis expresadas en lenguaje natural, con el fin de identificar fallos en las soluciones propuestas; se prevé un proceso iterativo de generación y ajuste de soluciones. Lo importante es que el agente puede reconocer su incapacidad para dar una respuesta a la consulta. Para trabajar en investigaciones complejas, recurre al servicio de búsqueda de Google y a herramientas de navegación web — al preparar resúmenes de la literatura publicada, no genera enlaces inexistentes y se esfuerza por evitar imprecisiones en los cálculos.

Los niveles actuales y futuros de logro de Aletheia han sido clasificados por los desarrolladores de Google en cinco categorías. En un modo prácticamente completamente autónomo, el agente de IA ha esbozado caminos para resolver tres problemas abiertos formulados por el matemático Pál Erdős; esta investigación se evaluó en un nivel cero, correspondiente a una "novedad insignificante". En ese mismo modo, propuso una solución para otro problema del mismo conjunto, alcanzando el primer nivel o "novedad mínima". En el segundo nivel, considerado "publicable", Aletheia mostró resultados en modo autónomo, en modo de colaboración con humanos y en modo de herramienta de apoyo. Los niveles tres ("avances significativos") y cuatro ("avances notables") aún no han sido conquistados por el agente de IA.

Por encargo de los desarrolladores, Aletheia analizó 700 problemas matemáticos no resueltos de Erdős y resolvió 13 de ellos. Sin embargo, ya existía una solución para 9 de esos problemas, y sólo 4 pueden considerarse realmente solucionados por primera vez. Más aún, de las 212 soluciones propuestas por la IA, solo el 6.5 % resultó ser "sustancialmente correcto". Las demás o presentaron defectos fundamentales (68.5 %) o resolvieron versiones mal interpretadas de los problemas originales (31.5 %).

Como resultado, los desarrolladores acordaron que su IA muestra una "tendencia a malinterpretar las preguntas de tal manera que sea más fácil responderlas" y sigue siendo "extremadamente propensa a errores en comparación con los humanos". En otras palabras, la IA aún no puede reemplazar a los matemáticos.

Fuentes:


Fuente: 3dnews.ru
Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster