Ataque Whisper Leak por definición del tema de comunicación con chatbots AI a través del análisis del tráfico TLS

Investigadores de seguridad de Microsoft han desarrollado una técnica de ataque a través de canales laterales llamada Whisper Leak, que permite clasificar los temas de las consultas a servicios basados en grandes modelos de lenguaje a partir del análisis pasivo del tráfico cifrado transmitido a través de una conexión TLS. La información sobre el tamaño de los paquetes de red y los retrasos entre su transmisión fue suficiente para determinar los temas de las consultas a chatbots de IA con una precisión superior al 98%. En la práctica, el método propuesto puede aplicarse para identificar temas específicos de las consultas de los usuarios en el tráfico en tránsito, como intentos de obtener información sobre actividades ilegales, sin necesidad de descifrar el contenido.

Las herramientas para extraer datos de volúmenes de tráfico, entrenar modelos y probar la efectividad del método se han publicado en GitHub. Se ha demostrado la posibilidad de llevar a cabo el ataque en 28 populares grandes modelos de lenguaje de los principales proveedores. Por ejemplo, la precisión en la identificación de consultas sobre el tema "lavado de dinero" para muchos servicios de IA fue del 100%, en el caso de que hubiera 1 consulta relevante en el tráfico analizado y 10,000 consultas no relacionadas con el tema deseado.

Ataque Whisper Leak por definición del tema de comunicación con chatbots AI a través del análisis del tráfico TLS

La razón de la filtración de información es que los modelos generan una respuesta a la consulta de manera secuencial, token por token, utilizando cada token anterior como contexto para determinar la siguiente palabra o frase más probable. En consecuencia, cada token se envía en un paquete de red separado y el retraso entre los paquetes corresponde al tiempo que el modelo tarda en determinar el siguiente token.

En TLS, si no se utiliza compresión de datos, la diferencia del texto cifrado equivale al tamaño del texto sin cifrar más una constante. Al crear un modelo que relaciona conjuntos de tokens deseados con el tamaño de los paquetes y los retrasos entre su envío, es posible identificar con bastante precisión la presencia de los temas buscados en el tráfico. Durante la investigación se prepararon tres variantes de modelos de aprendizaje automático basados en arquitecturas de redes neuronales LightGBM, Bi-LSTM y BERT. Para cada modelo se realizaron experimentos para determinar el tema buscado analizando solo el tamaño de los paquetes, solo los retrasos entre los paquetes y ambos criterios.

Ataque Whisper Leak por definición del tema de comunicación con chatbots AI a través del análisis del tráfico TLS

Para reducir la efectividad del análisis pasivo de la temática de las consultas, se sugiere a los desarrolladores de servicios de IA adjuntar un relleno adicional aleatorio, almacenar en búfer la transmisión de tokens o realizar sustituciones de paquetes ficticios.

Fuente: opennet.ru

Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster