Google ha abierto el código del sistema de inteligencia artificial Magika para la detección del tipo de contenido de archivos

La compañía Google ha anunciado la apertura del código del proyecto Magika, diseñado para determinar el tipo de contenido basado en el análisis de los datos disponibles en un archivo. Magika puede identificar con precisión los lenguajes de programación, métodos de compresión, paquetes de instalación, código ejecutable, tipos de marcado, formatos de sonido, video, documentos e imágenes utilizados en el contenido.

A diferencia de proyectos similares que determinan el tipo MIME según el contenido, Magika se distingue por la aplicación de métodos de aprendizaje automático, alto rendimiento y una precisión excepcional en la identificación. El modelo fue entrenado utilizando el marco Keras con 25 millones de ejemplos de archivos y soporta el reconocimiento de 116 tipos de datos con una precisión mínima del 99%. El modelo está empaquetado en formato ONNX y tiene un tamaño de solo 1 MB. La implementación de métodos de aprendizaje profundo ha permitido aumentar la precisión de identificación en un 50% en comparación con el sistema anterior de Google basado en reglas manuales.

Google ha abierto el código del sistema de inteligencia artificial Magika para la detección del tipo de contenido de archivos

En Google, el sistema se utiliza para clasificar archivos en los servicios de Gmail, Drive, Code Insight y Safe Browsing durante las verificaciones de seguridad y cumplimiento normativo. Se está trabajando en la integración de Magika en la plataforma VirusTotal como un componente para la filtración inicial de archivos antes de realizar análisis específicos. La configuración desplegada en la infraestructura de Google permite escanear varios millones de archivos por segundo y varios cientos de miles de millones de archivos por semana. Después de cargar el modelo, el tiempo para generar una salida es de 5-6 ms cuando se prueba en un núcleo de CPU. El tiempo de identificación casi no depende del tamaño del archivo.

Para implementar Magika en sus proyectos, se han preparado una utilidad de línea de comandos, un paquete para Python y una biblioteca de JavaScript que puede funcionar en el navegador o en proyectos basados en Node.js. La interfaz de línea de comandos y la API soportan la ejecución de operaciones en modo por lotes, es decir, permiten verificar varios archivos en una sola solicitud. Hay un modo de escaneo recursivo que examina todo el contenido de un directorio y tres modos de predicción para ajustar la resistencia a errores (alta confianza, confianza media y mejor suposición).

Google ha abierto el código del sistema de inteligencia artificial Magika para la detección del tipo de contenido de archivos


Fuente: opennet.ru
Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster