Se ha publicado el modelo AI abierto hertz-dev para comunicación de voz a dúplex completo

La empresa Standard Intelligence ha anunciado la publicación de hertz-dev, el primer modelo de IA de código abierto para la síntesis de voz en modo dúplex completo, que puede usarse como base para la creación de sistemas de comunicación por voz en tiempo real o generación de habla conversacional. El modelo permite generar voz cercana a los datos de voz en los que fue entrenado, proporcionando interacción al estilo de una comunicación humana en vivo sin retrasos, que recuerdan a una conversación telefónica entrecortada. Los desarrollos del proyecto se distribuyen bajo la licencia Apache 2.0.

En un sistema con GPU NVIDIA GeForce RTX 4090, la latencia media antes de la generación es de 120 ms (teóricamente hasta 65 ms), lo que es aproximadamente el doble de rápido que los modelos existentes disponibles públicamente. La versión publicada está construida utilizando la arquitectura de 'transformador', abarca 8.5 mil millones de parámetros y fue entrenada utilizando 500 mil millones de tokens. El tamaño del contexto considerado por el modelo (número de tokens que el modelo puede procesar y recordar al generar voz) es de 2048 tokens o aproximadamente 4 minutos de habla.

Fuente: opennet.ru

Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster