PolyAI revoluciona el mundo de los agentes de voz con Dialog-RSN-1
¿Qué pasa cuando la inteligencia artificial se encuentra con el razonamiento audio-nativo? PolyAI tiene la respuesta con su último lanzamiento: Dialog-RSN-1. Este innovador modelo de diálogo está cambiando la forma en que los agentes de voz empresariales procesan y responden a las llamadas en vivo. Fusionando la toma de turnos, el reconocimiento de voz, la llamada de funciones y la generación de respuestas en un único modelo de lenguaje grande, Dialog-RSN-1 razona directamente sobre el audio sin procesar, en lugar de depender únicamente de una transcripción de texto.
¿Por qué Dialog-RSN-1 es diferente?
PolyAI ha logrado destacar la diferencia de Dialog-RSN-1 frente a las arquitecturas tradicionales de agentes de voz en cascada y modelos de voz a voz como GPT Realtime y Gemini Live. La clave está en mantener el conocimiento del audio solo en el lado de entrada, combinándolo con un sistema de conversión de texto a voz independiente. Esto permite a las empresas conservar el control sobre la voz que escuchan las personas que llaman, algo que otros modelos no logran.
Beneficios y capacidades de Dialog-RSN-1
- Latencias más bajas: Dialog-RSN-1 está manejando llamadas en vivo con las latencias más bajas medidas por PolyAI, respondiendo en menos de 300 milisegundos.
- Razonamiento audio-nativo: El modelo razona directamente sobre el audio sin procesar, capturando tono, vacilación y señales de sincronización que otros sistemas pierden.
- Control de la voz de salida: Al mantener la generación de voz separada, se conserva el control total sobre la voz de salida.
¿Cómo se construye Dialog-RSN-1?
Dialog-RSN-1 admite audio solo en el lado de entrada y transfiere la generación de voz a un sistema de texto a voz separado. El modelo se ejecuta como un sistema basado en solicitudes, evaluando la llamada a intervalos establecidos o señales acústicas para decidir cuándo responder. Construido mediante ajuste fino supervisado y ajuste fino de refuerzo sobre modelos base multimodales, Dialog-RSN-1 apunta a una latencia inferior a 300 milisegundos en las GPU A100.
Resultados y referencias
PolyAI evaluó Dialog-RSN-1 en Dialog-Eval, logrando la puntuación de calidad más alta entre los modelos con capacidad de tiempo real probados. En cuanto a la latencia, el modelo responde de manera confiable en menos de 300 milisegundos, superando a otros modelos en implementaciones en vivo. En términos de precisión y tasa de error de palabras, Dialog-RSN-1 se destaca por producir transcripciones más precisas que los modelos ASR dedicados probados por la compañía.
Disponibilidad y futuro
El lanzamiento inicial de Dialog-RSN-1 se enfoca en el inglés, pero se espera un soporte de idiomas más amplio en el futuro. Los clientes existentes de PolyAI pueden habilitar el modelo en sus proyectos, mientras que los nuevos clientes pueden solicitar acceso anticipado antes de la apertura de una API pública planificada.
Dialog-RSN-1 representa un paso adelante en la evolución de los agentes de voz empresariales, ofreciendo un enfoque único y eficiente para manejar las llamadas en vivo. Con su capacidad de razonamiento audio-nativo y control de la voz de salida, este modelo promete mejorar significativamente la experiencia del cliente y la eficiencia operativa para las empresas que adopten esta tecnología.




