La voz transforma la espera en silencio, el error en interrupción y la ambigüedad en una acción potencialmente irreversible. Un agente vocal debe comprender un audio imperfecto, gestionar los turnos de palabra, consultar herramientas y responder con una latencia lo suficientemente baja para mantenerse natural. También debe permitir al usuario corregir, solicitar un humano y saber que está hablando con una IA.
Los modelos de voz a voz y las API en tiempo real avanzaron en 2026. La producción sigue siendo un problema de sistema: medios, red, identidad, políticas, herramientas, supervisión y centro de contacto.
Los modelos, precios, regiones y funciones de voz deben ser confirmados en las documentaciones oficiales antes de su implementación.
Definir el papel del agente
Los usos pueden ser:
- recepción y orientación ;
- calificación ;
- programación de citas ;
- consulta de un estatuto;
- asistencia interna;
- recopilación estructurada;
- recordatorio;
- tratamiento de solicitudes simples.
Las acciones de alto impacto — pago, modificación contractual, asesoramiento regulado — requieren autenticación, confirmación y, a veces, un humano.
El guion debe especificar lo que el agente no hace y cómo transfiere.
Dos arquitecturas de audio
Tubería en cascada
Reconocimiento de voz, texto, LLM, síntesis. Cada componente es controlable y reemplazable. La cadena añade latencia y puede perder información prosódica.
Modelo de habla a habla
El modelo procesa y genera el audio de manera más integrada, a veces en modo full-duplex. La conversación puede ser más natural. Se debe prever el control de las transcripciones, de la voz y de las salidas estructuradas.
Una arquitectura híbrida puede conservar una transcripción de trabajo y herramientas estructuradas alrededor de un modelo en tiempo real.
Transporte y sesión
WebRTC es adecuado para navegadores y aplicaciones en tiempo real; la telefonía puede pasar por SIP o un proveedor. La sesión debe gestionar:
- negociación de medios;
- códecs ;
- pérdida de paquetes;
- temblor ;
- enrutamiento regional ;
- reanudación;
- autenticación ;
- cifrado ;
- fin de la llamada.
Los tokens del lado del cliente son cortos y limitados. Los secretos de la plataforma permanecen del lado del servidor.
Construir un presupuesto de latencia
La experiencia depende del tiempo antes de una señal de escucha y del tiempo antes de una respuesta útil. Los pasos son:
- transporte entrante ;
- detección de voz o comprensión continua;
- inferencia ;
- herramienta ;
- generación de audio ;
- transporte saliente.
Canalización de un agente vocal desde el transporte de audio hasta las herramientas, la respuesta y la transferencia humana.
Gestionar los turnos de palabra
Un sistema clásico espera un silencio para decidir que el usuario ha terminado. Un silencio demasiado corto corta; demasiado largo ralentiza. Los modelos full-duplex pueden escuchar y hablar simultáneamente, pero deben gestionar interrupción y superposición.
El usuario debe poder interrumpir. El audio en curso se detiene, el estado se actualiza y las acciones no confirmadas se cancelan. El sistema distingue un ruido de una corrección.
Los indicios visuales o sonoros indican escucha, procesamiento y transferencia sin simular una presencia humana engañosa.
No ocultar los tiempos de herramienta
Una llamada de CRM o una búsqueda puede tardar varios segundos. El agente puede confirmar la tarea, proporcionar información intermedia exacta o proponer un recordatorio. No debe inventar una conversación de relleno.
Las herramientas tienen tiempos de espera, reintentos, idempotencia y estado. Una operación larga se vuelve asincrónica y el resultado se confirma cuando es real.
Autenticar sin degradar la experiencia
La voz por sí sola no es una prueba de identidad suficiente. Según el riesgo, utilizar:
- información conocida no sensible;
- código de un solo uso;
- enlace en un canal autenticado;
- conexión de aplicación ;
- transferencia a un asesor;
- reautenticación antes de la acción.
El agente nunca solicita un secreto completo e innecesario. Las respuestas están ocultas en los registros y en la síntesis de voz.
Confirmación de acciones
Antes de una acción, el agente repite los parámetros esenciales: objeto, fecha, monto, destinatario o consecuencia. La confirmación se refiere a esta versión y expira.
Para datos difíciles de entender oralmente, se puede enviar un resumen escrito en un canal seguro. El usuario puede corregir un solo campo sin tener que reiniciar toda la conversación.
Consentimiento y transparencia
La llamada indica claramente el uso de una IA y los fines pertinentes. Si la conversación se graba o transcribe, la información y la base aplicable deben establecerse con los responsables competentes.
La recolección se minimiza. La transcripción, el audio, el resumen, los metadatos y la retroalimentación pueden tener duraciones diferentes. La elección de voz no debe imitar a una persona sin autorización.
Transcripción y datos sensibles
La transcripción puede contener nombre, salud, pago o secreto. Los accesos, la retención y el enmascaramiento están definidos. Los datos no se envían a herramientas no autorizadas.
Un puntaje de confianza de transcripción puede desencadenar una solicitud de repetición. Los nombres propios, direcciones y referencias son confirmados, a veces mediante deletreo o canal de texto.
Diseñar las herramientas
Las herramientas vocales deben ser cortas y estructuradas. El modelo no lee una respuesta técnica bruta. Una capa transforma los estados en frases exactas y seguras.
Las acciones están limitadas, auditadas y verificadas. El modelo no puede elegir libremente un destinatario externo ni ampliar sus derechos.
Transferencia humana
La transferencia debe estar accesible en todo momento o según reglas. El asesor recibe, con consentimiento y derecho apropiado:
- razón ;
- etapas completadas ;
- identidad verificada ;
- datos recopilados;
- puntos inciertos ;
- acciones pendientes.
El usuario no repite toda su historia. Si ningún asesor está disponible, el sistema propone una alternativa real.
Modo degradado
En caso de ruido, red débil, modelo no disponible o herramienta lenta:
- pedir que repita;
- pasar al teclado/texto;
- limitar las acciones ;
- transferir ;
- crear un recordatorio;
- terminar adecuadamente.
Una falla no debe dejar una acción en un estado desconocido.
Evaluar la calidad
El conjunto de pruebas incluye:
- acentos ;
- ruido ;
- superposición;
- interrupciones ;
- nombres ;
- nombres ;
- ambigüedades;
- emoción ;
- idiomas ;
- rechazo ;
- herramientas;
- transferencia.
Medir el éxito de la tarea, correcciones, tiempo, latencia p95, tasa de transferencia, errores críticos, satisfacción y costo. Los evaluadores escuchan extractos autorizados según una política.
Observabilidad en tiempo real
Seguir la calidad de la red, paquetes, latencia, giros, interrupciones, llamadas de herramientas, errores, desconexiones, costos y escaladas. El identificador de sesión enlaza medios y negocio sin almacenar más de lo necesario.
Las alertas detectan un aumento de silencio, abandono o repeticiones.
Costo
El costo combina audio entrante/saliente, modelo, telefonía, herramientas, almacenamiento, transcripción, supervisión y transferencia humana. Se relaciona con una tarea resuelta.
El enrutamiento puede reservar los modelos más capaces para las conversaciones complejas. Las llamadas no urgentes pueden utilizar una devolución de llamada asincrónica.
Un despliegue progresivo
Comenzar con un motivo simple, con horarios y población limitados, luego analizar cada fracaso. Las acciones sensibles permanecen en propuesta. La capacidad se amplía cuando la latencia, la calidad y la transferencia están bajo control.
Partitech puede diseñar la plataforma en tiempo real, integrar las herramientas de negocio, asegurar la identidad y construir la campaña de evaluación. El objetivo es una voz útil y transparente, capaz de actuar sin sacrificar el control ni la calidad del servicio.
Hablemos de su proyecto
Prototipar e industrializar un agente vocal de negocios con Partitech. Contacte a Partitech.