La voce trasforma l'attesa in silenzio, l'errore in interruzione e l'ambiguità in un'azione potenzialmente irreversibile. Un agente vocale deve comprendere un audio imperfetto, gestire i turni di parola, consultare strumenti e rispondere con una latenza sufficientemente bassa da rimanere naturale. Deve anche permettere all'utente di correggere, chiedere un umano e sapere che sta parlando con un'IA.
I modelli speech-to-speech e le API in tempo reale hanno fatto progressi nel 2026. La produzione rimane un problema di sistema: media, rete, identità, politiche, strumenti, supervisione e centro di contatto.
I modelli, i prezzi, le regioni e le funzioni vocali devono essere confermati nella documentazione ufficiale prima dell'implementazione.
Definire il ruolo dell'agente
Gli usi possono essere:
- accoglienza e orientamento;
- qualificazione ;
- presa di appuntamento ;
- consultazione di uno statuto;
- assistenza interna;
- raccolta strutturata;
- promemoria;
- trattamento di richieste semplici.
Le azioni ad alto impatto — pagamento, modifica contrattuale, consulenza regolamentata — richiedono un'autenticazione, una conferma e talvolta un umano.
Lo script deve precisare cosa l’agente non fa e come trasferisce.
Due architetture audio
Pipeline a cascata
Riconoscimento vocale, testo, LLM, sintesi. Ogni componente è controllabile e sostituibile. La catena aggiunge latenza e può perdere informazioni prosodiche.
Modello speech-to-speech
Il modello elabora e genera l'audio in modo più integrato, talvolta in full-duplex. La conversazione può essere più naturale. È necessario prevedere il controllo delle trascrizioni, della voce e delle uscite strutturate.
Un'architettura ibrida può conservare una trascrizione di lavoro e strumenti strutturati attorno a un modello in tempo reale.
Trasporto e sessione
WebRTC è adatto ai browser e alle applicazioni in tempo reale; la telefonia può passare tramite SIP o un fornitore. La sessione deve gestire:
- negoziazione dei media;
- codec ;
- perdita di pacchetti;
- tremolio ;
- instradamento regionale ;
- ripresa ;
- autenticazione ;
- crittografia ;
- fine dell’appello.
I token lato client sono brevi e limitati. I segreti della piattaforma restano sul lato server.
Costruire un budget di latenza
L'esperienza dipende dal tempo prima di un segno di ascolto e dal tempo prima di una risposta utile. I passaggi sono:
- trasporto in entrata ;
- rilevamento della parola o comprensione continua;
- inferenza ;
- strumento ;
- generazione audio ;
- trasporto in uscita.
Pipeline di un agente vocale dal trasporto audio fino agli strumenti, alla risposta e al trasferimento umano.
Gestire i turni di parola
Un sistema classico aspetta un silenzio per decidere che l’utente ha finito. Un silenzio troppo corto interrompe; troppo lungo rallenta. I modelli full-duplex possono ascoltare e parlare simultaneamente, ma devono gestire interruzioni e sovrapposizioni.
L’utente deve poter interrompere. L’audio in corso si ferma, lo stato viene aggiornato e le azioni non confermate vengono annullate. Il sistema distingue un rumore da una correzione.
Gli indizi visivi o sonori indicano ascolto, elaborazione e trasferimento senza simulare una presenza umana ingannevole.
Non nascondere i tempi dell'utensile
Una chiamata CRM o una ricerca può richiedere diversi secondi. L’agente può confermare il compito, fornire un’informazione intermedia precisa o proporre un richiamo. Non deve inventare una conversazione di riempimento.
Gli strumenti hanno timeout, tentativi, idempotenza e stato. Un'operazione lunga diventa asincrona e il risultato viene confermato quando è reale.
Autenticare senza degradare l'esperienza
La sola voce non è una prova sufficiente di identità. A seconda del rischio, utilizzare:
- informazione nota non sensibile ;
- codice a uso unico;
- link in un canale autenticato;
- connessione applicativa ;
- trasferimento a un consulente;
- ri-autenticazione prima dell'azione.
L'agente non chiede mai un segreto completo inutile. Le risposte sono nascoste nei log e nella sintesi vocale.
Conferma delle azioni
Prima di un'azione, l'agente ripete i parametri essenziali: oggetto, data, importo, destinatario o conseguenza. La conferma riguarda questa versione e scade.
Per dati difficili da capire a voce, un riepilogo scritto può essere inviato in un canale sicuro. L'utente può correggere un solo campo senza ricominciare tutta la conversazione.
Consenso e trasparenza
La chiamata indica chiaramente l’uso di un’IA e le finalità pertinenti. Se la conversazione è registrata o trascritta, le informazioni e la base applicabile devono essere stabilite con i responsabili competenti.
La raccolta è minima. Trascrizione, audio, riassunto, metadati e feedback possono avere durate diverse. La scelta della voce non deve imitare una persona senza autorizzazione.
Trascrizione e dati sensibili
La trascrizione può contenere nome, salute, pagamento o segreto. Gli accessi, la conservazione e la mascheratura sono definiti. I dati non vengono inviati a strumenti non autorizzati.
Un punteggio di fiducia della trascrizione può innescare una richiesta di ripetizione. I nomi propri, gli indirizzi e i riferimenti sono confermati, talvolta mediante sillabazione o canale testuale.
Progettare gli strumenti
Gli strumenti vocali devono essere brevi e strutturati. Il modello non legge una risposta tecnica grezza. Uno strato trasforma gli stati in frasi esatte e sicure.
Le azioni sono limitate, controllate e verificate. Il modello non può scegliere liberamente un destinatario esterno né ampliare i propri diritti.
Trasferimento umano
Il trasferimento deve essere accessibile in qualsiasi momento o secondo delle regole. Il consulente riceve, con consenso e diritto appropriato:
- ragione ;
- passi completati ;
- identità verificata ;
- dati raccolti ;
- punti incerti ;
- azioni in sospeso.
L'utente non ripete tutta la sua storia. Se nessun consulente è disponibile, il sistema propone un'alternativa reale.
Modalità degradato
In caso di rumore, rete debole, modello non disponibile o strumento lento:
- chiedere di ripetere;
- passare alla tastiera/testo ;
- limitare le azioni;
- trasferire;
- creare un promemoria;
- terminare correttamente.
Un guasto non deve lasciare un'azione in uno stato sconosciuto.
Valutare la qualità
Il gioco di test include:
- accenti ;
- rumore ;
- sovrapposizione ;
- interruzioni ;
- numeri ;
- nomi ;
- ambiguità ;
- emozione;
- lingue ;
- rifiuto;
- strumenti;
- trasferimento.
Misurare il successo del compito, le correzioni, il tempo, la latenza p95, il tasso di trasferimento, gli errori critici, la soddisfazione e i costi. I valutatori ascoltano estratti autorizzati secondo una politica.
Osservabilità in tempo reale
Monitorare la qualità della rete, pacchetti, latenza, giri, interruzioni, chiamate agli strumenti, errori, disconnessioni, costi ed escalation. L'identificativo di sessione collega media e business senza immagazzinare più del necessario.
Gli avvisi rilevano un aumento del silenzio, dell'abbandono o delle ripetizioni.
Costo
Il costo combina audio in entrata/uscita, modello, telefonia, strumenti, archiviazione, trascrizione, supervisione e trasferimento umano. È riferito a un compito risolto.
Il routing può riservare i modelli più capaci alle conversazioni complesse. Le chiamate non urgenti possono utilizzare un richiamo asincrono.
Un dispiegamento progressivo
Iniziare con un motivo semplice, con orari e popolazione limitati, poi analizzare ogni fallimento. Le azioni sensibili restano in proposta. La capacità si estende quando latenza, qualità e trasferimento sono sotto controllo.
Partitech può progettare la piattaforma in tempo reale, integrare gli strumenti di lavoro, garantire la sicurezza dell'identità e costruire la campagna di valutazione. L'obiettivo è una voce utile e trasparente, capace di agire senza sacrificare il controllo né la qualità del servizio.
Parliamo del tuo progetto
Prototipare e industrializzare un agente vocale professionale con Partitech. Contatta Partitech.