La voix transforme l’attente en silence, l’erreur en interruption et l’ambiguïté en action potentiellement irréversible. Un agent vocal doit comprendre un audio imparfait, gérer les tours de parole, consulter des outils et répondre avec une latence suffisamment faible pour rester naturel. Il doit aussi permettre à l’utilisateur de corriger, de demander un humain et de savoir qu’il parle à une IA.
Les modèles speech-to-speech et les API temps réel ont progressé en 2026. La production reste un problème de système : média, réseau, identité, politiques, outils, supervision et centre de contact.
Les modèles, prix, régions et fonctions de voix doivent être confirmés dans les documentations officielles avant mise en œuvre.
Définir le rôle de l’agent
Les usages peuvent être :
- accueil et orientation ;
- qualification ;
- prise de rendez-vous ;
- consultation d’un statut ;
- assistance interne ;
- collecte structurée ;
- rappel ;
- traitement de demandes simples.
Les actions à fort impact — paiement, modification contractuelle, conseil réglementé — nécessitent une authentification, une confirmation et parfois un humain.
Le script doit préciser ce que l’agent ne fait pas et comment il transfère.
Deux architectures audio
Pipeline en cascade
Reconnaissance vocale, texte, LLM, synthèse. Chaque composant est contrôlable et remplaçable. La chaîne ajoute de la latence et peut perdre des informations prosodiques.
Modèle speech-to-speech
Le modèle traite et génère l’audio de façon plus intégrée, parfois full-duplex. La conversation peut être plus naturelle. Le contrôle des transcriptions, de la voix et des sorties structurées doit être prévu.
Une architecture hybride peut conserver une transcription de travail et des outils structurés autour d’un modèle temps réel.
Transport et session
WebRTC est adapté aux navigateurs et applications temps réel ; la téléphonie peut passer par SIP ou un fournisseur. La session doit gérer :
- négociation média ;
- codecs ;
- perte de paquets ;
- jitter ;
- routage régional ;
- reprise ;
- authentification ;
- chiffrement ;
- fin d’appel.
Les jetons côté client sont courts et limités. Les secrets de plateforme restent côté serveur.
Construire un budget de latence
L’expérience dépend du délai avant un signe d’écoute et du délai avant une réponse utile. Les étapes sont :
- transport entrant ;
- détection de parole ou compréhension continue ;
- inférence ;
- outil ;
- génération audio ;
- transport sortant.
Outil local de cadrage
Atelier de cadrage
Structurez les décisions principales avant de lancer un atelier métier. Les réponses restent dans votre navigateur.
Pipeline d’un agent vocal depuis le transport audio jusqu’aux outils, à la réponse et au transfert humain.
Gérer les tours de parole
Un système classique attend un silence pour décider que l’utilisateur a terminé. Un silence trop court coupe ; trop long ralentit. Les modèles full-duplex peuvent écouter et parler simultanément, mais doivent gérer interruption et chevauchement.
L’utilisateur doit pouvoir interrompre. L’audio en cours s’arrête, l’état est mis à jour et les actions non confirmées sont annulées. Le système distingue un bruit d’une correction.
Les indices visuels ou sonores indiquent écoute, traitement et transfert sans simuler une présence humaine trompeuse.
Ne pas masquer les temps d’outil
Un appel CRM ou une recherche peut prendre plusieurs secondes. L’agent peut confirmer la tâche, fournir une information intermédiaire exacte ou proposer un rappel. Il ne doit pas inventer une conversation de remplissage.
Les outils ont timeouts, retries, idempotence et état. Une opération longue devient asynchrone et le résultat est confirmé lorsqu’il est réel.
Authentifier sans dégrader l’expérience
La voix seule n’est pas une preuve d’identité suffisante. Selon le risque, utiliser :
- information connue non sensible ;
- code à usage unique ;
- lien dans un canal authentifié ;
- connexion applicative ;
- transfert à un conseiller ;
- réauthentification avant action.
L’agent ne demande jamais un secret complet inutile. Les réponses sont masquées dans les logs et la synthèse vocale.
Confirmation des actions
Avant une action, l’agent répète les paramètres essentiels : objet, date, montant, destinataire ou conséquence. La confirmation porte sur cette version et expire.
Pour des données difficiles à comprendre à l’oral, un récapitulatif écrit peut être envoyé dans un canal sécurisé. L’utilisateur peut corriger un seul champ sans recommencer toute la conversation.
Consentement et transparence
L’appel indique clairement l’usage d’une IA et les finalités pertinentes. Si la conversation est enregistrée ou transcrite, l’information et la base applicable doivent être établies avec les responsables compétents.
La collecte est minimisée. Transcription, audio, résumé, métadonnées et feedback peuvent avoir des durées différentes. Le choix de voix ne doit pas imiter une personne sans autorisation.
Transcription et données sensibles
La transcription peut contenir nom, santé, paiement ou secret. Les accès, rétention et masquage sont définis. Les données ne sont pas envoyées à des outils non autorisés.
Un score de confiance de transcription peut déclencher une demande de répétition. Les noms propres, adresses et références sont confirmés, parfois par épellation ou canal texte.
Concevoir les outils
Les outils vocaux doivent être courts et structurés. Le modèle ne lit pas une réponse technique brute. Une couche transforme les statuts en phrases exactes et sûres.
Les actions sont limitées, auditées et vérifiées. Le modèle ne peut pas choisir un destinataire externe librement ni élargir ses droits.
Transfert humain
Le transfert doit être accessible à tout moment ou selon des règles. Le conseiller reçoit, avec consentement et droit approprié :
- raison ;
- étapes accomplies ;
- identité vérifiée ;
- données collectées ;
- points incertains ;
- actions en attente.
L’utilisateur ne répète pas toute son histoire. Si aucun conseiller n’est disponible, le système propose une alternative réelle.
Mode dégradé
En cas de bruit, réseau faible, modèle indisponible ou outil lent :
- demander de répéter ;
- passer au clavier/texte ;
- limiter les actions ;
- transférer ;
- créer un rappel ;
- terminer proprement.
Une panne ne doit pas laisser une action dans un état inconnu.
Évaluer la qualité
Le jeu de tests inclut :
- accents ;
- bruit ;
- chevauchement ;
- interruptions ;
- nombres ;
- noms ;
- ambiguïtés ;
- émotion ;
- langues ;
- refus ;
- outils ;
- transfert.
Mesurer réussite de tâche, corrections, temps, latence p95, taux de transfert, erreurs critiques, satisfaction et coût. Les évaluateurs écoutent des extraits autorisés selon une politique.
Observabilité temps réel
Suivre qualité réseau, paquets, latence, tours, interruptions, appels d’outils, erreurs, déconnexions, coûts et escalades. L’identifiant de session relie média et métier sans stocker plus que nécessaire.
Les alertes détectent une hausse de silence, d’abandon ou de répétitions.
Coût
Le coût combine audio entrant/sortant, modèle, téléphonie, outils, stockage, transcription, supervision et transfert humain. Il est rapporté à une tâche résolue.
Le routage peut réserver les modèles les plus capables aux conversations complexes. Les appels non urgents peuvent utiliser un rappel asynchrone.
Un déploiement progressif
Commencer sur un motif simple, avec horaires et population limités, puis analyser chaque échec. Les actions sensibles restent en proposition. La capacité s’étend lorsque latence, qualité et transfert sont maîtrisés.
Partitech peut concevoir la plateforme temps réel, intégrer les outils métier, sécuriser l’identité et construire la campagne d’évaluation. L’objectif est une voix utile et transparente, capable d’agir sans sacrifier le contrôle ni la qualité de service.
Parlons de votre projet
Prototyper et industrialiser un agent vocal métier avec Partitech. Contactez Partitech.