
Structure de l'Agent Vocal AI
Description
À propos de l'atelier Que se passe-t-il réellement à partir du moment où vous commencez à parler à un agent vocal intelligent jusqu'à ce que vous entendiez sa réponse ? Cette session nous emmène en visite technique à l'intérieur de l'architecture qui sous-tend les agents vocaux AI en temps réel, pour comprendre comment leurs composants fonctionnent ensemble comme un système unifié : de la reconnaissance vocale et la conversion en texte (STT), au traitement des demandes à l'aide de modèles de langage de grande taille (LLMs), puis à la génération de la réponse vocale via des technologies de synthèse vocale (TTS). L'expérience ne s'arrête pas à ces trois composants ; la session aborde également l'un des aspects les plus complexes des systèmes vocaux : comment l'agent sait quand écouter, quand parler, comment gérer les interruptions et le passage de parole, et comment réduire la latence de réponse pour parvenir à une conversation qui semble naturelle et fluide au lieu d'une série de demandes et de réponses séparées. Nous passons ensuite au défi le plus difficile : construire ces systèmes pour le monde arabe. L'arabe ne signifie pas un modèle qui gère une langue dans une forme fixe ; c'est plutôt un système linguistique où les dialectes s'entrelacent, les schémas de prononciation et le vocabulaire diffèrent, et le changement de code se produit entre l'arabe et l'anglais au sein de la même conversation. Ces caractéristiques imposent des défis supplémentaires à diverses étapes du système, de la reconnaissance vocale précise à la compréhension du contexte et à la génération d'une voix naturelle qui convient à l'utilisateur. Ces défis augmentent lors du passage de l'agent vocal d'un modèle prototype à un produit réel opérant dans les secteurs régulés du Golfe, tels que la banque et la santé ; où la qualité du modèle à elle seule n'est pas suffisante, mais où des considérations de confidentialité, de fiabilité, de conformité et de gestion des données utilisateurs doivent être intégrées au cœur de la conception du système. La session dissèque ces couches pour comprendre ce qui est nécessaire pour construire un agent vocal arabe capable de fonctionner dans un environnement réel, et pas seulement de fournir une expérience technique impressionnante. À propos du conférencier Fares a commencé sa carrière en tant qu'ingénieur en IA, avant de passer à des rôles de produit et d'affaires, combinant son expérience technique avec une compréhension de la construction et du fonctionnement des produits AI sur le marché. Il dirige actuellement les opérations de produit chez Surge, une plateforme AI principalement conçue pour l'arabe (premier en arabe), travaillant au développement d'agents vocaux et textuels AI pour les secteurs régulés dans la région du Golfe. À travers son travail à l'intersection de l'IA, des produits et des opérations, Fares se concentre sur la transformation des technologies AI de modèles techniques en produits utilisables et opérationnels dans de réels environnements de travail et leurs exigences réglementaires.
Event location
Let your network know you're going
Share this event to start conversations, invite colleagues, and connect before it begins.