
Structuur van Voice AI Agent
Description
Over de workshop Wat gebeurt er eigenlijk vanaf het moment dat je begint te praten met een slimme spraakagent tot je zijn reactie hoort? Deze sessie neemt ons mee op een technische tour door de architectuur die ten grondslag ligt aan real-time voice AI agents, om te begrijpen hoe hun componenten samenwerken als een verenigd systeem: van spraakherkenning en conversie naar tekst (STT), tot het verwerken van verzoeken met behulp van grote taalmodellen (LLM's) en vervolgens het genereren van de spraakreactie via tekst-naar-spraak (TTS) technologieën. De ervaring stopt niet bij deze drie componenten; de sessie behandelt ook een van de meest complexe aspecten van spraaksystemen: hoe de agent weet wanneer te luisteren, wanneer te spreken, hoe om te gaan met onderbrekingen en het nemen van beurten, en hoe de responstijd te verminderen om een gesprek te bereiken dat natuurlijk en soepel aanvoelt in plaats van een reeks aparte verzoeken en antwoorden. Daarna gaan we verder naar de grootste uitdaging: het bouwen van deze systemen voor de Arabische wereld. Arabisch betekent niet dat er een model is dat één taal in een vaste vorm beheert; het is eerder een taalsysteem waarin dialecten met elkaar verweven zijn, uitspraakpatronen en vocabulaire verschillen, en code-switching optreedt tussen Arabisch en Engels binnen hetzelfde gesprek. Deze kenmerken stellen extra uitdagingen op verschillende fasen van het systeem, van nauwkeurige spraakherkenning tot het begrijpen van context en het genereren van natuurlijk klinkende spraak die geschikt is voor de gebruiker. Deze uitdagingen nemen toe wanneer de spraakagent van een prototype-model wordt overgebracht naar een echt product dat opereert binnen gereguleerde Golfsectoren, zoals bankieren en gezondheidszorg; waar de kwaliteit van het model alleen niet voldoende is, maar overwegingen van privacy, betrouwbaarheid, naleving en het omgaan met gebruikersgegevens moeten worden ingebed binnen het kernontwerp van het systeem. De sessie dissecteert deze lagen om te begrijpen wat nodig is om een Arabische spraakagent te bouwen die in een echte omgeving kan functioneren, en niet alleen een indrukwekkende technische ervaring biedt. Over de spreker Fares begon zijn carrière als AI-engineer, voordat hij overging naar product- en bedrijfsrollen, waarbij hij zijn technische achtergrond combineerde met een begrip van het bouwen en opereren van AI-producten op de markt. Momenteel leidt hij de productoperaties bij Surge, een AI-platform dat voornamelijk is gebouwd voor Arabisch (Arabisch-eerst), en werkt hij aan het ontwikkelen van spraak- en tekst-AI-agents voor gereguleerde sectoren in de Golfregio. Door zijn werk op het snijvlak van AI, producten en operaties, richt Fares zich op het transformeren van AI-technologieën van technische modellen naar bruikbare en operationele producten binnen echte werkomgevingen en hun regelgevende vereisten.
Event location
Let your network know you're going
Share this event to start conversations, invite colleagues, and connect before it begins.