
Структура голосового AI агента
Description
Про семінарЩо насправді відбувається з того моменту, коли ви починаєте говорити зі смарт-голосовим агентом, до того моменту, коли ви чуєте його відповідь?Ця сесія веде нас у технічну подорож всередину архітектури, що підпирає голосові AI агенти у реальному часі, щоб зрозуміти, як їхні компоненти працюють разом як єдина система: від розпізнавання мови та конвертації в текст (STT), до обробки запитів з використанням великих мовних моделей (LLMs), а потім генерування голосової відповіді за допомогою технологій текст-в-мову (TTS).Досвід не обмежується цими трьома компонентами; сесія також розглядає один з найскладніших аспектів голосових систем: як агент знає, коли слухати, коли говорити, як справлятися з перервами та чергуванням реплік, а також як зменшити затримку відповіді, щоб досягти розмови, яка здається природною та плавною, а не серією окремих запитів і відповідей.Потім ми переходимо до найскладнішого виклику: створення цих систем для арабського світу.Арабська мова не означає модель, яка обробляє одну мову у фіксованій формі; скоріше, це мовна система, де діалекти переплітаються, патерни вимови та словниковий запас відрізняються, а код-світінг відбувається між арабською та англійською в межах однієї розмови. Ці характеристики накладають додаткові виклики на різних етапах системи, від точного розпізнавання мови до розуміння контексту та генерування природного звучання голосу, що підходить користувачу.Ці виклики зростають, коли голосового агента переводять з прототипу в реальний продукт, що працює в регульованих секторах Перської затоки, таких як банківська справа та охорона здоров'я; де якість моделі сама по собі недостатня, але необхідно враховувати питання конфіденційності, надійності, відповідності та обробки даних користувачів, які мають бути вбудовані в основний дизайн системи.Сесія розбирає ці шари, щоб зрозуміти, що потрібно для створення арабського голосового агента, здатного функціонувати в реальному середовищі, а не просто надавати вражаючий технічний досвід.Про спікераФарес розпочав свою кар’єру як інженер штучного інтелекту, перш ніж перейти до ролей у продуктах та бізнесі, поєднуючи свою технічну підготовку з розумінням будівництва та експлуатації AI продуктів на ринку.Наразі він очолює операції з продуктами в Surge, AI платформі, що в основному створена для арабської мови (арабська перша), працюючи над розробкою голосових і текстових AI агентів для регульованих секторів у регіоні Перської затоки.У своїй роботі на перетині AI, продуктів та операцій Фарес зосереджується на перетворенні технологій AI з технічних моделей на використовувані та дієві продукти в реальних робочих середовищах і їх регуляторних вимогах.
Event location
Let your network know you're going
Share this event to start conversations, invite colleagues, and connect before it begins.