
Struktura agenta AI głosowego
Description
O warsztacie Co właściwie dzieje się od momentu, gdy zaczynasz rozmawiać z inteligentnym agentem głosowym, aż do momentu usłyszenia jego odpowiedzi? Ta sesja zabierze nas w techniczną podróż do wnętrza architektury, która wspiera agenty AI głosowe w czasie rzeczywistym, aby zrozumieć, jak ich składniki współpracują jako zjednoczony system: od rozpoznawania mowy i konwersji na tekst (STT), przez przetwarzanie żądań za pomocą dużych modeli językowych (LLM), a następnie generowanie odpowiedzi głosowej za pomocą technologii tekst-na-mowę (TTS). Doświadczenie nie kończy się na tych trzech komponentach; sesja porusza również jeden z najbardziej złożonych aspektów systemów głosowych: jak agent wie, kiedy słuchać, kiedy mówić, jak radzić sobie z przerwami i przejmowaniem mowy oraz jak zmniejszyć opóźnienie odpowiedzi, aby osiągnąć rozmowę, która wydaje się naturalna i płynna, zamiast serii odrębnych żądań i odpowiedzi. Następnie przechodzimy do najtrudniejszego wyzwania: budowania tych systemów dla świata arabskiego. Arabski nie oznacza modelu, który obsługuje jeden język w ustalonej formie; raczej jest to system językowy, w którym dialekty się przenikają, wzorce wymowy i słownictwo różnią się, a przełączanie kodów zachodzi między arabskim a angielskim w tej samej rozmowie. Te cechy nakładają dodatkowe wyzwania na różnych etapach systemu, od dokładnego rozpoznawania mowy po rozumienie kontekstu i generowanie naturalnie brzmiącego głosu, który odpowiada użytkownikowi. Te wyzwania wzrastają, gdy przenosimy agenta głosowego z modelu prototypowego do rzeczywistego produktu działającego w regulowanych sektorach Zatoki, takich jak bankowość i opieka zdrowotna; gdzie sama jakość modelu nie wystarcza, ale uwzględnienie prywatności, niezawodności, zgodności oraz zarządzania danymi użytkowników musi być wbudowane w podstawowy projekt systemu. Sesja analizuje te warstwy, aby zrozumieć, co jest wymagane do zbudowania arabskiego agenta głosowego zdolnego do działania w rzeczywistym środowisku, a nie tylko do zapewnienia imponującego doświadczenia technicznego. O mówcy Fares rozpoczął swoją karierę jako inżynier AI, zanim przeszedł do ról produktowych i biznesowych, łącząc swoje techniczne doświadczenie z rozumieniem budowania i obsługi produktów AI na rynku. Obecnie kieruje operacjami produktowymi w Surge, platformie AI, która jest głównie zbudowana dla Arabów (arabskie pierwsze), pracując nad rozwojem agentów głosowych i tekstowych AI dla regulowanych sektorów w regionie Zatoki. Dzięki swojej pracy na styku AI, produktów i operacji, Fares skupia się na przekształcaniu technologii AI z modeli technicznych w użyteczne i operacyjne produkty w rzeczywistych środowiskach pracy oraz ich wymaganiach regulacyjnych.
Event location
Let your network know you're going
Share this event to start conversations, invite colleagues, and connect before it begins.