Submit Event
Структура голоса AI-агента

Структура голоса AI-агента

05 авг 202618:30 - 20:30 Asia/RiyadhRiyadh, Saudi Arabia10 AttendeesOpen

Description

О мастер-классе Что на самом деле происходит с момента, когда вы начинаете говорить с умным голосовым агентом, до того момента, как вы услышите его ответ? Эта сессия проведет нас по техническому туру внутри архитектуры, которая поддерживает голосовые AI-агенты в реальном времени, чтобы понять, как их компоненты работают вместе как единая система: от распознавания речи и преобразования в текст (STT) до обработки запросов с использованием больших языковых моделей (LLMs), а затем генерации голосового ответа с помощью технологий синтеза речи (TTS). Опыт не ограничивается только этими тремя компонентами; сессия также рассматривает один из самых сложных аспектов голосовых систем: как агент знает, когда слушать, когда говорить, как обрабатывать прерывания и смену говорящего, а также как снизить задержку ответа, чтобы достичь разговора, который ощущается естественным и плавным, а не серией отдельных запросов и ответов. Затем мы перейдем к самой сложной задаче: созданию этих систем для арабского мира. Арабский язык не означает модель, которая обрабатывает один язык в фиксированной форме; скорее, это лингвистическая система, где диалекты переплетаются, различаются модели произношения и словарный запас, и происходит кодовое переключение между арабским и английским в рамках одного разговора. Эти характеристики налагают дополнительные сложности на различных этапах системы, от точного распознавания речи до понимания контекста и генерации естественного звучащего голоса, подходящего для пользователя. Эти вызовы усиливаются при передаче голосового агента от прототипной модели к фактическому продукту, работающему в регулируемых секторах Персидского залива, таких как банковское дело и здравоохранение; где качества модели само по себе недостаточно, но также необходимо учитывать конфиденциальность, надежность, соблюдение норм и обработку данных пользователей, которые должны быть встроены в основное проектирование системы. Сессия разбирает эти слои, чтобы понять, что нужно для создания арабского голосового агента, способного функционировать в реальной среде, а не просто предлагать впечатляющий технический опыт. О спикере Фарес начал свою карьеру в качестве инженера искусственного интеллекта, прежде чем перейти к продуктовым и бизнес-ролям, сочетая свой технический опыт с пониманием создания и управления продуктами ИИ на рынке. В настоящее время он возглавляет продуктовые операции в Surge, платформе ИИ, которая в первую очередь создана для арабского языка (арабский в первую очередь), работая над разработкой голосовых и текстовых AI-агентов для регулируемых секторов в регионе Персидского залива. В своей работе на пересечении ИИ, продуктов и операций Фарес сосредоточен на преобразовании технологий ИИ из технических моделей в пригодные для использования и эксплуатации продукты в реальных рабочих условиях и их регуляторных требованиях.

Event location

Let your network know you're going

Share this event to start conversations, invite colleagues, and connect before it begins.

about_us.editorial_intelligence_platform

Free