
Aufbau eines Sprach-KI-Agenten
Description
Über den Workshop Was geschieht wirklich, in dem Moment, in dem Sie mit einem intelligenten Sprachagenten zu sprechen beginnen, bis Sie seine Antwort hören? Diese Sitzung führt uns auf eine technische Tour durch die Architektur, die hinter Echtzeit-Sprach-KI-Agenten steht, um zu verstehen, wie ihre Komponenten als ein einheitliches System zusammenarbeiten: von der Spracherkennung und Umwandlung in Text (STT), über die Verarbeitung von Anfragen mit großen Sprachmodellen (LLMs), bis hin zur Generierung der Sprachantwort über Text-to-Speech (TTS)-Technologien. Die Erfahrung endet nicht bei diesen drei Komponenten; die Sitzung behandelt auch einen der komplexesten Aspekte von Sprachsystemen: wie der Agent weiß, wann er zuhören, wann er sprechen, wie er Unterbrechungen und den Wechsel zwischen Sprechern handhabt und wie er die Antwortlatenz reduziert, um ein Gespräch zu erreichen, das sich natürlich und flüssig anfühlt, anstatt aus einer Reihe separater Anfragen und Antworten zu bestehen. Dann gehen wir zur größten Herausforderung über: den Aufbau dieser Systeme für die arabische Welt. Arabisch bedeutet nicht, ein Modell zu haben, das eine Sprache in fester Form verarbeitet; vielmehr handelt es sich um ein linguistisches System, in dem Dialekte miteinander verwoben sind, sich Aussprachemuster und Wortschatz unterscheiden und Code-Switching zwischen Arabisch und Englisch innerhalb desselben Gesprächs auftritt. Diese Eigenschaften stellen zusätzliche Herausforderungen in verschiedenen Phasen des Systems dar, von der genauen Spracherkennung bis hin zum Verständnis des Kontexts und der Generierung einer natürlich klingenden Stimme, die zum Benutzer passt. Diese Herausforderungen nehmen zu, wenn der Sprachagent von einem Prototyp-Modell zu einem tatsächlichen Produkt übergeht, das in regulierten Golfsektoren wie dem Bankwesen und der Gesundheitsversorgung tätig ist; wo die Qualität des Modells allein nicht ausreicht, sondern Überlegungen zu Datenschutz, Zuverlässigkeit, Compliance und zum Umgang mit Benutzerdaten in das Grunddesign des Systems integriert werden müssen. Die Sitzung zerlegt diese Schichten, um zu verstehen, was erforderlich ist, um einen arabischen Sprachagenten aufzubauen, der in einer realen Umgebung funktionieren kann, und nicht nur eine beeindruckende technische Erfahrung bietet. Über den Referenten Fares begann seine Karriere als KI-Ingenieur, bevor er in Produkt- und Geschäftsrollen wechselte und sein technisches Wissen mit einem Verständnis für den Aufbau und Betrieb von KI-Produkten auf dem Markt kombinierte. Derzeit leitet er die Produktoperationen bei Surge, einer KI-Plattform, die hauptsächlich für Arabisch (Arabic-first) entwickelt wurde, und arbeitet an der Entwicklung von Sprach- und Text-KI-Agenten für regulierte Sektoren in der Golfregion. Durch seine Arbeit an der Schnittstelle von KI, Produkten und Operationen konzentriert sich Fares darauf, KI-Technologien von technischen Modellen in nutzbare und betriebsfähige Produkte innerhalb realer Arbeitsumgebungen und ihrer regulatorischen Anforderungen zu transformieren.
Event location
Let your network know you're going
Share this event to start conversations, invite colleagues, and connect before it begins.