
Nahezu Echtzeit-Retrieval-unterstützte Generierung (RAG)
Beschreibung
Nahezu Echtzeit-Retrieval-unterstützte Generierung (RAG) Pipelines im großen Maßstab in JavaRAG ist das Muster, das verwendet wird, um die Genauigkeit von LLM zu verbessern und KI-Halluzinationen zu minimieren. Aber die meisten Implementierungen sind ein Sammelsurium aus Batch-Embedding-Jobs, externen Vektordatenbanken, Nachrichtensystemen, verschiedenen Diensten und brüchigem Klebekoden. Das Ergebnis ist vorhersehbar: höhere Latenz, schwierigere und kostspieligere Operationen. In diesem Vortrag sehen Sie eine Streaming-RAG-Architektur, die nativ in Java erstellt wurde: kontinuierliche Aufnahme und Transformation mit verteilten DAG-Pipelines, horizontal skalierbare Einbettungsinferenz und im Arbeitsspeicher verteilte Vektorsammlungen für Millisekunden-semantische Suche. Wir zeigen, wie Daten vektorisierte werden können, während sie von CDC, Ereignissen, REST-Quellen und Dokumenten ankommen, wie partition-aware Verarbeitung Netzauslastung verringert und wie die Ko-lokalisierung von Rechenleistung mit Vektorspeicherung eine schnelle Abfrage mit Filterung und Anreicherung in einer einzigen Laufzeit ermöglicht. Das Ziel ist eine einheitliche, zustandsbehaftete Plattform, die architektonische Zersplitterung reduziert und gleichzeitig Latenz und Widerstandsfähigkeit verbessert. Wichtige Diskussionspunkte: Scott McMahon ist der Senior Director für Lösungsarchitektur bei Hazelcast®, mit über 25 Jahren Erfahrung in der Softwareentwicklung und Unternehmensberatung. Vor seinem Eintritt bei Hazelcast baute er Big-Data-Analyseplattformen und Geschäftsprozessmanagementsysteme für viele der weltweit führenden Unternehmen. Er lebt derzeit in Portland, Oregon, und wenn er nicht an Computersystemen arbeitet, verbringt er gerne Zeit in der Natur und hat Spaß mit seiner Familie.
Veranstaltungsort
Lassen Sie Ihr Netzwerk wissen, dass Sie dabei sind
Teilen Sie diese Veranstaltung, um Gespräche zu beginnen, Kollegen einzuladen und sich vorab zu vernetzen.