
Session 03: Datenvorbereitung für KI
Description
Datenvorbereitung für KI: Verarbeitung von Rohanwendungsdaten in saubere Modellkontexte Hochleistungsfähige KI-Modelle und Abrufsysteme sind nur so gut wie die Datenpipelines, die sie speisen. Wenn Sie rohe, unstrukturierte Datenbankprotokolle, unordentliche Dokumenten-Dumps oder unparsed JSON direkt in ein Embedding-Modell oder den Kontextbereich eines LLM eingeben, wird Ihr System unter Halluzinationen, hohen API-Kosten und Kontextaufblähung leiden. In dieser Sitzung schließen wir Modul 1 (Dateninfrastruktur & Pipelines) ab, indem wir die Datenvorbereitung für KI meistern. Wir wechseln von der Übertragung roher Datenbankereignisse zur Transformation, Chunking und Sanitization von unstrukturierten und semi-strukturierten Daten in saubere, modellgerechte Kontextdarstellungen. Was wir behandeln werden Deterministisches vs. Semantisches Chunking: Über feste Zeichensplits hinaus—Erforschung von headerbewusstem, markdown-basiertem und semantischen Grenz-Chunking, um den logischen Kontext zu bewahren. Feature- und Metadatenextraktion: Anreicherung von Text-Chunks mit strukturierten Metadaten (Zeitstempel, Mandanten-IDs, Kategorien und Berechtigungen), um eine hochpräzise Filterung während des Kontextabrufs zu ermöglichen. Zero-Trust-PII-Retusche & Maskierung: Implementierung automatisierter Regex- und modellgestützter Datenschutzfilter, um sensible persönliche Daten (nationale IDs, Telefonnummern, finanzielle Zugangsdaten) zu entfernen, bevor die Daten Vektorindizes oder externen LLM-APIs erreichen. Datenqualität & Duplikaterkennung: Strategien zur Erkennung von nahezu doppeltem Inhalt, Normalisierung von Textkodierungen und Umgang mit Schemadrift in unstrukturierten Datenfeeds. Der praktische Codelab In diesem interaktiven Engineering-Workshop der Sitzung werden wir eine automatisierte TypeScript-Datenbereinigungs- und Chunking-Engine bauen. Gemeinsam werden wir: 1. Eine Multi-Strategie-Chunking-Engine bauen: Feste Längen-, Gleitraster- und semantische headerbewusste Chunking-Routinen implementieren und vergleichen. 2. PII-Sanitization automatisieren: Eine Zero-Trust-Sanitization-Pipeline erstellen, die persönliche Daten (PII) vor der Speicherung erkennt und entfernt. 3. Chunks mit Metadaten anreichern: Getypte, versionierte Metadatenumschläge (zod) an jeden Chunk anfügen für die nachgelagerte Filterung. 4. Ausgabebereitschaft validieren: Qualitätsprüfungen gegen verarbeitete Chunks durchführen, um sicherzustellen, dass sie den Embedding- und Abrufstandards entsprechen. Bis 16:00 Uhr haben Sie eine automatisierte Datenvorbereitungspipeline aufgebaut, die rohe Anwendungsoutputs in produktionsfähigen, datenschutzkonformen KI-Kontext umwandelt! Wer sollte teilnehmen? Softwareentwickler, Backend-Ingenieure, technische Architekten und Datenpraktiker, die saubere, sichere und produktionsbereite Datenpipelines für intelligente Systeme aufbauen möchten.
Event location
Let your network know you're going
Share this event to start conversations, invite colleagues, and connect before it begins.