Submit Event
Sessie 03: Gegevensvoorbereiding voor AI

Sessie 03: Gegevensvoorbereiding voor AI

19 aug. 202614:00 - 16:30 Africa/NairobiNakuru, Kenya0 AttendeesOpen

Description

Gegevensvoorbereiding voor AI: Ruwe toepassinggegevens omzetten in schone modelcontext Hogepresteerende AI-modellen en retrievalsystemen zijn slechts zo goed als de gegevenspipelines die ze voeden. Als je ruwe, ongestructureerde database-logboeken, rommelige documentdump of ongeparsed JSON rechtstreeks in een embeddingmodel of LLM-contextvenster dumpt, zal je systeem lijden aan hallucinaties, hoge API-kosten en contextbloat. In deze sessie voltooien we Module 1 (Gegevensinfrastructuur & Pipelines) door de Gegevensvoorbereiding voor AI meester te worden. We maken de overgang van het streamen van ruwe databasegebeurtenissen naar het transformeren, chunking en saneren van ongestructureerde en semi-gestructureerde gegevens in schone, modelklare contextrepresentaties. Wat we zullen behandelen Deterministische vs. Semantische Chunking: Voorbij vaste karakter splitsingen—onderzoeksheader-bewuste, markdown-gebaseerde, en semantische grenschunking om logische context te behouden. Kenmerken- & Metadata-extractie: Tekstchunks verrijken met gestructureerde metadata (tijdstempels, tenant-ID's, categorieën, en rechten) om hoge-precisie filtering mogelijk te maken tijdens contextretrieval. Zero-Trust PII Redaction & Maskering: Geautomatiseerde regex en modelgeassisteerde privacyfilters implementeren om gevoelige persoonlijke gegevens (nationale ID's, telefoonnummers, financiële credentials) te verwijderen voordat gegevens vectorindices of externe LLM-API's bereiken. Gegevenskwaliteit & Deduplicatie: Strategieën voor het detecteren van bijna-dubbele inhoud, normaliseren van tekstcoderingen, en omgaan met schema-afwijkingen in ongestructureerde gegevensfeeds. De Hands-On Codelab In deze interactieve engineeringworkshop van de sessie zullen we een geautomatiseerde TypeScript-gegevenssanering en chunking-engine bouwen. Samen zullen we: 1. Een Multi-Strategie Chunking Engine bouwen: Implementeren en vergelijken van vaste-lengte, schuifvenster, en semantische header-bewuste chunking-routines. 2. PII-sanering automatiseren: Een zero-trust saneringspipeline bouwen die persoonlijke gegevens (PII) detecteert en verwijdert voor opslag. 3. Chunks verrijken met metadata: Typen, versioned metadata-enveloppen (zod) aan elke chunk hechten voor downstream filtering. 4. Validatie van uitvoerklaarheid: Kwaliteitscontroles uitvoeren tegen verwerkte chunks om ervoor te zorgen dat ze voldoen aan embedding- en retrievalnormen. Tegen 16:00 uur heb je een geautomatiseerde gegevensvoorbereidingspipeline gebouwd die ruwe toepassingsoutputs omzet in productieklare, privacy-compliance AI-context! Wie zou moeten deelnemen? Softwareontwikkelaars, backend-engineers, technische architecten en gegevensbeheerders die schone, veilige en productieklare gegevenspipelines voor intelligente systemen willen bouwen.

Event location

Let your network know you're going

Share this event to start conversations, invite colleagues, and connect before it begins.

about_us.editorial_intelligence_platform

Free
Register for free