Submit Event
Sesja 03: Przygotowanie Danych dla AI

Sesja 03: Przygotowanie Danych dla AI

19 sie 202614:00 - 16:30 Africa/NairobiNakuru, Kenya0 AttendeesOpen

Description

Przygotowanie Danych dla AI: Inżynieria Surowych Danych Aplikacji w Czyste Konteksty Modelowe Wysokowydajne modele AI i systemy wyszukiwania są tak dobre, jak rurociągi danych, które je zasilają. Jeśli wrzucisz surowe, niestrukturalne logi z bazy danych, chaotyczne zrzuty dokumentów lub nieprzetworzony JSON bezpośrednio do modelu osadzenia lub okna kontekstowego LLM, twój system będzie cierpiał na halucynacje, wysokie koszty API i nadmiar kontekstu. W tej sesji kończymy Moduł 1 (Infrastruktura Danych & Rurociągi) opanowując Przygotowanie Danych dla AI. Przechodzimy od przetwarzania surowych zdarzeń z bazy danych do transformacji, dzielenia i sanacji niestrukturalnych i półstrukturalnych danych w czyste, gotowe do modelu reprezentacje kontekstowe. Co Przeprowadzimy Chunking Deterministyczny vs. Semantyczny: Poza ustalonymi podziałami na znaki — eksploracja chunkingu uwzględniającego nagłówki, opartego na markdown oraz granic semantycznych, aby zachować logiczny kontekst. Ekstrakcja Ceł i Metadanych: Wzbogacenie kawałków tekstu o uporządkowane metadane (czasy, identyfikatory dzierżawcy, kategorie i uprawnienia), aby umożliwić filtrowanie o wysokiej precyzji podczas pobierania kontekstu. Redakcja i Maskowanie PII z Zerowym Zaufaniem: Wdrażanie automatycznych filtrów prywatności z użyciem regex i wspomaganych modelami, aby usunąć wrażliwe dane osobowe (numery identyfikacyjne, numery telefonów, dane finansowe) przed dotarciem danych do indeksów wektorowych lub zewnętrznych API LLM. Jakość Danych i Usuwanie Duplikatów: Strategie wykrywania treści prawie duplikatów, normalizacji kodowania tekstu i radzenia sobie z dryfowaniem schematu w niestrukturalnych źródłach danych. Część Praktyczna Codelab W interaktywnym warsztacie inżynieryjnym tej sesji zbudujemy zautomatyzowany silnik sanizacji i dzielenia danych w TypeScript. Razem: 1. Zbudujemy Silnik Chunking z Wieloma Strategiami: Wdrożymy i porównamy rutyny chunkingu o stałej długości, sliding-window i chunkingu semantycznego uwzględniającego nagłówki. 2. Zautomatyzujemy Sanizację PII: Zbudujemy pipeline sanizacji z zerowym zaufaniem, który wykrywa i redaguje dane osobowe (PII) przed ich przechowaniem. 3. Wzbogacimy Kawałki o Metadane: Dołączymy typowane, wersjonowane koperty metadanych (zod) do każdego kawałka na potrzeby późniejszego filtrowania. 4. Walidacja Gotowości Wyników: Przeprowadzimy kontrole jakości przetworzonych kawałków, aby upewnić się, że spełniają standardy osadzenia i pobierania. Do godziny 16:00 zbudujesz zautomatyzowany proces przygotowania danych, który przekształca surowe dane aplikacji w kontekst AI spełniający standardy produkcyjne i zgodny z przepisami o prywatności! Kto Powinien Uczestniczyć? Programiści, inżynierowie backendowi, architekci techniczni i praktycy danych, którzy chcą budować czyste, bezpieczne i gotowe do produkcji rurociągi danych dla inteligentnych systemów.

Event location

Let your network know you're going

Share this event to start conversations, invite colleagues, and connect before it begins.

about_us.editorial_intelligence_platform

Free
Register for free