
Sesión 03: Preparación de Datos para IA
Description
Preparación de Datos para IA: Ingeniería de Datos de Aplicación en Crudo a Contexto de Modelo LimpioLos modelos de IA de alto rendimiento y los sistemas de recuperación son tan buenos como los canales de datos que los alimentan. Si vuelcas registros de base de datos sin procesar, documentos desordenados o JSON no analizados directamente en un modelo de incrustación o en una ventana de contexto de LLM, tu sistema sufrirá de alucinaciones, altos costos de API y sobrecarga de contexto.En esta sesión, completamos el Módulo 1 (Infraestructura de Datos y Canalizaciones) dominando la Preparación de Datos para IA. Pasamos de transmitir eventos de base de datos en crudo a transformar, dividir y sanear datos no estructurados y semiestructurados en representaciones de contexto limpias y listas para el modelo.Lo que cubriremosDivisión Determinística vs. Semántica: Más allá de las divisiones de caracteres fijos—explorando la división consciente del encabezado, basada en Markdown y la división semántica de límites para preservar el contexto lógico.Extracción de Características y Metadatos: Enriqueciendo bloques de texto con metadatos estructurados (marcas de tiempo, IDs de inquilinos, categorías y permisos) para permitir filtrado de alta precisión durante la recuperación del contexto.Redacción y Máscara de PII de Confianza Cero: Implementación de filtros de privacidad automáticos basados en regex y asistidos por modelos para eliminar datos personales sensibles (IDs nacionales, números de teléfono, credenciales financieras) antes de que los datos lleguen a índices de vectores o APIs externas de LLM.Calidad de Datos y Deduplificación: Estrategias para detectar contenido casi duplicado, normalizar codificaciones de texto y manejar la deriva de esquema en los flujos de datos no estructurados.El Taller PrácticoEn el taller interactivo de ingeniería de esta sesión, construiremos un motor automatizado de saneamiento y división de datos en TypeScript. Juntos, vamos a:1. Construir un Motor de División Multi-Estrategia: Implementar y comparar rutinas de división de longitud fija, ventana deslizante y división consciente del encabezado semántico.2. Automatizar el Saneamiento de PII: Construir una canalización de saneamiento de confianza cero que detecte y redacte datos personales (PII) antes del almacenamiento.3. Enriquecer Bloques con Metadatos: Adjuntar sobres de metadatos tipificados y versionados (zod) a cada bloque para filtrado posterior.4. Validar la Preparación de la Salida: Realizar controles de calidad en los bloques procesados para asegurar que cumplen con los estándares de incrustación y recuperación.¡Para las 4:00 PM, habrás construido una canalización automatizada de preparación de datos que convierte salidas de aplicación en crudo en un contexto de IA listo para producción y conforme a la privacidad!¿Quién Debe Asistir?Desarrolladores de software, ingenieros de backend, arquitectos técnicos y profesionales de datos que quieran construir canalizaciones de datos limpias, seguras y listas para producción para sistemas inteligentes.
Event location
Let your network know you're going
Share this event to start conversations, invite colleagues, and connect before it begins.