Submit Event
Sessão 03: Preparação de Dados para IA

Sessão 03: Preparação de Dados para IA

19 ago 202614:00 - 16:30 Africa/NairobiNakuru, Kenya0 AttendeesOpen

Description

Preparação de Dados para IA: Engenharia de Dados de Aplicação Brutos em Contexto Limpo para ModelosModelos de IA de alto desempenho e sistemas de recuperação são tão bons quanto os pipelines de dados que os alimentam. Se você jogar logs de banco de dados brutos e não estruturados, despejos de documentos bagunçados ou JSON não analisado diretamente em um modelo de incorporação ou janela de contexto LLM, seu sistema sofrerá com alucinações, altos custos de API e inchaço de contexto.Nesta sessão, completamos o Módulo 1 (Infraestrutura de Dados & Pipelines) dominando a Preparação de Dados para IA. Fazemos a transição de eventos brutos de banco de dados em streaming para transformação, fragmentação e higienização de dados não estruturados e semi-estruturados em representações de contexto prontas para modelo e limpas.O Que Vamos CobrirFragmentação Determinística vs. Semântica: Além de divisões de caracteres fixos—explorando fragmentação ciente de cabeçalho, baseada em markdown e fragmentação de limites semânticos para preservar o contexto lógico.Extração de Recursos & Metadados: Enriquecendo fragmentos de texto com metadados estruturados (timestamps, IDs de inquilinos, categorias e permissões) para permitir filtragem de alta precisão durante a recuperação de contexto.Redação e Máscara de PII de Confiança Zero: Implementando filtros de privacidade automatizados por regex e assistidos por modelo para remover dados pessoais sensíveis (IDs nacionais, números de telefone, credenciais financeiras) antes que os dados cheguem a índices vetoriais ou APIs externas de LLM.Qualidade de Dados & Desduplicação: Estratégias para detectar conteúdo quase duplicado, normalizar codificações de texto e lidar com a deriva de esquema em feeds de dados não estruturados.O Codelab PráticoNesta oficina interativa de engenharia da sessão, construiremos um motor automatizado de higienização e fragmentação de dados em TypeScript. Juntos, iremos:1. Construir um Motor de Fragmentação de Múltiplas Estratégias: Implementar e comparar rotinas de fragmentação de comprimento fixo, janela deslizante e fragmentação ciente de cabeçalho semântico.2. Automatizar a Higienização de PII: Construir um pipeline de higienização de confiança zero que detecta e redige dados pessoais (PII) antes do armazenamento.3. Enriquecer Fragmentos com Metadados: Anexar envelopes de metadados tipados e versionados (zod) a cada fragmento para filtragem subsequente.4. Validar a Prontidão da Saída: Executar verificações de qualidade contra fragmentos processados para garantir que atendam aos padrões de incorporação e recuperação.Até às 16h, você terá construído um pipeline de preparação de dados automatizado que converte saídas brutas de aplicação em contexto de IA compatível com privacidade e de qualidade de produção!Quem Deve Participar?Desenvolvedores de software, engenheiros de backend, arquitetos técnicos e profissionais de dados que desejam construir pipelines de dados limpos, seguros e prontos para produção para sistemas inteligentes.

Event location

Let your network know you're going

Share this event to start conversations, invite colleagues, and connect before it begins.

about_us.editorial_intelligence_platform

Free
Register for free