
Session 03 : Préparation des données pour l'IA
Description
Préparation des données pour l'IA : Transformer des données d'application brutes en contextes de modèle propres.Les modèles d'IA et les systèmes de récupération performants ne sont aussi bons que les pipelines de données qui les alimentent. Si vous déversez des journaux de base de données bruts et non structurés, des dumps de documents en désordre ou du JSON non analysé directement dans un modèle d'embedding ou une fenêtre de contexte LLM, votre système souffrira d'hallucinations, de coûts API élevés et de surcharge de contexte.Dans cette session, nous complétons le Module 1 (Infrastructure & Pipelines de données) en maîtrisant la Préparation des données pour l'IA. Nous passons du streaming d'événements de base de données bruts à la transformation, à la segmentation et à la désinfection de données non structurées et semi-structurées en représentations contextuelles propres et prêtes pour le modèle.Ce que nous couvrirons :- Découpage déterministe vs. sémantique : au-delà des découpages fixes de caractères – exploration du découpage conscient des en-têtes, basé sur le markdown, et des limites sémantiques pour préserver le contexte logique.- Extraction de caractéristiques et de métadonnées : enrichissement des morceaux de texte avec des métadonnées structurées (horodatages, ID de locataire, catégories et autorisations) pour permettre un filtrage de haute précision lors de la récupération de contexte.- Réduction et masquage des PII en mode Zéro-Confiance : mise en œuvre de filtres de confidentialité automatisés à l'aide de regex et assistés par des modèles pour supprimer les données personnelles sensibles (ID nationaux, numéros de téléphone, identifiants financiers) avant que les données n'atteignent les index de vecteurs ou les API LLM externes.- Qualité des données et déduplication : stratégies pour détecter le contenu proche du duplicata, normaliser les encodages de texte, et gérer la dérive de schéma dans les flux de données non structurées.Le laboratoire pratiqueDans l'atelier d'ingénierie interactif de cette session, nous construirons un moteur automatisé de désinfection et de découpage de données en TypeScript. Ensemble, nous allons :1. Construire un moteur de découpage multi-stratégie : mettre en œuvre et comparer les routines de découpage à longueur fixe, à fenêtre glissante, et conscientes des en-têtes sémantiques.2. Automatiser la désinfection des PII : construire un pipeline de désinfection en mode zéro-confiance qui détecte et masque les données personnelles (PII) avant le stockage.3. Enrichir les morceaux avec des métadonnées : attacher des enveloppes de métadonnées typées et versionnées (zod) à chaque morceau pour le filtrage en aval.4. Valider la préparation de la sortie : effectuer des contrôles de qualité sur les morceaux traités pour s'assurer qu'ils respectent les normes d'embedding et de récupération.D'ici 16h00, vous aurez construit un pipeline de préparation de données automatisé qui transforme les sorties d'application brutes en contextes d'IA conformes à la confidentialité et prêts pour la production !Qui devrait assister ?Développeurs de logiciels, ingénieurs backend, architectes techniques et praticiens des données qui souhaitent construire des pipelines de données propres, sécurisés et prêts pour la production pour des systèmes intelligents.
Event location
Let your network know you're going
Share this event to start conversations, invite colleagues, and connect before it begins.