
Сессия 03: Подготовка данных для ИИ
Description
Подготовка данных для ИИ: Преобразование необработанных данных приложения в чистый контекст модели Высокопроизводительные модели ИИ и системы извлечения данных зависят от качества конвейеров данных, которые их обеспечивают. Если вы загружаете необработанные, неструктурированные журналы баз данных, беспорядочные манипуляции с документами или непарсенный JSON напрямую в модель вложений или в контекст LLM, ваша система будет страдать от галлюцинаций, высоких затрат на API и растяжения контекста. На этой сессии мы завершаем Модуль 1 (Инфраструктура данных и конвейеры), овладевая подготовкой данных для ИИ. Мы переходим от потоковой передачи необработанных событий базы данных к преобразованию, нарезке и очистке неструктурированных и полуструктурированных данных в чистые, готовые к модели представления контекста. Что мы рассмотрим Детерминированная и семантическая нарезка: За пределами фиксированных разделений на символы — исследование нарезки с учетом заголовков, на основе Markdown и с семантическими границами для сохранения логического контекста. Извлечение признаков и метаданных: Обогащение текстовых фрагментов структурированными метаданными (метки времени, идентификаторы арендаторов, категории и права доступа) для обеспечения точной фильтрации во время извлечения контекста. Редактирование и маскирование личной информации с нулевым уровнем доверия: Реализация автоматизированных фильтров приватности на основе регулярных выражений и помощи модели для удаления чувствительной личной информации (национальные идентификаторы, номера телефонов, финансовые учетные данные) до того, как данные достигнут векторных индексов или внешних LLM API. Качество данных и дедупликация: Стратегии обнаружения почти дублированного контента, нормализации кодировок текста и обработки дрейфа схем в неструктурированных потоках данных. Практическая лаборатория На интерактивном инженерном семинаре этой сессии мы создадим автоматизированный движок очистки и нарезки данных на TypeScript. Вместе мы: 1. Построим движок нарезки с мультитратийным подходом: Реализуем и сравним рутинные процедуры нарезки фиксированной длины, скользящего окна и семантической нарезки с учетом заголовков. 2. Автоматизируем очистку личной информации: Создадим конвейер очистки с нулевым уровнем доверия, который обнаруживает и редактирует личные данные (PII) до их хранения. 3. Обогатим фрагменты метаданными: Прикрепим типизированные, версионированные конверты метаданных (zod) к каждому фрагменту для дальнейшей фильтрации. 4. Проверим готовность вывода: Проведем контроль качества обработанных фрагментов, чтобы убедиться, что они соответствуют стандартам вложения и извлечения. К 16:00 вы создадите автоматизированный конвейер подготовки данных, который превращает необработанные выходные данные приложения в готовый к производству контекст ИИ, соответствующий требованиям конфиденциальности! Кто должен присутствовать? Программисты, инженерыBackend, технические архитекторы и специалисты по данным, которые хотят создать чистые, безопасные и готовые к производству конвейеры данных для интеллектуальных систем.
Event location
Let your network know you're going
Share this event to start conversations, invite colleagues, and connect before it begins.