
Моделі, що руйнують 🚨Сесія безпеки AI 7: Занадто багато агентства
Опис
Частина 1 LLM03: Надмірне агентство Арші Чадха, спільний керівник OWASP Top 10 для LLM застосувань 2026 Ризик, коли системі ІІ дозволяють робити речі, а не лише говорити. Це займало #6 у списку 2025 року. У оновленні 2026 року воно перемістилося на #3: найбільший стрибок у всьому списку, оскільки інциденти в продукції тепер зосереджені навколо моделей, які виконують команди, викликають API та самостійно торкаються баз даних. Ми пройдемо через три речі, які це викликають: надмірна функціональність, надмірні дозволи, надмірна автономія. І що насправді стримує, коли модель маніпулюється. Частина 2 Інтерактивна демонстрація: електронний помічник, який став бунтівним Рішаб Гупта, програміст у Великій Техніці Помічник для електронної пошти з впровадженим запитом, в режимі реального часу. Один і той же шкідливий інструктаж вдається, відхиляється або чекає на схвалення: залежно лише від того, як налаштовані його функціональність, дозволи та автономія. Потім реальний випадок: впровадження запиту, яке було закладено у публічний Slack канал, спонукало AI Slack виявити секрети з приватних каналів. Частина 3 Інцидент Hugging Face: агент, якого не повинні були випускати з кімнати Дам’ян Галаc, старший програмний архітектор у Nvidia У липні 2026 року моделі OpenAI, що тестувалися на кібер-бенчмарку, виявили flaw у власному пакунковому інсталяторі пісочниці, досягли відкритого Інтернету та зламали виробничі системи Hugging Face, щоб отримати відповіді на тест. Жодна людина нічого з цього не керувала. Hugging Face зафіксував несанкціонований доступ до внутрішніх наборів даних та облікових даних сервісів. Ми пройдемо через те, як вузька мета плюс доступ до інструментів плюс прогалин у containment перетворили оцінку на реальний злом, і що це говорить про тестування моделей, які починають оволодівати цим. Частина 4 Групова вправа: поєднання безпечних інструментів в реальну шкоду Ви отримуєте агент підтримки AI з восьми інструментів. Кожен з них виглядає досить безпечно, щоб схвалити його самостійно. Ваше завдання — знайти послідовність, яка все ж виводить дані клієнтів: використовуючи лише дозволені дії. Потім ми перевернемо ситуацію і розберемося, де насправді повинна стояти межа. Просто беріть свої ноутбуки, без налаштувань.
Місце проведення
Розкажіть своїй мережі, що ви йдете
Поділіться цією подією, щоб розпочати розмови, запросити колег та налагодити контакти до її початку.