
Ограниченная автономия: модели ИИ, память и поиск на краю
Описание
Описание Эта сессия рассматривает практические инженерные проблемы внедрения ИИ в ограниченные физические системы и устройства на краю. Разложив стек на устройстве на модели, память и поиск, мероприятие охватывает экономику локальной инференции LLM, проектирование агентской памяти для управления непрерывным состоянием и реализацию встроенного векторного поиска для автономии в офлайне. Мероприятие предназначено для инженеров, работающих в области робототехники, прикладного машинного обучения и встроенных систем, и фокусируется на создании надежного агентского поведения, которое работает надежно без зависимости от облака. Повестка дня Мы начинаем с модели, анализируя аппаратные механизмы и экономику выполнения LLM непосредственно на устройствах на краю. Затем мы рассматриваем агентскую память, исследуя, как долго работающие агенты сохраняют состояние, ранжируют подцели и управляют ограничениями контекста без облачной инфраструктуры. Мы завершаем с уровнем поиска, демонстрируя, как встроенные векторные движки позволяют проводить гибридный поиск в офлайне за миллисекунды непосредственно внутри аппаратного обеспечения IoT и автономной робототехники. 18:00 Открытие дверей 18:30 - 19:00 Экономика инференции LLM: от дата-центров до края (Пол Виллот, старший инженер MLE @ Liquid AI) 19:00 - 19:30 Агентская память для устройств на краю (Стефания Друга, научный сотрудник @ Sakana AI RSI Lab) 19:30 - 20:00 Агентский поиск для аппаратного обеспечения IoT и автономных систем (Эва Шишка, инженер DevRel @ Qdrant) 20:00 - 21:00 Нетворкинг 21:00 Закрытие дверей Доклады Доклад 1 - Экономика инференции LLM: от дата-центров до края Докладчик: Пол Виллот (старший инженер MLE, Liquid AI) Аннотация: По мере того, как языковые модели переходят из дата-центров на ноутбуки, телефоны, роботы и другие устройства на краю, возникает основополагающий вопрос: где экономически целесообразно запускать интеллект? Ответ требует взгляда на механизмы самой инференции: как пропускная способность памяти, размер модели, использование аппаратного обеспечения и параллелизм определяют стоимость и скорость производства токена. Дата-центры получают выгоду от масштаба, распределяя стоимость больших моделей между многими параллельными пользователями. Устройства на краю сталкиваются с другой ситуацией, где ресурсы более ограничены и существует гораздо меньше возможностей для амортизации инференции за счет больших пакетных вычислений. Это делает проектирование модели и системы все более важным: квантизация, разреженность, гибридные архитектуры, кэширование и другие техники могут существенно изменить компромисс между стоимостью, пропускной способностью и интерактивностью. Опираться на работу Liquid AI над эффективными базовыми моделями, доклад исследует, как эти компромиссы формируют новую роль интеллекта на краю. Последние техники, такие как спекулятивное декодирование (включая работу Liquid AI по DSpark), иллюстрируют, как переосмысление стека инференции может сместить границы производительности и сделать все более мощные модели практичными на более широком диапазоне аппаратного обеспечения. Биография: Пол Виллот - старший инженер в Liquid AI Japan, где он отвечает за работу по эффективным моделям ИИ в области зрения, аудио и языка. У него более десяти лет опыта в исследованиях и производстве машинного обучения, с предыдущими ролями в Mercari, Elix и Alpaca Japan. Его работа охватывает от масштабного поиска и систем низкой задержки до компьютерного зрения и моделей, развернутых на аппаратном обеспечении с низким энергопотреблением. Он имеет степень магистра в области данных и машинного обучения от Сорбоннского университета и особенно интересуется тем, чтобы сделать передовые модели ИИ практичными и эффективными в реальных системах. Доклад 2 - Агентская память для устройств на краю: уроки от долгосрочных исследовательских агентов Докладчик: Стефания Друга (научный сотрудник, Sakana.ai RSI Lab) Аннотация: В Sakana AI мы строим агентов, которые работают сотни итераций для чтения литературы, проведения экспериментов и написания статей. Модель редко является единственным ограничением. Окружающая система забывает ранние решения, повторяет завершенные работы, извлекает неправильное состояние или уходит от исходного исследовательского вопроса. Агенты на краю и физически воплощенные агенты сталкиваются с той же проблемой памяти в условиях еще более строгих ограничений на контекст, вычисления, хранение и соединение. Используя наши существующие эксперименты с долгосрочными исследовательскими агентами, я покажу, когда память помогает, когда она становится дорогим шумом, и что происходит, когда актуальное состояние выходит из контекста. Я сравню отключение памяти, развернутое воспоминание, управляемое ранжирование подцелей и условия оракулов, показывая, что основное улучшение пришло от ранжирования предыдущего состояния по текущей подцели. Это практическое руководство по системам памяти: удаление контекста, прогрессивное раскрытие, уплотнение с приоритетом на воспоминания, структурированная память для решений и оценка на уровне траектории. Центральный аргумент состоит в том, что агентская память - это не просто хранилище; это политика, определяющая, какая прошлое информация должна иметь авторитет над настоящим действием. Биография: Стефания Друга - научный сотрудник в лаборатории RSI Sakana AI, где она изучает память, непрерывное обучение и самосовершенствование в агентских системах. Ранее она была исследователем ИИ в Google DeepMind и проводила исследования в MIT Media Lab. У нее есть докторская степень из Университета Вашингтона и степень магистра из MIT. Ее работа охватывает оценку агентов, мультимодальное взаимодействие и воплощенный ИИ с акцентом на системы, которые учатся на опыте и остаются надежными за пределами одной сессии. Доклад 3 - Qdrant Edge: агентский поиск для аппаратного обеспечения IoT и автономных систем Докладчик: Эва Шишка (инженер DevRel, Qdrant) Аннотация: Агенты, работающие на аппаратном обеспечении, не могут ждать сети. Роботу, принимающему решение о следующем шаге, или дрону в здании без связи, нужен поиск, который происходит там, где создаются данные. Qdrant Edge - это движок векторного поиска Qdrant в виде встроенной библиотеки: вы открываете раздел на локальном диске внутри вашего процесса, записываете в него встраивания и выполняете запросы офлайн с инсталляционным размером около 11 МБ и без сервера, без Docker и без фоновых потоков. Этот доклад проходит через цикл агентного взаимодействия на устройстве (захват, встраивание, поиск, решение) с помощью демонстрации живого робота, где гибридный поиск по плотным векторным данным и подписям BM25 возвращает результаты менее чем за миллисекунду. Биография: Эва Шишка - инженер DevRel в Qdrant, работающая над прикладным векторным поиском, начиная с того, как встраивания из моделей, таких как ESM-2, индексируются, фильтруются и проверяются в больших масштабах до оптимизации задержки агентского поиска на устройствах на краю. Ранее она работала в области НИОКР компьютерного зрения, бенчмарков, наблюдаемости и применения ИИ в устройствах подводной навигации для морских приложений в Университете Кейо. Организаторы Илья Кулятин - предприниматель с опытом работы и учебы в США, Нидерландах, Сингапуре, Великобритании и Японии. Он имеет степень бакалавра в области экономики, степень магистра в области финансов и степень магистра в области машинного обучения. Он является трехкратным основателем, который теперь помогает Японии развивать местную экосистему ИИ через некоммерческое сообщество Tokyo AI (TAI), одновременно создавая системного интегратора и поставщика решений, основанного на ИИ, Foundry Labs株式会社. Эва Шишка - инженер DevRel в Qdrant, открытом векторном базе данных, где она работает над поиском для научных и мультимодальных данных. Она является соорганизатором мероприятий Tokyo AI (TAI) на пересечении ИИ и наук о жизни. Поддержка Foundry Labs K.K. - это системный интегратор и поставщик решений в области ИИ на основе Токио, предоставляющий полную поддержку для предприятий: от проектирования стратегии до внедрения, развертывания и операций. Они настраивают ИИ для операционных, регуляторных и защитных требований каждого клиента, имея практический опыт в области финансов, госуправления и промышленности, а также опыт внедрения производственных систем в защищенных и регулируемых средах. Qdrant - это открытый векторный поисковый движок, созданный для обработки высокоразмерных данных в больших масштабах. Он обеспечивает уровень поиска, стоящий за некоторыми из самых требовательных приложений ИИ в производстве сегодня, от RAG-пайплайнов до рекомендационных систем и ИИ-агентов, предоставляя разработчикам быстрый, точный поиск по сходству, где бы он ни понадобился. О TAI Tokyo AI (TAI) - это крупнейшее международное сообщество ИИ в Японии, насчитывающее более 5000 участников, преимущественно базирующихся в Токио: инженеры, исследователи, инвесторы, менеджеры продуктов и корпоративные лидеры в области инноваций. Через более 80 мероприятий в год и более 300 докладчиков из числа стартапов, предприятий и академических кругов TAI связывает людей, создающих ИИ в Японии, с глобальной экосистемой, стремясь превратить Токио в глобальный узел AI. Политика конфиденциальности Мы будем обрабатывать ваш адрес электронной почты для целей связанной с мероприятием и для последующей рассылки новостей. Вы можете отписаться от рассылки в любой момент. Дополнительные сведения о том, как мы обрабатываем персональные данные, доступны в нашей Политике конфиденциальности.
Место проведения
Расскажите своей сети, что вы идёте
Поделитесь этим событием, чтобы начать разговоры, пригласить коллег и наладить контакты до его начала.