
24 вересня - Зустріч по ІІ, МЛ та комп'ютерному зору
Опис
Приєднуйтесь до нашої віртуальної зустрічі 24 вересня, щоб послухати доповіді експертів на передових темах у сфері ІІ, МЛ та комп'ютерного зору. Дата, Час та Місце 24 вересня 2026 року 9:00 - 11:00 PST Онлайн. Зареєструйтесь на Zoom! Як принципи ІІ Mercedes-Benz сприяють нашій інновації? У Mercedes-Benz наші принципи ІІ керують кожним етапом інновації, підкреслюючи відповідальне використання, безпеку та надійність, зрозумілість, та захист конфіденційності. Ці принципи виходять за межі заяв і активно формують те, як ми проєктуємо, тестуємо та впроваджуємо системи ІІ у реальних автомобільних та підприємницьких умовах. У цій доповіді я представлю, як ці принципи надихнули наше нещодавнє дослідження щодо ефективності повторного використання LoRA (Адаптація низького рангу). Комбінуючи теоретичний аналіз із синтетичними даними як проксі для підприємницьких сценаріїв, ми виявили сильні та слабкі сторони модульних компонентів ІІ за обмеженого доступу до даних. Наші результати надають практичні рекомендації щодо того, коли повторно використовувані LoRA можуть забезпечити високоякісні результати. Про доповідача Мей-Єн Чен є старшим науковим співробітником даних у Mercedes-Benz Tech Innovation GmbH в Німеччині з 10-річним досвідом роботи в галузі ІІ та рішень у сфері даних. Вона очолює проєкти ІІ на ранніх стадіях у різних бізнес-функціях і співпрацює з науковими установами у сфері машинного навчання та відповідальної ІІ. Токени регіону як візуальний примітив: від розпізнавання до моделювання світу Токенізація на основі патчів стала стандартним інтерфейсом між візуальними кодувальниками та подальшими моделями, однак патчі не мають семантичної структури та погано масштабуються з роздільною здатністю та часовими інтервалами. Ця доповідь представляє дослідницьку програму, орієнтовану на заміну патч-токенів на регіональні представлення — семантично щільні токени, що базуються на візуальних об'єктах, а не на довільних незалежних зображеннях. Я опишу RELOCATE, REN та T-REN, прогресію методів, які виробляють регіональні токени через пулінг, навчають їх з регіональними цілями та розширюють їх до відео з часовою когерентністю. Потім я представлю поточну роботу з інтеграції регіональних токенів у VLM для безпосереднього розширення обсягу візуального контексту, а також попередні результати з прогнозування траєкторії регіонів майбутнього як основи для моделювання світу. Ширша тези полягає в тому, що токени на рівні регіону є більш природною одиницею візуальних обчислень, ніж патчі, і їхня перевага зростає зі складністю завдання, роздільною здатністю та часовими горизонтами. Про доповідача Сав’я Хосла є студенткою другого року аспірантури в Університеті Іллінойс Урбана-Шампейн, під керівництвом проф. Дерека Хойема та проф. Олександра Швинга. Використання дифузійних моделей тексту до зображення для послідовного генерації наборів Колекції зображень є основним способом, яким люди фіксують світ, однак прогреси у генеративному редагуванні переважно непридатні до цієї модальності. Ми вирішуємо цю прогалину, представляючи Match-and-Fuse - метод без навчання та без попередньої підготовки для послідовної генерації наборів з колекцій зображень, які мають спільний візуальний елемент, але відрізняються за точкою зору, часом захоплення та оточуючим контентом. Наша ключова ідея полягає в об'єднанні графової структури, що поєднує щільні відповідності з виниклого пріору в дифузійних моделях тексту до зображення для генерації узгоджених полотен. Ми досягаємо найкращої у своєму класі послідовності та візуальної якості, а також відкриваємо нові креативні можливості для генерації контенту. Про доповідача Кейт Файнгольд є аспіранткою з комп'ютерного зору в Інституті Вейцмана науки. Її дослідження знаходяться на перехресті генеративних моделей, 3D/4D сприйняття та мультимодального навчання, зосереджуючись на проблемах, де зір зустрічається з іншими модальностями або парадигмами в креативних завданнях. Оцінка врожайності кави в густому середовищі Ця презентація містить детальний робочий процес, пов'язаний з оцінкою врожайності кави в густому середовищі. За фотографіями кавових рослин до збору з кількох кавових господарств, деталі, пов'язані з попередньою обробкою, анотацією для виявлення регіонів інтересу (ROI), навчанням виявлення об'єктів і результатами інференції з різними моделями Yolo, а також сегментацією з SAM2 та Yolo*-seg з результатами навчання та інференції для визначення кількості сирих, недозрілих, зрілих та перезрілих кавових ягід, а також зрештою врожайності всього господарства. Все це базується на реальних даних, зафіксованих на iPhone та андроїд-телефонах. Про доповідача Рагху М. Рао є консультантом, що працює над застосуваннями моделей комп'ютерного зору ІІ. Раніше він працював у AMD та Xilinx. Він має докторський ступінь у бездротових комунікаціях від UCLA та є старшим членом IEEE. Його поточні інтереси зосереджені на застосуваннях ІІ в сільському господарстві, охороні здоров'я та бездротових комунікаціях.
Розкажіть своїй мережі, що ви йдете
Поділіться цією подією, щоб розпочати розмови, запросити колег та налагодити контакти до її початку.







