Dodaj wydarzenie
24 września - Spotkanie AI, ML i Wizji Komputerowej

24 września - Spotkanie AI, ML i Wizji Komputerowej

24 wrz 20269:00 AM GMT-07:00OnlineOpen
LearnNetwork
CodeImageVideo

Opis

Dołącz do naszego wirtualnego spotkania 24 września, aby posłuchać wystąpień ekspertów na temat najnowszych zagadnień związanych z AI, ML i wizją komputerową. Data, Czas i Miejsce 24 września 2026 r. 9:00 - 11:00 PST Online. Zarejestruj się na Zoom! Jak zasady AI Mercedes-Benz napędzają naszą innowacyjność? W Mercedes-Benz nasze zasady AI kierują każdym krokiem innowacji, podkreślając odpowiedzialne wykorzystanie, bezpieczeństwo i niezawodność, możliwość wyjaśnienia oraz ochronę prywatności. Te zasady wykraczają poza oświadczenia i aktywnie kształtują to, w jaki sposób projektujemy, testujemy i wdrażamy systemy AI w rzeczywistych warunkach motoryzacyjnych i biznesowych. W moim wystąpieniu zaprezentuję, jak te zasady zainspirowały nasze ostatnie badania dotyczące efektywności ponownego wykorzystania LoRA (Low-Rank Adaptation). Łącząc analizy teoretyczne z syntetycznymi danymi jako przybliżeniem scenariuszy przemysłowych, odkryliśmy mocne i słabe strony modułowych komponentów AI w warunkach ograniczonego dostępu do danych. Nasze wyniki dostarczają praktycznych wskazówek na temat tego, kiedy ponownie używane LoRA mogą przynieść wysokiej jakości wyniki. O prelegentce Mei-Yen Chen jest starszym specjalistą ds. danych w Mercedes-Benz Tech Innovation GmbH w Niemczech, mającym 10-letnie doświadczenie w branży związanej z AI i rozwiązaniami danych. Prowadzi projekty AI na wczesnym etapie w różnych funkcjach biznesowych i współpracuje z instytucjami badawczymi w dziedzinie uczenia maszynowego i odpowiedzialnej AI. Tokeny obszarowe jako wizualny prymityw: od rozpoznawania do modelowania świata Tokenizacja oparta na łatkach stała się domyślnym interfejsem między enkoderami wizji a modelami zainspirowanymi, jednak łatki nie mają struktury semantycznej i źle skalują się wraz z rozdzielczością i czasem. To wystąpienie przedstawia program badawczy skoncentrowany na zastąpieniu tokenów łatkami reprezentacjami na poziomie obszaru - semantycznie gęstymi tokenami osadzonymi w jednostkach wizualnych, a nie w losowych krawędziach siatki. Opiszę RELOCATE, REN i T-REN, progresję metod, które produkują tokeny obszarowe poprzez grupowanie, trenować je z celami na poziomie obszaru i rozszerzyć je do video z koherentnością czasową. Następnie zaprezentuję bieżące prace integrujące tokeny obszarowe w VLM, aby bezpośrednio zwiększyć pojemność kontekstu wizualnego oraz wstępne wyniki dotyczące prognozowania trajektorii regionów na przyszłość jako podstawy do modelowania świata. Szersza teza brzmi, że tokeny na poziomie obszaru są bardziej naturalną jednostką obliczeń wizualnych niż łatki, a ich zaletą jest to, że rośnie w miarę wzrostu złożoności zadania, rozdzielczości i horyzontu czasowego. O prelegencie Savya Khosla jest doktorantką drugiego roku na Uniwersytecie Illinois Urbana-Champaign, pod opieką prof. Dereka Hoiema i prof. Alexa Schwinga. Wykorzystanie modeli dyfuzji tekst-zdjęcie do spójnej generacji zestaw-z-estawu Kolekcje obrazów są głównym sposobem, w jaki ludzie uchwycają świat, jednak postępy w generatywnej edycji pozostają w dużej mierze niezastosowane do tej formy. Zajmujemy się tą luką, wprowadzając Match-and-Fuse - metodę zero-shot, bez konieczności treningu, do spójnej generacji zestaw-z-estawu z kolekcji obrazów, które dzielą wspólny element wizualny, ale różnią się punktem widzenia, czasem uchwycenia i otaczającą treścią. Naszym kluczowym pomysłem jest zjednoczony framework oparty na grafach, który łączy gęste korespondencje z emergentnym priorem w modelach dyfuzji tekst-zdjęcie w celu generowania spójnych obrazów. Osiągamy najnowocześniejszą spójność i jakość wizualną oraz odblokowujemy nowe możliwości twórcze dla generacji treści. O prelegentce Kate Feingold jest doktorantką w dziedzinie wizji komputerowej w Weizmann Institute of Science. Jej badania znajdują się na styku modeli generatywnych, percepcji 3D/4D oraz uczenia multimodalnego, koncentrując się na problemach, gdzie wizja spotyka inne modalności lub paradygmaty w kreatywnych zadaniach. Oszacowanie plonów kawy w gęstym otoczeniu To wystąpienie przedstawia szczegółowy przebieg dotyczący oszacowania plonów kawy w gęstym otoczeniu. Na podstawie zdjęć przed zbiorami roślin kawy z kilku plantacji kawy, zawiera szczegóły związane z przetwarzaniem wstępnym, adnotacjami do wykrywania obszarów zainteresowania (ROI), treningiem wykrywania obiektów i wynikami inferencji z różnych modeli Yolo, a także segmentacją z SAM2 i Yolo*-seg z wynikami treningu i inferencji, aby określić liczbę surowych, niedojrzałych, dojrzałych i przerośniętych owoców kawy oraz ostatecznie plon całej plantacji. Wszystko to opiera się na danych z rzeczywistego świata zebranych za pomocą iPhone'a i telefonów z Androidem. O prelegencie Raghu M. Rao jest konsultantem pracującym nad zastosowaniem modeli AI w wizji komputerowej. Wcześniej pracował w AMD i Xilinx. Posiada stopień doktora w dziedzinie komunikacji bezprzewodowej na UCLA i jest starszym członkiem IEEE. Jego obecne zainteresowania dotyczą zastosowań AI w rolnictwie, opiece zdrowotnej i komunikacji bezprzewodowej.

Daj swojej sieci znać, że idziesz

Udostępnij to wydarzenie, aby rozpocząć rozmowy, zaprosić kolegów i nawiązać kontakty przed jego rozpoczęciem.

Powiązane wydarzenia

Platforma sztucznej inteligencji

Ceny na stronie
Kup bilety