Dodaj wydarzenie
24 września - Meetup AI, ML i Wizja Komputerowa

24 września - Meetup AI, ML i Wizja Komputerowa

24 wrz 20264:00 PM UTCSan Francisco, United StatesOpen
LearnNetwork
CodeImageVideo

Opis

Dołącz do naszego wirtualnego meetup'u 24 września, aby wysłuchać wystąpień ekspertów na temat najnowszych trendów w zakresie AI, ML i wizji komputerowej. Data, Czas i Lokalizacja 24 września 2026 9:00 - 11:00 PST Online. Zarejestruj się na Zoom! Jak zasady AI Mercedes-Benz napędzają nasze innowacje? W Mercedes-Benz nasze zasady AI kierują każdym krokiem innowacji, podkreślając odpowiedzialne wykorzystanie, bezpieczeństwo i niezawodność, możliwość wyjaśnienia oraz ochronę prywatności. Zasady te wykraczają poza deklaracje i aktywnie kształtują sposób, w jaki projektujemy, testujemy i wdrażamy systemy AI w rzeczywistych środowiskach motoryzacyjnych i przedsiębiorczych. W tym wystąpieniu przedstawię, jak zasady te zainspirowały nasze ostatnie badania nad tym, kiedy ponowne użycie LoRA (Low-Rank Adaptation) jest skuteczne. Łącząc analizę teoretyczną z danymi syntetycznymi jako proxy dla scenariuszy przedsiębiorstw, odkryliśmy mocne i słabe strony modułowych komponentów AI w warunkach ograniczonego dostępu do danych. Nasze ustalenia dostarczają praktycznych wskazówek dotyczących tego, kiedy ponownie użyte LoRA mogą przynieść wysokiej jakości rezultaty. O mówcy Mei-Yen Chen jest starszym analitykiem danych w Mercedes-Benz Tech Innovation GmbH w Niemczech z 10-letnim doświadczeniem branżowym w dziedzinie AI i rozwiązań danych. Kieruje projektami AI w wczesnej fazie w różnych funkcjach biznesowych i współpracuje z instytucjami badawczymi nad uczeniem maszynowym i odpowiedzialnym AI. Tokeny regionów jako wizualny prymityw: Od rozpoznawania do modelowania świata Tokenizacja oparta na fragmentach stała się domyślnym interfejsem między enkoderami wizji a modelami downstream, jednak fragmenty nie niosą struktury semantycznej i słabo skalują się z rozdzielczością i czasem. To wystąpienie przedstawia program badawczy skoncentrowany na zastąpieniu tokenów fragmentów reprezentacjami na poziomie regionu - semantycznie gęstymi tokenami osadzonymi w jednostkach wizualnych, a nie w arbitralnych przycinkach siatki. Opiszę RELOCATE, REN i T-REN, ewolucję metod, które produkują tokeny regionów przez pooling, trenują je przy użyciu celów na poziomie regionu i rozszerzają je na wideo z koherencją czasową. Następnie zaprezentuję trwającą pracę nad integracją tokenów regionów w VLM, aby bezpośrednio zwiększyć pojemność kontekstu wizualnego oraz wstępne wyniki dotyczące przewidywania trajektorii regionów jako fundamentu do modelowania świata. Szersza teza to, że tokeny na poziomie regionu są bardziej naturalną jednostką obliczeń wizualnych niż fragmenty, a ich przewaga rośnie wraz ze wzrostem złożoności zadania, rozdzielczości i horyzontu czasowego. O mówcy Savya Khosla jest studentką drugiego roku studiów doktoranckich na Uniwersytecie Illinois Urbana-Champaign, pod opieką prof. Dereka Hoiema i prof. Alexa Schwinga. Wykorzystanie modeli dyfuzji tekst-obraz do spójnej generacji zestawów Kolekcje obrazów są głównym sposobem, w jaki ludzie uchwytują świat, a postępy w edycji generacyjnej pozostają w dużej mierze niedostosowane do tej modalności. Zajmujemy się tę luką, wprowadzając Match-and-Fuse - metodę zero-shot, bez potrzeby szkolenia, do spójnej generacji zestawów z kolekcji obrazów, które dzielą wspólny element wizualny, ale różnią się punktem widzenia, czasem uchwycenia i otaczającą zawartością. Naszym kluczowym pomysłem jest zjednoczony, oparty na grafach, framework, który łączy gęste korespondencje z pojawiającym się priorytetem w modelach dyfuzji tekst-obraz, aby generować spójne płótna. Osiągamy najlepszą w swojej klasie spójność i jakość wizualną oraz odblokowujemy nowe możliwości twórcze w zakresie generacji treści. O mówcy Kate Feingold jest studentką doktorancką w dziedzinie wizji komputerowej w Instytucie Weizmanna. Jej badania znajdują się na styku modeli generacyjnych, percepcji 3D/4D i uczenia multimodalnego, koncentrując się na problemach, gdzie wizja łączy się z innymi modalnościami lub paradygmatami w zadaniach kreatywnych. Szacowanie plonów kawy w gęstym środowisku To wystąpienie dostarcza szczegółowego workflow związanego z szacowaniem plonów kawy w gęstym środowisku. Z zdjęciami przedżniwnymi roślin kawowców z kilku plantacji kawowych, szczegóły dotyczące wstępnego przetwarzania, adnotacji do wykrywania regionów zainteresowania (ROI), szkolenie detekcji obiektów oraz wyniki inferencyjne z różnych modeli Yolo, a w końcu segmentacja przy użyciu SAM2 i Yolo*-seg z wynikami szkolenia i inferencji w celu określenia liczby surowych, przedwczesnych, dojrzałych i naddojrzałych owoców kawy oraz ostatecznego plonu całej plantacji. Wszystko to oparte jest na danych z rzeczywistego świata uchwyconych na telefonach iPhone i Android. O mówcy Raghu M. Rao jest konsultantem zajmującym się zastosowaniami modeli sztucznej inteligencji w wizji komputerowej. Wcześniej pracował w AMD i Xilinx. Posiada doktorat w dziedzinie komunikacji bezprzewodowej z UCLA i jest starszym członkiem IEEE. Jego obecne zainteresowania dotyczą zastosowania AI w rolnictwie, opiece zdrowotnej oraz komunikacji bezprzewodowej.

Lokalizacja wydarzenia

Daj swojej sieci znać, że idziesz

Udostępnij to wydarzenie, aby rozpocząć rozmowy, zaprosić kolegów i nawiązać kontakty przed jego rozpoczęciem.

Related events

Platforma sztucznej inteligencji

Ceny na stronie
Kup bilety