
Ograniczona Autonomia: modele AI, pamięć i wyszukiwanie na krawędzi
Opis
Opis Sesja ta bada praktyczne wyzwania inżynieryjne związane z wdrażaniem AI w ograniczonych systemach fizycznych i urządzeniach brzegowych. Analizując stos na urządzeniu, w tym modele, pamięć i wyszukiwanie, wydarzenie porusza kwestie ekonomiki lokalnej inferencji LLM, projektowania pamięci agentnej do zarządzania ciągłym stanem oraz wdrażania osadzonego wyszukiwania wektorowego w celu autonomii offline. Zaprojektowane dla inżynierów pracujących w dziedzinie robotyki, stosowanej ML i systemów wbudowanych, prelekcje koncentrują się na budowaniu odpornych zachowań agentnych, które działają niezawodnie bez uzależnienia od chmury. Agenda Zaczynamy na poziomie modelu, analizując mechanikę sprzętową i ekonomię uruchamiania LLM bezpośrednio na urządzeniach brzegowych. Następnie badamy pamięć agentną, zwracając uwagę na to, jak długo działające agenty utrzymują stan, klasyfikują sub-cel oraz zarządzają ograniczeniami kontekstu bez infrastruktury chmurowej. Kończymy na poziomie wyszukiwania, demonstrując, jak osadzone silniki wektorowe umożliwiają sub-milisekundowe, offline wyszukiwanie hybrydowe bezpośrednio w sprzęcie IoT i autonomicznej robotyce. 18:00 Drzwi otwarte 18:30 - 19:00 Ekonomia inferencji LLM: od centrów danych do krawędzi (Paul Willot, Starszy MLE @ Liquid AI) 19:00 - 19:30 Pamięć agentna dla urządzeń brzegowych (Stefania Druga, Główny Naukowiec Badawczy @ Sakana AI RSI Lab) 19:30 - 20:00 Wyszukiwanie agentne dla sprzętu IoT i systemów autonomicznych (Ewa Szyszka, Inżynier DevRel @ Qdrant) 20:00 - 21:00 Networking 21:00 Drzwi zamknięte Prezentacje Prezentacja 1 - Ekonomia inferencji LLM: od centrów danych do krawędzi Mówca: Paul Willot (Starszy MLE, Liquid AI) Abstrakt: W miarę jak modele językowe wychodzą poza centrum danych i trafiają na laptopy, telefony, roboty i inne urządzenia brzegowe, pojawia się kluczowe pytanie: gdzie ma sens ekonomiczny uruchamianie inteligencji? Odpowiedź na nie wymaga spojrzenia głębiej na benchmarki modelu w mechanikę samej inferencji: jak szerokość pasma pamięci, rozmiar modelu, wykorzystanie sprzętu i współbieżność wpływają na koszt i szybkość generowania tokenu. Centrum danych korzystają z skali, dzieląc koszty dużych modeli między wielu współbieżnych użytkowników. Urządzenia brzegowe stają przed innym reżimem, gdzie zasoby są bardziej ograniczone, a możliwości rozkładania kosztów inferencji na większe partie są znacznie mniejsze. To sprawia, że projektowanie modeli i systemów staje się coraz ważniejsze: kwantyzacja, rzadkość, hybrydowe architektury, pamięci podręczne i inne techniki mogą znacząco zmieniać kompromisy między kosztem, przepustowością a interaktywnością. Czerpiąc z pracy Liquid AI nad efektywnymi modelami bazowymi, prezentacja zbada, jak te kompromisy kształtują nową rolę inteligencji brzegowej. Ostatnie techniki, takie jak spekulacyjne dekodowanie (w tym prace Liquid AI nad DSpark), ilustrują, jak przemyślenie stosu inferencyjnego może przesunąć granice wydajności i uczynić coraz bardziej zaawansowane modele praktycznymi na znacznie szerszym zakresie sprzętu. Biografia: Paul Willot jest starszym inżynierem w Liquid AI Japan, gdzie prowadzi prace nad efektywnymi modelami AI obejmującymi wizję, dźwięk i język. Ma ponad dekadę doświadczenia w badaniach i produkcji machine learningu, wcześniej pracując w Mercari, Elix i Alpaca Japan. Jego prace obejmowały od dużych systemów wyszukiwania po systemy ML o niskiej latencji, wizję komputerową i modele wdrożone na sprzęcie brzegowym o niskim zużyciu energii. Posiada tytuł magistra z zakresu Data Science i Machine Learning na Sorbonne Université i szczególnie interesuje się tym, jak uczynić zaawansowane modele AI praktycznymi i efektywnymi w rzeczywistych systemach. Prezentacja 2 - Pamięć agentna dla urządzeń brzegowych: lekcje z długo działających agentów badawczych Mówca: Stefania Druga (Główny Naukowiec Badawczy, Sakana.ai RSI Lab) Abstrakt: W Sakana AI budujemy agentów, którzy działają przez setki ruchów, czytają literaturę, przeprowadzają eksperymenty i piszą prace. Model rzadko jest jedynym ograniczeniem. Otaczająca go konstrukcja zapomina wcześniejsze decyzje, powtarza zakończoną pracę, przywołuje niewłaściwy stan lub dryfuje od pierwotnego pytania badawczego. Agenci brzegowi i fizycznie ucieleśnieni stają w obliczu tego samego problemu pamięci, mając jeszcze ściślejsze ograniczenia dotyczące kontekstu, obliczeń, przechowywania i łączności. Używając naszych istniejących eksperymentów z długo działającymi agentami badawczymi, pokażę, kiedy pamięć pomaga, kiedy staje się kosztownym szumem i co się dzieje, gdy istotny stan wypada z kontekstu. Porównam pamięć wyłączoną, wdrożoną pamięć, bramkowanie, aktywne klasyfikowanie sub-cel oraz warunki orakula, pokazując, że główna poprawa pochodziła z klasyfikowania wcześniejszego stanu zgodnie z aktualną sub-celem. To praktyczny przewodnik po pamięciach konstrukcyjnych: usuwanie kontekstu, progresywne ujawnianie, kompakcja pamięci z priorytetem na wspomnienia, uporządkowana pamięć decyzyjna i ocena na poziomie trajektorii. Główna teza jest taka, że pamięć agentna to nie tylko przechowywanie; to polityka decydująca, które przeszłe informacje powinny mieć władzę nad obecnym działaniem. Biografia: Stefania Druga jest Głównym Naukowcem Badawczym w RSI Lab Sakana AI, gdzie bada pamięć, uczenie bieżące i samodoskonalenie w systemach agentowych. Wcześniej była Naukowcem Badawczym AI w Google DeepMind i prowadziła badania w MIT Media Lab. Posiada doktorat z Uniwersytetu Waszyngtońskiego i magisterium z MIT. Jej prace obejmują ocenę agentów, interakcje multimodalne i AI ucieleśnione, z naciskiem na systemy, które uczą się na podstawie doświadczenia i pozostają niezawodne poza jedną sesją. Prezentacja 3 - Qdrant Edge: agentne wyszukiwanie dla sprzętu IoT i systemów autonomicznych Mówca: Ewa Szyszka (Inżynier DevRel, Qdrant) Abstrakt: Agenci działający na sprzęcie nie mogą czekać na sieć. Robot decydujący, gdzie postawić następny krok, czy dron w budynku bez połączenia, potrzebuje wyszukiwania, które odbywa się tam, gdzie dane są tworzone. Qdrant Edge to silnik wyszukiwania wektorowego Qdrant jako osadzona biblioteka: otwierasz shard na lokalnym dysku wewnątrz swojego procesu, zapisujesz osadzone wektory, a następnie przeprowadzasz zapytania offline, z rozmiarem instalacji około 11 MB, bez serwera, bez Dockera, bez wątków w tle. Ta prezentacja przeprowadzi przez pętlę agentów na urządzeniu (przechwytywanie, osadzanie, wyszukiwanie, podejmowanie decyzji) z wykorzystaniem na żywo demonstracji robota, gdzie hybrydowe wyszukiwanie nad gęstymi wektorami wizji i podpisami BM25 zwraca wyniki w czasie poniżej milisekundy. Biografia: Ewa Szyszka jest Inżynierem DevRel w Qdrant, zajmującym się zastosowaną wyszukiwarką wektorową, od tego, jak osadzone wektory z modeli takich jak ESM-2 są indeksowane, weryfikowane i kontrolowane na dużą skalę, po optymalizację latencji wyszukiwania agentnego na urządzeniach brzegowych. Wcześniej pracowała w dziedzinie badań i rozwoju wizji komputerowej, oceny, obserwowalności i zastosowania AI w urządzeniach do nawigacji podwodnej dla zastosowań morskich w Uniwersytecie Keio. Organizatorzy Ilya Kulyatin jest przedsiębiorcą z doświadczeniem zawodowym i akademickim w USA, Holandii, Singapurze, Wielkiej Brytanii i Japonii. Posiada licencjat z ekonomii, magisterium z finansów i MSc z uczenia maszynowego. Jest 3-krotnym założycielem, obecnie pomaga Japonii rozwijać lokalny ekosystem AI poprzez organizację non-profit, Tokyo AI (TAI), podczas gdy buduje integratora systemów AI i dostawcę rozwiązań, Foundry Labs株式会社. Ewa Szyszka jest Inżynierem DevRel w Qdrant, otwartym źródłowym bazie danych wektorowych, gdzie pracuje nad wyszukiwaniem dla danych naukowych i multimodalnych. Współorganizuje wydarzenia Tokyo AI (TAI) na styku AI i nauk biologicznych. Wsparcie Foundry Labs K.K. to tokijska firma zajmująca się integracją systemów AI i dostawą rozwiązań, oferująca kompleksowe wsparcie dla przedsiębiorstw: od projektowania strategii poprzez wdrożenie, uruchomienie i operacje. Dostosowują AI do operacyjnych, regulacyjnych i bezpieczeństwa wymagań klienta, z praktycznym doświadczeniem w finansach, rządzie i przemyśle oraz dużym dorobkiem w zakresie realizacji systemów produkcyjnych w środowiskach bezpiecznych i regulowanych. Qdrant to otwarty silnik wyszukiwania wektorowego, stworzony do obsługi danych wysokowymiarowych na dużą skalę. Napędza warstwę wyszukiwania dla niektórych z najbardziej wymagających aplikacji AI w produkcji dzisiaj, od pipeline’ów RAG po systemy rekomendacji i agentów AI, zapewniając deweloperom szybkie i dokładne wyszukiwanie podobieństw tam, gdzie jest to potrzebne. O TAI Tokyo AI (TAI) to największa międzynarodowa społeczność AI w Japonii, skupiająca ponad 5000 członków głównie z Tokio: inżynierów, naukowców, inwestorów, menadżerów produktów i liderów innowacji w korporacjach. Poprzez 80+ wydarzeń rocznie i 300+ prelegentów z zakresu startupów, przedsiębiorstw i akademii, TAI łączy ludzi budujących AI w Japonii z globalnym ekosystemem, pracując na rzecz przekształcenia Tokio w globalne centrum AI. Polityka prywatności Będziemy przetwarzać Twój adres e-mail w celach związanych z komunikacją dotyczącą wydarzeń oraz bieżącej komunikacji dotyczącej newslettera. Możesz zrezygnować z subskrypcji newslettera w dowolnym momencie. Szczegółowe informacje na temat przetwarzania danych osobowych są dostępne w naszej Polityce prywatności.
Lokalizacja wydarzenia
Daj swojej sieci znać, że idziesz
Udostępnij to wydarzenie, aby rozpocząć rozmowy, zaprosić kolegów i nawiązać kontakty przed jego rozpoczęciem.