Evenement toevoegen
Beperkte autonomie: AI-modellen, geheugen en retrieval aan de rand

Beperkte autonomie: AI-modellen, geheugen en retrieval aan de rand

04 sep. 202618:00 - 21:00 Asia/TokyoBunkyo City, Japan0 DeelnemersOpen

Beschrijving

Beschrijving Deze sessie onderzoekt de praktische technische uitdagingen van het inzetten van AI op beperkte fysieke systemen en randapparatuur. Door de on-device stack op te splitsen in modellen, geheugen en retrieval, behandelt het evenement de economie van lokale LLM-inferentie, het ontwerp van agentisch geheugen voor continue staatbeheer en de implementatie van ingebedde vectorzoekoplossingen voor offline autonomie. Ontworpen voor engineers die werken in robotica, toegepaste ML, en embedded systemen, richten de lezingen zich op het bouwen van veerkrachtig agentisch gedrag dat betrouwbaar functioneert zonder afhankelijkheid van de cloud. ​Agenda We beginnen op het modellageniveau door de hardwaremechanica en economie van het draaien van LLM's direct op randapparatuur te analyseren. Vervolgens onderzoeken we agentisch geheugen en verkennen we hoe langlopende agents de staat behouden, subdoelen rangschikken en contextlimieten beheren zonder cloudinfrastructuur. We eindigen met de retrievallaag, waarbij we laten zien hoe ingebedde vectorengines sub-millisecond, offline hybride zoekopdrachten mogelijk maken direct in IoT-hardware en autonome robotica. 18:00 Deuren open 18:30 - 19:00 LLM Inferentie-economie: Van datacenters naar de rand (Paul Willot, Senior MLE @ Liquid AI) 19:00 - 19:30 Agentisch geheugen voor randapparatuur (Stefania Druga, Staff Research Scientist @ Sakana AI RSI Lab) 19:30 - 20:00 Agentische retrieval voor IoT-hardware en autonome systemen (Ewa Szyszka, DevRel Engineer @ Qdrant) 20:00 - 21:00 Netwerken 21:00 Deuren sluiten Lezingen Lezing 1 - LLM Inferentie-economie: Van datacenters naar de rand Spreker: Paul Willot (Senior MLE, Liquid AI) Abstract: Terwijl taalmodellen zich van de datacenter naar laptops, telefoons, robots en andere randapparatuur verplaatsen, ontstaat er een fundamentele vraag: waar maakt het economisch gezien zin om intelligentie uit te voeren? Het beantwoorden van deze vraag vereist dat we onder modelbenchmarks kijken naar de mechanica van inferentie zelf: hoe geheugenbandbreedte, modelgrootte, hardwarebenutting en gelijktijdigheid de kosten en snelheid van het produceren van een token bepalen. Datacenters profiteren van schaalvoordelen, waarbij de kosten van grote modellen worden gedeeld over veel gelijktijdige gebruikers. Randapparatuur heeft te maken met een ander regime, waar bronnen beperkter zijn en er veel minder mogelijkheden zijn om inferentie te amortiseren via grote batches. Dit maakt model- en systeemontwerp steeds belangrijker: kwantisatie, sparsititeit, hybride architecturen, caching en andere technieken kunnen de afweging tussen kosten, doorvoer en interactie materieel verschuiven. Geïnspireerd door het werk van Liquid AI aan efficiënte fundamentmodellen, zal de lezing verkennen hoe deze afwegingen de opkomende rol van randintelligentie vormgeven. Recente technieken zoals speculatieve decodering (inclusief Liquid AI's DSpark-werk) illustreren hoe het heroverwegen van de inferentiestapel de prestatiegrens kan verplaatsen en steeds capabelere modellen praktisch kan maken op een veel breder scala aan hardware. Bio: Paul Willot is een senior engineer bij Liquid AI Japan, waar hij het werk leidt aan efficiënte AI-modellen die zich uitstrekken over visie, audio en taal. Hij heeft meer dan tien jaar ervaring in machine learning-onderzoek en productie, met eerdere rollen bij Mercari, Elix en Alpaca Japan. Zijn werk varieert van grootschalig zoeken en low-latency ML-systemen tot computer visie en modellen die op low-power randhardware zijn ingezet. Hij heeft een Master's degree in Data Science en Machine Learning van de Sorbonne Université en is bijzonder geïnteresseerd in het praktisch en efficiënt maken van geavanceerde AI-modellen in echte systemen. Lezing 2 - Agentisch Geheugen voor Randapparatuur: Lessen van Langlopende Onderzoeksagents Spreker: Stefania Druga (Staff Research Scientist, Sakana.ai RSI Lab) Abstract: Bij Sakana AI bouwen we agents die honderden beurten draaien om literatuur te lezen, experimenten uit te voeren en papers op te stellen. Het model is zelden de enige beperking. De omringende harnassen vergeten eerdere beslissingen, herhalen voltooide werkzaamheden, halen de verkeerde staat op of dwalen af van de oorspronkelijke onderzoeksvraag. Rand- en fysiek belichaamde agents staan voor hetzelfde geheugenprobleem onder nog striktere beperkingen op context, rekenkracht, opslag en connectiviteit. Aan de hand van onze bestaande experimenten met langlopende onderzoeksagents zal ik laten zien wanneer geheugen helpt, wanneer het dure ruis wordt, en wat er gebeurt wanneer relevante staat uit de context valt. Ik zal geheugen-productie, geselecteerde herinnering, gating, actieve-subdoelrangschikking en oracle-omstandigheden vergelijken, en laten zien dat de belangrijkste verbetering voortkwam uit het rangschikken van de vorige staat op basis van het huidige subdoel. Dit is een praktische veldgids voor geheugenharnassen: contextverhuizing, progressieve openbaarmaking, herinnering-eerst compactie, gestructureerd beslissingsgeheugen en evaluatie op trajectniveau. Het centrale argument is dat agentisch geheugen niet alleen opslag is; het is een beleid voor het beslissen welke eerdere informatie autoriteit moet hebben over de huidige actie. Bio: Stefania Druga is een Staff Research Scientist bij het RSI Lab van Sakana AI, waar ze geheugen, continue leerprocessen en zelfverbetering in agentische systemen bestudeert. Voorheen was ze AI Research Scientist bij Google DeepMind en voerde ze onderzoek uit aan het MIT Media Lab. Ze heeft een PhD van de Universiteit van Washington en een MS van MIT. Haar werk beslaat agentevaluatie, multimodale interactie en belichaamde AI, met een focus op systemen die leren van ervaring en betrouwbaar blijven buiten een enkele sessie. Lezing 3 - Qdrant Edge: agentische retrieval voor IoT-hardware en autonome systemen Spreker: Ewa Szyszka (DevRel Engineer, Qdrant) Abstract: Agents die op hardware draaien kunnen niet wachten op een netwerk. Een robot die moet beslissen waar hij de volgende stap zet, of een drone in een gebouw zonder uplink, heeft retrieval nodig die gebeurt waar de gegevens worden gecreëerd. Qdrant Edge is de Qdrant vectorzoekmachine als een ingebedde bibliotheek: je opent een shard op lokale schijf binnen je eigen proces, schrijft embeddings naar deze schijf en queryt ze offline, met een installatie-voetafdruk van ongeveer 11 MB en zonder server, geen Docker, geen achtergrondthreads. Deze lezing doorloopt de on-device agentische lus (vastleggen, embedden, zoeken, beslissen) met een live robot-demo waarbij hybride zoekopdrachten over dichte visievectoren en BM25-bijschriften resultaten opleveren in minder dan een milliseconde. Bio: Ewa Szyszka is een DevRel Engineer bij Qdrant, waar ze werkt aan toegepaste vectorzoekoplossingen, van hoe embeddings van modellen zoals ESM-2 worden geïndexeerd, gescreend en op grote schaal worden geïnspecteerd tot het optimaliseren van agentische retrieval-latentie op randapparatuur. Ze heeft eerder gewerkt aan computer vision R&D, benchmarks, observability en toepassingen van AI in onderwaternavigatieapparaten voor maritieme toepassingen aan de Keio Universiteit. ​Organisatoren Ilya Kulyatin is een ondernemer met werk- en academische ervaring in de VS, Nederland, Singapore, VK en Japan. Hij heeft een BA in Economie, een MA in Financiën en een MSc in Machine Learning. Hij is 3x oprichter en helpt momenteel Japan de lokale AI-ecosysteem te laten groeien door middel van een non-profit gemeenschap, Tokyo AI (TAI), terwijl hij een AI-native systeemintegrator en oplossingenprovider, Foundry Labs株式会社, opbouwt. Ewa Szyszka is een DevRel Engineer bij Qdrant, de open-source vector database, waar ze werkt aan retrieval voor wetenschappelijke en multimodale gegevens. Ze co-organiseert Tokyo AI (TAI) evenementen op het snijvlak van AI en de levenswetenschappen. ​Ondersteuners Foundry Labs K.K. is een in Tokio gevestigde AI-systeemintegrator en oplossingenprovider, die end-to-end ondersteuning biedt voor ondernemingen: van strategie-ontwerp tot implementatie, uitrol en operaties. Ze passen AI aan op de operationele, regelgevende en beveiligingsvereisten van elke klant, met praktische ervaring in de financiën, de overheid en de industrie, en een bewezen staat van dienst in het leveren van productiesystemen in veilige en gereguleerde omgevingen. Qdrant is een open-source vectorzoekmachine gebouwd om hoge-dimensionale gegevens op schaal te verwerken. Het ondersteunt de retrieval-laag achter enkele van de meest veeleisende AI-toepassingen in productie vandaag, van RAG-pijpleidingen tot aanbevelingssystemen tot AI-agents, en biedt ontwikkelaars snelle, nauwkeurige gelijkenis zoekopdrachten waar dat nodig is. Over TAI Tokyo AI (TAI) is de grootste internationale AI-gemeenschap in Japan, met meer dan 5.000 leden, voornamelijk gevestigd in Tokio: engineers, onderzoekers, investeerders, productmanagers en leiders in bedrijfsinnovatie. Via meer dan 80 evenementen per jaar en 300+ sprekers die startups, ondernemingen en de academische wereld bestrijken, verbindt TAI de mensen die AI in Japan bouwen met het wereldwijde ecosysteem, en werkt aan het transformeren van Tokio tot een wereldwijde AI-hub. ​​Privacybeleid We zullen uw e-mailadres verwerken voor eventgerelateerde communicatie en doorlopende nieuwsbriefcommunicatie. U kunt zich op elk moment afmelden voor de nieuwsbrief. Verdere details over hoe we persoonlijke gegevens verwerken zijn beschikbaar in ons Privacybeleid.

Locatie evenement

Laat je netwerk weten dat je komt

Deel dit evenement om gesprekken te starten, collega`s uit te nodigen en van tevoren contact te leggen.

Related events

Platform voor kunstmatige intelligentie

Gratis
Gratis registreren