Enviar evento
Autonomia Constrangida: Modelos de IA, Memória e Recuperação na Edge

Autonomia Constrangida: Modelos de IA, Memória e Recuperação na Edge

04 set 202618:00 - 21:00 Asia/TokyoBunkyo City, Japan0 ParticipantesOpen

Descrição

Descrição Esta sessão examina os desafios práticos de engenharia ao implantar IA em sistemas físicos restritos e dispositivos de edge. Ao decompor a pilha on-device em modelos, memória e recuperação, o evento aborda a economia da inferência local de LLMs, o design de memórias agenticas para gerenciamento contínuo de estado, e a implementação de busca vetorial incorporada para autonomia offline. Projetado para engenheiros que trabalham em robótica, ML aplicada e sistemas embarcados, as palestras se concentram na construção de comportamentos agenticos resilientes que funcionam de forma confiável sem dependências de nuvem. ​Agenda Começamos na camada de modelo, analisando a mecânica de hardware e a economia de executar LLMs diretamente em dispositivos de edge. Em seguida, examinamos a memória agentica, explorando como agentes de longa duração mantêm estado, ranqueiam subobjetivos, e gerenciam limites de contexto sem infraestrutura de nuvem. Concluímos com a camada de recuperação, demonstrando como motores vetoriais incorporados habilitam busca híbrida offline de submilissegundos diretamente dentro de hardware IoT e robótica autônoma. 18:00 Abertura das portas 18:30 - 19:00 Economia da Inferência LLM: Dos Datacenters para a Edge (Paul Willot, MLE Sênior @ Liquid AI) 19:00 - 19:30 Memória Agentica para Dispositivos de Edge (Stefania Druga, Cientista de Pesquisa Sênior @ Sakana AI RSI Lab) 19:30 - 20:00 Recuperação Agentica para Hardware IoT e Sistemas Autônomos (Ewa Szyszka, Engenheira DevRel @ Qdrant) 20:00 - 21:00 Networking 21:00 Fechamento das portas Palestras Palestra 1 - Economia da Inferência LLM: Dos Datacenters para a Edge Palestrante: Paul Willot (MLE Sênior, Liquid AI) Resumo: À medida que os modelos de linguagem se movem além do datacenter e para laptops, phones, robôs e outros dispositivos de edge, uma questão fundamental surge: onde faz sentido econômico executar inteligência? Responder a isso exige olhar sob os benchmarks dos modelos para a mecânica da inferência em si: como a largura de banda de memória, o tamanho do modelo, a utilização de hardware e a concorrência determinam o custo e a velocidade de produção de um token. Datacenters se beneficiam da escala, compartilhando o custo de grandes modelos entre muitos usuários concorrentes. Dispositivos de edge enfrentam um regime diferente, onde os recursos são mais restritos e há muito menos oportunidade de amortizar a inferência através de grandes lotes. Isso torna o design do modelo e do sistema cada vez mais importante: quantização, esparsidade, arquiteturas híbridas, cache e outras técnicas podem mudar materialmente a troca entre custo, throughput e interatividade. Baseando-se no trabalho da Liquid AI em modelos de fundação eficientes, a palestra explorará como essas trocas moldam o papel emergente da inteligência de edge. Técnicas recentes, como decodificação especulativa (incluindo o trabalho DSpark da Liquid AI), ilustram como repensar a pilha de inferência pode mover a fronteira de desempenho e tornar modelos cada vez mais capazes práticos em uma gama muito mais ampla de hardware. Bio: Paul Willot é engenheiro sênior na Liquid AI Japan, onde lidera o trabalho em modelos de IA eficientes que abrangem visão, áudio e linguagem. Ele tem mais de uma década de experiência em pesquisa e produção de aprendizado de máquina, com funções anteriores na Mercari, Elix e Alpaca Japan. Seu trabalho abrange desde busca em larga escala e sistemas de ML de baixa latência até visão computacional e modelos implantados em hardware de edge de baixo consumo. Ele possui um mestrado em Ciência de Dados e Aprendizado de Máquina pela Sorbonne Université e está particularmente interessado em tornar modelos avançados de IA práticos e eficientes em sistemas do mundo real. Palestra 2 - Memória Agentica para Dispositivos de Edge: Lições de Agentes de Pesquisa de Longa Duração Palestrante: Stefania Druga (Cientista de Pesquisa Sênior, Sakana.ai RSI Lab) Resumo: Na Sakana AI, construímos agentes que operam por centenas de turnos para ler literatura, realizar experimentos e redigir artigos. O modelo raramente é a única restrição. A estrutura ao redor esquece decisões anteriores, repete trabalhos concluídos, recupera o estado errado ou se distorce da questão de pesquisa original. Agentes embutidos e fisicamente reificadas enfrentam o mesmo problema de memória sob limites ainda mais restritos de contexto, computação, armazenamento e conectividade. Usando nossos experimentos existentes com agentes de pesquisa de longa duração, irei mostrar quando a memória ajuda, quando se torna um ruído caro e o que acontece uma vez que o estado relevante sai do contexto. Compararei memória-desligada, recuperação implantada, controle, ranqueamento ativo de subobjetivos e condições oraculares, mostrando que a principal melhoria veio do ranqueamento do estado anterior pelo subobjetivo atual. Este é um guia prático de campo para estruturas de memória: evacuação de contexto, divulgação progressiva, compactação de recuperação-primeiro, memória de decisão estruturada e avaliação em nível de trajetória. O argumento central é que a memória agentica não é meramente armazenamento; é uma política para decidir qual informação do passado deve ter autoridade sobre a ação presente. Bio: Stefania Druga é Cientista de Pesquisa Sênior no Sakana AI’s RSI Lab, onde estuda memória, aprendizagem contínua e autoaperfeiçoamento em sistemas agenticos. Anteriormente, foi Cientista de Pesquisa em IA na Google DeepMind e conduziu pesquisas no MIT Media Lab. Ela possui um PhD pela Universidade de Washington e um MS pelo MIT. Seu trabalho abrange avaliação de agentes, interação multimodal e IA incorporada, com foco em sistemas que aprendem com experiência e permanecem confiáveis além de uma única sessão. Palestra 3 - Qdrant Edge: recuperação agentica para hardware IoT e sistemas autônomos Palestrante: Ewa Szyszka (Engenheira DevRel, Qdrant) Resumo: Agentes rodando em hardware não podem esperar por uma rede. Um robô decidindo onde pisar a seguir, ou um drone em um edifício sem uplink, precisa de recuperação que aconteça onde os dados são criados. Qdrant Edge é o motor de busca vetorial Qdrant como uma biblioteca incorporada: você abre um shard no disco local dentro do seu próprio processo, escreve embeddings nele e os consulta offline, com um footprint de instalação em torno de 11 MB e sem servidor, sem Docker, sem threads em segundo plano. Esta palestra percorre o ciclo agentico on-device (captura, embutir, buscar, decidir) usando uma demonstração ao vivo de robô onde a busca híbrida sobre vetores de visão densa e legendas BM25 retorna resultados em menos de uma milissegundo. Bio: Ewa Szyszka é Engenheira DevRel na Qdrant, trabalhando em busca vetorial aplicada, desde como embeddings de modelos como ESM-2 são indexados, filtrados e inspecionados em escala até a otimização da latência de recuperação agentica em dispositivos de edge. Ela trabalhou anteriormente em pesquisa e desenvolvimento de visão computacional, benchmarks, observabilidade e aplicações de IA em dispositivos de navegação submarina para aplicações marinhas na Universidade Keio. ​Organizadores Ilya Kulyatin é um empreendedor com experiência de trabalho e acadêmica nos EUA, Países Baixos, Cingapura, Reino Unido e Japão. Ele possui um BA em Economia, um MA em Finanças e um MSc em Aprendizado de Máquina. Ele é um 3x fundador, agora ajudando o Japão a crescer o ecossistema local de IA através de uma comunidade sem fins lucrativos, Tokyo AI (TAI), enquanto constrói um integrador de sistemas nativos de IA e fornecedor de soluções, Foundry Labs株式会社. Ewa Szyszka é Engenheira DevRel na Qdrant, o banco de dados vetorial de código aberto, onde trabalha em recuperação para dados científicos e multimodais. Ela coorganiza eventos da Tokyo AI (TAI) na interseção de IA e ciências da vida. ​Apoiadores Foundry Labs K.K. é um integrador de sistemas de IA baseado em Tóquio e fornecedor de soluções, oferecendo suporte de ponta a ponta para empresas: desde o design de estratégia até a implementação, implantação e operações. Eles adaptam a IA às exigências operacionais, regulatórias e de segurança de cada cliente, com experiência prática em finanças, governo e indústria, e um histórico de entrega de sistemas de produção em ambientes seguros e regulamentados. Qdrant é um motor de busca vetorial de código aberto construído para lidar com dados de alta dimensão em escala. Ele alimenta a camada de recuperação por trás de algumas das aplicações de IA mais exigentes em produção hoje, desde pipelines RAG até sistemas de recomendação e agentes de IA, oferecendo aos desenvolvedores busca de similaridade rápida e precisa onde quer que seja necessário. Sobre a TAI Tokyo AI (TAI) é a maior comunidade internacional de IA no Japão, com mais de 5.000 membros, principalmente baseados em Tóquio: engenheiros, pesquisadores, investidores, gerentes de produto e líderes de inovação corporativa. Através de mais de 80 eventos por ano e mais de 300 palestrantes abrangendo startups, empresas e academia, a TAI conecta as pessoas que constroem IA no Japão com o ecossistema global, trabalhando para transformar Tóquio em um hub global de IA. ​​Política de Privacidade Processaremos seu endereço de e-mail para fins de comunicações relacionadas ao evento e comunicações de boletim informativo contínuas. Você pode cancelar a inscrição do boletim a qualquer momento. Mais detalhes sobre como processamos dados pessoais estão disponíveis em nossa Política de Privacidade.

Localização do evento

Diga à sua rede que vai participar

Partilhe este evento para iniciar conversas, convidar colegas e conectar-se antes que comece.

Related events

Plataforma de inteligência artificial

Gratuito
Registar gratuitamente