
Autonomía Constrainada: Modelos de IA, Memoria y Recuperación en el Edge
Descripción
Descripción Esta sesión examina los desafíos de ingeniería prácticos de desplegar IA en sistemas físicos restringidos y dispositivos edge. Al descomponer la pila en el dispositivo en modelos, memoria y recuperación, el evento cubre la economía de la inferencia de LLM local, el diseño de arneses de memoria agentes para la gestión continua del estado y la implementación de búsqueda vectorial embebida para la autonomía offline. Diseñado para ingenieros que trabajan en robótica, ML aplicado y sistemas embebidos, las charlas se centran en construir un comportamiento agente resiliente que funcione de manera confiable sin dependencias de la nube. Agenda Comenzamos en la capa del modelo analizando la mecánica de hardware y economía de ejecutar LLMs directamente en dispositivos edge. A continuación, examinamos la memoria agente, explorando cómo los agentes de larga duración retienen el estado, clasifican subobjetivos y gestionan límites de contexto sin la infraestructura en la nube. Concluimos con la capa de recuperación, demostrando cómo los motores vectoriales embebidos permiten búsquedas híbridas offline de sub-milisegundos directamente dentro del hardware IoT y la robótica autónoma. 18:00 Apertura de puertas 18:30 - 19:00 Economía de Inferencia de LLM: Desde Datacenters hasta el Edge (Paul Willot, Ingeniero Senior de MLE en Liquid AI) 19:00 - 19:30 Memoria Agente para Dispositivos Edge (Stefania Druga, Científica Investigadora en Sakana AI RSI Lab) 19:30 - 20:00 Recuperación Agente para Hardware IoT y Sistemas Autónomos (Ewa Szyszka, Ingeniera DevRel en Qdrant) 20:00 - 21:00 Networking 21:00 Cierre de puertas Charlas Charla 1 - Economía de la Inferencia de LLM: Desde Datacenters hasta el Edge Ponente: Paul Willot (Ingeniero Senior, Liquid AI) Resumen: A medida que los modelos de lenguaje pasan del datacenter a laptops, teléfonos, robots y otros dispositivos edge, surge una pregunta fundamental: ¿dónde tiene sentido económico ejecutar inteligencia? Responderlo requiere mirar por debajo de los puntos de referencia del modelo en la mecánica de la inferencia misma: cómo el ancho de banda de memoria, el tamaño del modelo, la utilización de hardware y la concurrencia determinan el costo y la velocidad de producción de un token. Los datacenters se benefician de la escala, compartiendo el costo de modelos grandes entre muchos usuarios concurrentes. Los dispositivos edge enfrentan un régimen diferente, donde los recursos son más limitados y hay mucho menos oportunidad de amortizar la inferencia a través de grandes lotes. Esto hace que el diseño de modelos y sistemas sea cada vez más importante: la cuantización, la escasez, las arquitecturas híbridas, la memoria caché y otras técnicas pueden alterar materialmente el equilibrio entre costo, rendimiento e interactividad. Basándose en el trabajo de Liquid AI sobre modelos de fundación eficientes, la charla explorará cómo estos compromisos moldean el papel emergente de la inteligencia edge. Técnicas recientes como la decodificación especulativa (incluido el trabajo DSpark de Liquid AI) ilustran cómo repensar la pila de inferencia puede mover la frontera de rendimiento y hacer modelos cada vez más capaces prácticos en una gama mucho más amplia de hardware. Biografía: Paul Willot es ingeniero senior en Liquid AI Japón, donde lidera el trabajo sobre modelos de IA eficientes que abarcan visión, audio y lenguaje. Tiene más de una década de experiencia en investigación y producción de aprendizaje automático, con roles anteriores en Mercari, Elix y Alpaca Japón. Su trabajo ha abarcado desde búsqueda a gran escala y sistemas de ML de baja latencia hasta visión por computadora y modelos desplegados en hardware edge de bajo consumo. Posee un máster en Ciencia de Datos y Aprendizaje Automático de la Sorbonne Université y está particularmente interesado en hacer que los modelos de IA avanzados sean prácticos y eficientes en sistemas del mundo real. Charla 2 - Memoria Agente para Dispositivos Edge: Lecciones de Agentes de Investigación de Larga Duración Ponente: Stefania Druga (Científica Investigadora, Sakana.ai RSI Lab) Resumen: En Sakana AI, construimos agentes que funcionan durante cientos de turnos para leer literatura, realizar experimentos y redactar documentos. Rara vez el modelo es la única restricción. El arnés circundante olvida decisiones anteriores, repite trabajos completados, recupera el estado incorrecto o se aleja de la pregunta original de investigación. Los agentes edge y físicamente encarnados enfrentan el mismo problema de memoria bajo límites aún más estrictos de contexto, computación, almacenamiento y conectividad. Usando nuestros experimentos existentes con agentes de investigación de larga duración, mostraré cuándo la memoria ayuda, cuándo se convierte en ruido costoso y qué sucede una vez que el estado relevante cae fuera del contexto. Compararé memoria fuera, recuerdo desplegado, clasificación de sub-objetivos activos y condiciones de oráculo, demostrando que la principal mejora provino de clasificar el estado anterior por el sub-objetivo actual. Esta es una guía práctica sobre arneses de memoria: expulsión de contexto, divulgación progresiva, compactación de recuerdo-primer, memoria de decisiones estructurada y evaluación a nivel de trayectoria. El argumento central es que la memoria agente no es meramente almacenamiento; es una política para decidir qué información pasada debería tener autoridad sobre la acción presente. Biografía: Stefania Druga es Científica Investigadora en el RSI Lab de Sakana AI, donde estudia memoria, aprendizaje continuo y auto-mejora en sistemas agentes. Anteriormente, fue Científica Investigadora en IA en Google DeepMind y llevó a cabo investigaciones en el MIT Media Lab. Tiene un doctorado de la Universidad de Washington y una maestría de MIT. Su trabajo abarca evaluación de agentes, interacción multimodal y IA encarnada, con un enfoque en sistemas que aprenden de la experiencia y permanecen confiables más allá de una única sesión. Charla 3 - Qdrant Edge: recuperación agente para hardware IoT y sistemas autónomos Ponente: Ewa Szyszka (Ingeniera DevRel, Qdrant) Resumen: Los agentes que funcionan en hardware no pueden esperar en una red. Un robot que decide dónde pisar a continuación, o un dron en un edificio sin enlace, necesita recuperación que suceda donde se crea los datos. Qdrant Edge es el motor de búsqueda vectorial Qdrant como una biblioteca embebida: abres un fragmento en el disco local dentro de tu propio proceso, escribes incrustaciones en él y consultas offline, con un requerimiento de instalación alrededor de 11 MB y sin servidor, sin Docker, sin hilos en segundo plano. Esta charla repasa el bucle agente en el dispositivo (captar, incrustar, buscar, decidir) utilizando una demostración de robot en vivo donde la búsqueda híbrida sobre vectores de visión densos y subtítulos BM25 devuelve resultados en menos de un milisegundo. Biografía: Ewa Szyszka es Ingeniera DevRel en Qdrant, trabajando en búsqueda vectorial aplicada desde cómo las incrustaciones de modelos como ESM-2 se indexan, filtran e inspeccionan a escala hasta optimizar la latencia de recuperación agente en dispositivos edge. Anteriormente trabajó en I+D de visión por computadora, benchmarks, observabilidad y aplicaciones de IA en dispositivos de navegación submarina para aplicaciones marinas en la Universidad de Keio. Organizadores Ilya Kulyatin es un emprendedor con experiencia laboral y académica en EE. UU., Países Bajos, Singapur, Reino Unido y Japón. Tiene una licenciatura en Economía, una maestría en Finanzas y un máster en Aprendizaje Automático. Es fundador en 3 ocasiones y ahora ayuda a Japón a hacer crecer el ecosistema local de IA a través de una comunidad sin fines de lucro, Tokyo AI (TAI), mientras construye un integrador de sistemas y proveedor de soluciones nativo de IA, Foundry Labs株式会社. Ewa Szyszka es Ingeniera DevRel en Qdrant, la base de datos vectorial de código abierto, donde trabaja en recuperación de datos científicos y multimodales. Co-organiza eventos de Tokyo AI (TAI) en la intersección de IA y ciencias de la vida. Patrocinadores Foundry Labs K.K. es un integrador de sistemas de IA y proveedor de soluciones basado en Tokio, que ofrece soporte integral para empresas: desde el diseño de estrategia hasta la implementación, despliegue y operaciones. Adaptan IA a los requisitos operacionales, regulatorios y de seguridad de cada cliente, con experiencia práctica en finanzas, gobierno e industria, y un historial de envío de sistemas productivos en entornos seguros y regulados. Qdrant es un motor de búsqueda vectorial de código abierto diseñado para manejar datos de alta dimensión a escala. Potencia la capa de recuperación detrás de algunas de las aplicaciones de IA más exigentes en producción hoy en día, desde pipelines RAG hasta sistemas de recomendación y agentes de IA, brindando a los desarrolladores una búsqueda de similitud rápida y precisa dondequiera que sea necesario. Acerca de TAI Tokyo AI (TAI) es la comunidad internacional de IA más grande en Japón, con más de 5,000 miembros principalmente en Tokio: ingenieros, investigadores, inversores, gerentes de producto y líderes de innovación corporativa. A través de más de 80 eventos al año y más de 300 ponentes que abarcan desde startups, empresas y academia, TAI conecta a las personas que construyen IA en Japón con el ecosistema global, trabajando para transformar Tokio en un centro global de IA. Política de Privacidad Procesaremos su dirección de correo electrónico con el fin de comunicaciones relacionadas con eventos y comunicaciones continuas de boletines. Puede darse de baja del boletín en cualquier momento. Más detalles sobre cómo procesamos datos personales están disponibles en nuestra Política de Privacidad.
Ubicación del evento
Dile a tu red que vas a ir
Comparte este evento para iniciar conversaciones, invitar colegas y conectar antes de que comience.