Soumettre un événement
Autonomie Contraignante : Modèles d'IA, Mémoire et Récupération à la Periphérie

Autonomie Contraignante : Modèles d'IA, Mémoire et Récupération à la Periphérie

04 sept. 202618:00 - 21:00 Asia/TokyoBunkyo City, Japan0 ParticipantsOpen

Description

Description Cette session examine les défis d'ingénierie pratique liés au déploiement de l'IA dans des systèmes physiques contraints et des appareils en périphérie. En décomposant la pile sur appareil en modèles, mémoire et récupération, l'événement couvre l'économie de l'inférence LLM locale, la conception de harnais de mémoire agentique pour la gestion continue de l'état, et l'implémentation de recherche de vecteurs intégrée pour une autonomie hors ligne. Conçu pour les ingénieurs travaillant dans la robotique, le ML appliqué, et les systèmes embarqués, les interventions se concentrent sur la construction de comportements agentiques résilients qui fonctionnent de manière fiable sans dépendances au cloud. ​Agenda Nous commençons au niveau du modèle en analysant les mécanismes matériels et l'économie de l'exécution des LLM directement sur des appareils en périphérie. Ensuite, nous examinons la mémoire agentique, explorant comment les agents à long terme conservent l'état, classent les sous-objectifs et gèrent les limites de contexte sans infrastructure cloud. Nous concluons avec le niveau de récupération, démontrant comment les moteurs de vecteurs intégrés permettent une recherche hybride hors ligne en moins d'une milliseconde directement à l'intérieur du matériel IoT et de la robotique autonome. 18:00 Ouverture des portes 18:30 - 19:00 Économie de l'inférence LLM : Des Datacenters à la Périphérie (Paul Willot, Ingénieur MLE Senior @ Liquid AI) 19:00 - 19:30 Mémoire agentique pour les appareils en périphérie (Stefania Druga, Chercheuse Senior @ Sakana AI RSI Lab) 19:30 - 20:00 Récupération agentique pour le matériel IoT et les systèmes autonomes (Ewa Szyszka, Ingénieur DevRel @ Qdrant) 20:00 - 21:00 Réseautage 21:00 Fermeture des portes Interventions Intervention 1 - Économie de l'inférence LLM : Des Datacenters à la Périphérie Intervenant : Paul Willot (Ingénieur MLE Senior, Liquid AI) Résumé : À mesure que les modèles de langue passent au-delà des datacenters et sur des ordinateurs portables, des téléphones, des robots et d'autres appareils en périphérie, une question fondamentale émerge : où a-t-il un sens économique de faire fonctionner l'intelligence ? Y répondre nécessite d'observer en profondeur les benchmarks des modèles et les mécanismes de l'inférence elle-même : comment la bande passante de mémoire, la taille du modèle, l'utilisation du matériel et la concurrence déterminent le coût et la vitesse de production d'un jeton. Les datacenters bénéficient d'échelles, partageant le coût de grands modèles entre de nombreux utilisateurs concurrents. Les appareils en périphérie font face à un régime différent, où les ressources sont plus limitées et où il y a beaucoup moins d'opportunités d'amortir l'inférence par le biais de grands lots. Cela rend la conception des modèles et des systèmes de plus en plus importante : la quantification, la sparsité, les architectures hybrides, la mise en cache et d'autres techniques peuvent modifier de manière significative le compromis entre le coût, le débit et l'interactivité. S'appuyant sur le travail de Liquid AI sur des modèles fondation efficaces, l'intervention explorera comment ces compromis façonnent le rôle émergent de l'intelligence en périphérie. Des techniques récentes telles que le décodage spéculatif (y compris le travail DSpark de Liquid AI) illustrent comment repenser la pile d'inférence peut déplacer la frontière de performance et rendre des modèles de plus en plus capables pratiques sur une gamme de matériels beaucoup plus large. Bio : Paul Willot est un ingénieur senior chez Liquid AI Japan, où il dirige le travail sur des modèles d'IA efficaces couvrant la vision, l'audio et le langage. Il possède plus d'une décennie d'expérience dans la recherche et la production en apprentissage automatique, avec des rôles précédents chez Mercari, Elix et Alpaca Japan. Son travail a varié entre la recherche à grande échelle et les systèmes ML à faible latence pour la vision par ordinateur et les modèles déployés sur du matériel de bord à faible consommation. Il est titulaire d'un Master en Data Science et en Machine Learning de l'Université de la Sorbonne, et est particulièrement intéressé par la manière de rendre des modèles d'IA avancés pratiques et efficaces dans des systèmes réels. Intervention 2 - Mémoire Agentique pour les Appareils de Périphérie : Leçons des Agents de Recherche de Longue Durée Intervenant : Stefania Druga (Chercheuse Senior, Sakana.ai RSI Lab) Résumé : Chez Sakana AI, nous construisons des agents qui fonctionnent pendant des centaines de tours pour lire des documents, réaliser des expériences et rédiger des articles. Le modèle n'est pas souvent la seule contrainte. Le harnais environnant oublie les décisions antérieures, répète le travail accompli, récupère le mauvais état ou s'écarte de la question de recherche initiale. Les agents intégrés et physiquement incarnés font face au même problème de mémoire sous des limites encore plus strictes sur le contexte, le calcul, le stockage et la connectivité. En utilisant nos expériences existantes avec des agents de recherche de longue durée, je montrerai quand la mémoire aide, quand elle devient un bruit coûteux, et ce qui se passe une fois que l'état pertinent sort du contexte. Je vais comparer la mémoire désactivée, le rappel déployé, le contrôle, le classement actif des sous-objectifs et les conditions oracle, montrant que la principale amélioration provenait du classement des états antérieurs par rapport au sous-objectifs actuel. C'est un guide pratique sur les harnais de mémoire : éviction de contexte, divulgation progressive, compactage prioritaire basé sur le rappel, mémoire de décision structurée, et évaluation au niveau des trajectoires. L'argument central est que la mémoire agentique n'est pas simplement du stockage ; c'est une politique pour décider quelle information passée devrait avoir autorité sur l'action présente. Bio : Stefania Druga est chercheuse senior au laboratoire RSI de Sakana AI, où elle étudie la mémoire, l'apprentissage continu et l'auto-amélioration dans les systèmes agentiques. Auparavant, elle était chercheuse en IA chez Google DeepMind et a mené des recherches au MIT Media Lab. Elle est titulaire d'un doctorat de l'Université de Washington et d'une maîtrise du MIT. Son travail couvre l'évaluation des agents, l'interaction multimodale et l'IA incarnée, avec un accent sur les systèmes qui apprennent de l'expérience et restent fiables au-delà d'une seule session. Intervention 3 - Qdrant Edge : Récupération agentique pour le matériel IoT et les systèmes autonomes Intervenant : Ewa Szyszka (Ingénieur DevRel, Qdrant) Résumé : Les agents fonctionnant sur le matériel ne peuvent pas attendre d'être connectés à un réseau. Un robot décidant où poser le prochain pas, ou un drone dans un bâtiment sans liaison montante, a besoin d'une récupération qui se déroule là où les données sont créées. Qdrant Edge est le moteur de recherche de vecteurs Qdrant en tant que bibliothèque intégrée : vous ouvrez un fragment sur le disque local à l'intérieur de votre propre processus, écrivez des embeddings dans celui-ci et interrogez-les hors ligne, avec une empreinte d'installation d'environ 11 Mo sans serveur, sans Docker, sans threads d'arrière-plan. Cette intervention passe en revue la boucle agentique sur appareil (capturer, intégrer, rechercher, décider) à l'aide d'une démonstration en direct d'un robot où la recherche hybride sur des vecteurs de vision denses et des légendes BM25 retourne des résultats en moins d'une milliseconde. Bio : Ewa Szyszka est Ingénieur DevRel chez Qdrant, travaillant sur la recherche de vecteurs appliquée à la façon dont les embeddings de modèles comme ESM-2 sont indexés, filtrés et inspectés à grande échelle pour optimiser la latence de récupération agentique sur des appareils en périphérie. Elle a précédemment travaillé dans la R&D en vision par ordinateur, benchmarks, observabilité et applications de l'IA dans des dispositifs de navigation sous-marine pour des applications marines à l'Université Keio. ​Organisateurs Ilya Kulyatin est un entrepreneur avec une expérience professionnelle et académique aux États-Unis, aux Pays-Bas, à Singapour, au Royaume-Uni et au Japon. Il est titulaire d'une licence en économie, d'un master en finance et d'un MSc en apprentissage automatique. Il est un fondateur à trois reprises, aidant désormais le Japon à développer l'écosystème local de l'IA à travers une communauté à but non lucratif, Tokyo AI (TAI), tout en construisant un intégrateur de systèmes et fournisseur de solutions natif de l'IA, Foundry Labs株式会社. Ewa Szyszka est Ingénieur DevRel chez Qdrant, la base de données vectorielle open-source, où elle travaille sur la récupération de données scientifiques et multimodales. Elle co-organise des événements Tokyo AI (TAI) à l'intersection de l'IA et des sciences de la vie. ​Soutiens Foundry Labs K.K. est un intégrateur de systèmes d'IA basé à Tokyo et un fournisseur de solutions, offrant un soutien de bout en bout aux entreprises : de la conception de stratégies à la mise en œuvre, au déploiement et aux opérations. Ils adaptent l'IA aux exigences opérationnelles, réglementaires et de sécurité de chaque client, avec une expérience pratique dans les domaines de la finance, du gouvernement et de l'industrie, et un bilan de livraison de systèmes de production dans des environnements sécurisés et réglementés. Qdrant est un moteur de recherche de vecteurs open-source conçu pour traiter des données de haute dimension à grande échelle. Il alimente la couche de récupération derrière certaines des applications IA les plus exigeantes en production aujourd'hui, des pipelines RAG aux systèmes de recommandation en passant par les agents IA, offrant aux développeurs une recherche de similarité rapide et précise où cela est nécessaire. À propos de TAI Tokyo AI (TAI) est la plus grande communauté internationale d'IA au Japon, avec plus de 5,000 membres principalement basés à Tokyo : ingénieurs, chercheurs, investisseurs, chefs de produits et leaders de l'innovation d'entreprise. Grâce à plus de 80 événements par an et plus de 300 intervenants provenant de startups, d'entreprises et du milieu académique, TAI connecte les personnes qui construisent l'IA au Japon avec l'écosystème mondial, travaillant à transformer Tokyo en un hub mondial de l'IA. ​​Politique de confidentialité Nous traiterons votre adresse e-mail dans le cadre des communications liées à l'événement et des communications de newsletters continues. Vous pouvez vous désinscrire de la newsletter à tout moment. De plus amples détails sur la manière dont nous traitons les données personnelles sont disponibles dans notre Politique de confidentialité.

Lieu de l`événement

Faites savoir à votre réseau que vous y allez

Partagez cet événement pour engager des conversations, inviter des collègues et vous connecter avant qu`il commence.

Related events

Plateforme d’intelligence artificielle

Gratuit
S`inscrire gratuitement