
Construire des systèmes d'IA auto-améliorants
Description
Alors que les grands modèles de langage sont appliqués à des domaines complexes, la frontière passe de modèles entraînés une fois à des systèmes auto-améliorants. Amit décomposera l'auto-amélioration en trois axes : génération d'environnement, entraînement RL, et évolution de l'outil, y compris les vérificateurs et la mémoire. Pour les deux premiers, il présentera des contrefactuels exécutables, un cadre qui opérationnalise le raisonnement contrefactuel sous forme de code, permettant la génération évolutive d'environnements RL avec une difficulté contrôlable et des réponses vérifiables. L'entraînement RL dans ces environnements induit les comportements fondamentaux du raisonnement contrefactuel - abduction, intervention et prédiction et, contrairement à l'affinage supervisé, se généralise hors domaine vers de nouvelles structures de code et problèmes mathématiques exprimés en mots. Du côté de l'outil, Amit présentera interwhen, qui compile des politiques en langue naturelle en vérificateurs formels qui certifient chaque étape du raisonnement d'un agent en temps réel, augmentant la fiabilité pass^4 d'un modèle à poids ouverts de 30B sur τ²-bench Telecom de 32% à 87%. Ces axes forment une seule boucle d'auto-amélioration et posent une question de recherche centrale sur la manière de réaliser le RL conjointement avec les composants de l'outil et de faire évoluer à la fois le modèle et son outil. Lecture préalable : À propos des intervenants : Amit Sharma construit un laboratoire d'IA axé sur la cybersécurité et les systèmes d'IA auto-améliorants. Il a passé la dernière décennie chez Microsoft Research, où il a travaillé sur le raisonnement en IA et l'inférence causale. Son travail a conduit à des contributions fondamentales pour le raisonnement causal, avec des applications pour faire avancer la généralisation, l'explicabilité et les capacités de raisonnement des systèmes d'IA. Il a développé l'algorithme DiCE pour l'explication contrefactuelle et des méthodes de réfutation pour évaluer les estimations causales, qui sont largement adoptées dans le milieu académique et industriel. Amit est également le co-fondateur de PyWhy, un écosystème open-source impliquant l'Université Carnegie Mellon, Microsoft, Amazon et d'autres pour faire avancer des outils de ML causal évolutifs. Rejoignez en ligne : meet.google.com\u002Fonq-amgt-pgz Au plaisir de vous voir !
Lieu de l`événement
Faites savoir à votre réseau que vous y allez
Partagez cet événement pour engager des conversations, inviter des collègues et vous connecter avant qu`il commence.
