
Construyendo sistemas de IA auto-mejorables
Descripción
A medida que los grandes modelos de lenguaje se aplican a dominios complejos, la frontera está cambiando de modelos entrenados una vez a sistemas auto-mejorables. Amit descompondrá la auto-mejora en tres ejes: generación de entornos, entrenamiento de RL y evolución del arnés, incluidos verificadores y memoria. Para los dos primeros, presentará contrahechos ejecutables, un marco que operacionaliza el razonamiento contrafáctico como código, permitiendo la generación escalable de entornos de RL con dificultad controlable y respuestas verificables. El entrenamiento de RL en estos entornos induce los comportamientos clave del razonamiento contrafáctico - abducción, intervención y predicción y, a diferencia del ajuste fino supervisado, generaliza fuera del dominio a nuevas estructuras de código y problemas de palabras matemáticas. En el lado del arnés, Amit presentará interwhen, que compila políticas de lenguaje natural en verificadores formales que certifican cada paso del razonamiento de un agente en tiempo de ejecución, elevando la fiabilidad pass^4 de un modelo de 30B pesos abiertos en τ²-bench Telecom del 32% al 87%. Estos ejes se componen en un único bucle de auto-mejora y presentan una pregunta central de investigación sobre cómo realizar RL conjuntamente con los componentes del arnés y auto-evolucionar tanto el modelo como su arnés. Lectura previa: Sobre los ponentes: Amit Sharma está construyendo un laboratorio de IA centrado en la ciberseguridad y sistemas de IA auto-mejorables. Pasó la última década en Microsoft Research, donde trabajó en el razonamiento de IA e inferencia causal. Su trabajo ha llevado a contribuciones fundamentales para el razonamiento causal, con aplicaciones para avanzar en la generalización, explicabilidad y capacidades de razonamiento de los sistemas de IA. Desarrolló el algoritmo DiCE para explicación contrafáctica y métodos de refutación para evaluar estimaciones causales, que son ampliamente adoptados en la academia y la industria. Amit también es cofundador de PyWhy, un ecosistema de código abierto que involucra a la Universidad Carnegie Mellon, Microsoft, Amazon y otros para avanzar en herramientas escalables de ML causal. Únete en línea: meet.google.com//onq-amgt-pgz ¡Esperamos verte!
Ubicación del evento
Dile a tu red que vas a ir
Comparte este evento para iniciar conversaciones, invitar colegas y conectar antes de que comience.
