
Les agents peuvent-ils vraiment s'améliorer d'eux-mêmes ?
Description
Une soirée pratique à construire un agent qui s'améliore de manière prouvée : simuler les cas extrêmes, évaluer contre des évaluations, et restreindre chaque version afin que la prochaine ne soit expédiée que si elle surpasse la précédente. Vous repartirez avec la boucle, construite sur des outils open-source, fonctionnant sur un ordinateur portable. Détails de l'événement "Les agents auto-améliorants" génèrent beaucoup de travail dans les présentations en ce moment. Une partie de cela est réelle, beaucoup ne l'est pas, et cette soirée sépare les deux en construisant la version réelle devant vous. Nous construirons ensemble la version réelle en direct pour montrer la différence. Avant que quoi que ce soit atteigne la production, nous simulons des utilisateurs synthétiques et des scénarios adverses pour mettre en lumière où l'agent échoue, notons ces sessions contre des évaluations, et réintégrons les échecs. L'évaluation devient la porte d'entrée : rien ne sort à moins que les chiffres ne changent dans le bon sens. Ensuite, nous le maintenons en marche, en dirigeant le trafic de production à travers les mêmes évaluations pour que les régressions apparaissent sous forme de scores déclinants plutôt que de tickets de support. L'auto-amélioration récursive complète est encore un problème de recherche ouvert et nous ne prétendrons pas le contraire, mais la version bornée est réalisable aujourd'hui, sur OpenTelemetry et des frameworks open-source que vous pouvez forker et auto-héberger. Animant l'atelier, Nikhil, fondateur et PDG de Future AGI, gère la construction en direct, de bout en bout. Il consacre ses journées au problème exact dont il est question ce soir : rendre les agents suffisamment fiables pour leur faire confiance en production, et mesurables pour savoir qu'ils s'améliorent réellement. Apportez un ordinateur portable pour : Instrumenter un agent de base avec OpenTelemetry et capturer ses scores d'évaluation initiaux Simuler des utilisateurs synthétiques et des scénarios adverses pour le casser exprès Noter les sessions contre des évaluations afin que les échecs deviennent des chiffres, pas des anecdotes Lire les traces pour trouver la véritable cause racine, pas deviner à partir de la sortie Réintégrer les corrections, puis re-simuler pour confirmer que les scores ont bougé Restreindre l'expédition : promouvoir une nouvelle version seulement si elle surpasse la précédente Diriger le trafic de production à travers les mêmes évaluations pour continuer à l'améliorer Agenda 17h30 - Snacks & salutations 18h00 - Conférencier invité (à annoncer) 19h00 - Construction en direct : la boucle d'auto-amélioration qui se livre réellement (apportez un ordinateur portable) 19h30 - Débat ouvert & Q&R : battage médiatique contre ce qui fonctionne 20h00 - Réseautage 20h30 - À la prochaine itération Pour les ingénieurs et les constructeurs de produits IA exécutant des agents en production qui veulent la version qui s'améliore de manière prouvée, construite sur des outils ouverts qu'ils peuvent conserver.
Lieu de l`événement
Faites savoir à votre réseau que vous y allez
Partagez cet événement pour engager des conversations, inviter des collègues et vous connecter avant qu`il commence.





