
Agentes Podem Realmente Se Auto- Melhorar?
Descrição
Uma noite prática construindo um agente que comprovadamente melhora: simule os casos extremos, pontue contra avaliações e gateie cada lançamento para que a próxima versão seja lançada apenas se superar a anterior. Você sairá com o ciclo, construído em ferramentas de código aberto, rodando em um laptop. Detalhes do evento "Agentes auto-melhoradores" estão fazendo muito trabalho em apresentações no momento. Parte disso é real, muito disso não é, e esta noite separa os dois ao construir a versão real diante de você. Juntos, construiremos a versão real ao vivo para mostrar a diferença. Antes que qualquer coisa chegue à produção, simulamos usuários sintéticos e cenários adversariais para identificar onde o agente falha, avaliamos essas execuções contra avaliações e reinserimos os fracassos. A avaliação se torna o filtro: nada é liberado a menos que os números se movam na direção certa. Em seguida, mantemos a execução, roteando o tráfego de produção de volta pelas mesmas avaliações para que as regressões apareçam como pontuações em queda em vez de chamados de suporte. A auto-melhoramento recursivo total ainda é um problema de pesquisa em aberto e não vamos fingir o contrário, mas a versão limitada é viável hoje, em OpenTelemetry e frameworks de código aberto que você pode bifurcar e auto-hospedar. Liderando o workshop, Nikhil, fundador e CEO da Future AGI, realiza a construção ao vivo, de ponta a ponta. Ele passa seus dias trabalhando exatamente no problema sobre o qual esta noite se trata: tornando os agentes confiáveis o suficiente para confiar em produção, e mensuráveis o suficiente para saber que eles estão realmente melhorando. Traga um laptop para: Instrumentar um agente básico com OpenTelemetry e capturar suas pontuações iniciais em avaliações Simular usuários sintéticos e cenários adversariais para quebrá-lo propositalmente Avaliar as execuções contra as avaliações para que as falhas se tornem números, não anedotas Ler os rastros para encontrar a causa raiz real, não adivinhar a partir da saída Reinserir as correções, então re-simular para confirmar que as pontuações se moveram Filtrar o lançamento: promover uma nova versão apenas se ela superar a anterior Rotejar o tráfego de produção de volta pelas mesmas avaliações para mantê-lo melhorando Agenda 5:30 - Lanches e Olá 6:00 - Palestrante convidado (a ser anunciado) 7:00 - Construção ao vivo: o ciclo de auto-melhoria que realmente é lançado (traga um laptop) 7:30 - Debate aberto e Q&A: hype versus o que funciona 8:00 - Networking 8:30 - Até a próxima iteração Para engenheiros e construtores de produtos de IA que executam agentes em produção que desejam a versão que comprovadamente melhora, construída em ferramentas abertas que eles podem manter. Sobre a Pebblebed Pebblebed é uma VC técnica de estágio inicial fundada por Pam Vagata (cofundadora do OpenAI, liderou a IA da Stripe, inventor do FBLearner Flow); Keith Adams (fundou o Facebook AI Research, foi arquiteto chefe do Slack, 20º engenheiro da VMWare) e Tammie Siew (ex-investidora da Sequoia no Sudeste Asiático, ex-fundadora apoiada pela Sequoia e Notable Capital) Sobre a Future AGI Future AGI é uma plataforma de simulação, avaliação e observabilidade de IA de código aberto. As equipes a usam para simular agentes antes de lançá-los, pontuá-los contra modos reais de falha e continuar monitorando-os em produção para que a qualidade não degrade silenciosamente ao longo do tempo. É auto-hospedável e nativa do OpenTelemetry, com rastreamento que se conecta a mais de 35 frameworks. O ciclo que você construirá esta noite funciona nas mesmas ferramentas abertas, suas para bifurcar e levar para casa, sem necessidade de conta.
Localização do evento
Diga à sua rede que vai participar
Partilhe este evento para iniciar conversas, convidar colegas e conectar-se antes que comece.







