
Engenharia Prática de Produto com Claude Code
Descrição
Nesta sessão, você construirá uma estrutura de avaliação que define o que é correto antes de escrever uma linha de código do agente, redesenhará um agente de contexto único em um orquestrador com subagentes especializados e modelos em camadas, e medirá a diferença de custo e qualidade entre os dois. Você sairá capaz de provar que seu agente razoa de forma sólida, ao invés de apenas adivinhar bem, e de apontar para os números que justificam a implantação. Um lugar no workshop é um investimento único. Um agente mal estruturado pode queimar 10 vezes o valor desse lugar em uso desnecessário de tokens em larga escala. Mike Hyzy é um Arquiteto Certificado por Claude que constrói sistemas agentes para empresas globais de alto nível, ensina estratégia de IA no programa MSAI da Northwestern, conduz workshops de inovação destacados no SXSW e escreve para a Packt. O que você aprenderá: Durante o workshop, você aprenderá a: • Definir o que significa correto antes de construir, usando conjuntos de dados de referência, verificações determinísticas, um juiz LLM calibrado e pontuação de trajetória. • Avaliar o comportamento do agente, bem como as respostas finais, para que você possa distinguir um raciocínio sólido de uma resposta que por acaso é correta. • Construir e diagnosticar um agente Claude de contexto único, usando saídas estruturadas e logs de trajetória para identificar onde a confiabilidade falha. • Projetar uma arquitetura de orquestrador e subagente, com papéis especializados, janelas de contexto isoladas, superfícies de ferramentas restritas e modelação em camadas. • Medir a troca entre qualidade e custo, e usar evidências da estrutura de avaliação para decidir quais mudanças arquitetônicas realmente melhoram o sistema. • Aplicar controles de produção, incluindo regras de permissão, trilhas de auditoria legíveis, telemetria, tetos de gastos e testes adversariais. • Tomar uma decisão de implantação baseada em evidências, usando precisão medida, qualidade de raciocínio, modos de falha, controles, custo e risco residual. Quem deve participar deste workshop: Este é um masterclass avançado e prático para profissionais que já construíram ou entregaram com Claude e agora enfrentam as questões mais difíceis de produção: Como você sabe que o agente está correto? O que ele pode fazer? Que evidências permitiriam que alguém o aprovasse? É mais adequado para: • gerentes de produto, engenheiros de produto responsáveis por produtos ou fluxos de trabalho de IA agentes que precisam ir além do protótipo. • engenheiros de software e IA construindo sistemas multi-agente, utilizando ferramentas ou de múltiplos passos com Claude. • engenheiros de plataformas de IA padronizando padrões reutilizáveis de agentes, métodos de avaliação e controles em toda a organização. • líderes de engenharia que revisam ou aprovam sistemas autônomos e precisam de critérios explícitos e defensáveis. • fundadores e equipes de produto cujo produto depende da confiabilidade do agente e que precisam de mais do que uma demonstração polida para justificar a implantação. Este workshop não é adequado para iniciantes. Não é uma introdução à criação de prompts ou agentes básicos. Os participantes devem já estar confortáveis usando LLMs além de uma interface de chat padrão e seguindo código Python. Construa o Agente. Então Prove-o. Construir um agente não é mais a parte difícil. O problema mais complicado é provar que uma saída fluente e confiante é realmente suportada por um processo confiável. Os testes convencionais de software não são suficientes para agentes analíticos: várias saídas podem ser válidas e uma resposta que parece correta ainda pode ser produzida por meio de raciocínio inventado. Isso deixa os construtores sem evidência, os aprovadores sem critérios, e os agentes promissores presos no protótipo. Este masterclass inverte a sequência usual de desenvolvimento. Você constrói o aparelho de medição primeiro. Cada decisão arquitetônica que se segue é então testada contra um padrão fixo e visível. O sistema prático: um agente de avaliação de risco de fornecedor de terceiros. O agente recebe um pacote de segurança e contrato de fornecedor - incluindo um relatório SOC 2, acordo de processamento de dados, acordo de serviços principais e questionário de segurança preenchido - e o avalia em relação ao padrão de controle de uma organização. Retorna um memorando de risco estruturado com descobertas, gravidade, controles violados, evidências e recomendações. O exercício é projetado para que algumas descobertas só possam ser descobertas combinando evidências entre documentos. Isso torna as respostas corretas distintivas de respostas acertadas por acaso e dá à estrutura de avaliação algo significativo para medir. O mesmo padrão de orquestração, avaliação e controle pode ser transferido para outras cargas de trabalho analíticas de múltiplos documentos, como revisão de contratos, inteligência competitiva, monitoramento regulatório e avaliação de reivindicações. O que você levará: Você sairá com ativos práticos que pode adaptar aos seus próprios projetos de IA agentes: • Um repositório funcional que você pode direcionar para seus próprios conjuntos de documentos após o workshop. • Um método reutilizável para definir a correção antes que o desenvolvimento comece. • Uma estrutura de avaliação pontuada combinando um conjunto de referência escrito à mão, verificações determinísticas, um juiz LLM e avaliação de caminho de raciocínio. • Uma arquitetura de orquestrador e subagente com contextos isolados e acesso restrito a ferramentas. • Uma camada de controle de produção prática cobrindo permissões, auditabilidade, limites de custo e manuseio de falhas. • Uma abordagem de teste adversarial repetível para verificar se documentos ou entradas podem manipular o agente fora de seus limites pretendidos. • Uma avaliação de implantação em uma página trazendo seus próprios números medidos para precisão, solidez do raciocínio, modos de falha, controles, custo e risco residual.
Ferramentas que serão usadas nos eventos
Claude
Diga à sua rede que vai participar
Partilhe este evento para iniciar conversas, convidar colegas e conectar-se antes que comece.











