
Ingeniería de Producto Práctica con Claude Code
Descripción
En esta sesión, construirás un arnés de evaluación que define lo correcto antes de escribir una línea de código del agente, rediseñarás un agente de un solo contexto en un orquestador con subagentes especializados y modelos en diferentes niveles, y medirás la diferencia de costo y calidad entre ambos. Saldrás capacitado para demostrar que tu agente razona de manera sólida en lugar de adivinar bien, y para señalar los números que justifican el despliegue. Una plaza en el taller es una inversión única. Un agente mal estructurado puede quemar 10 veces el valor de esa plaza en uso innecesario de tokens a gran escala. Mike Hyzy es un Arquitecto Certificado de Claude que construye sistemas agentes para las principales empresas globales, enseña estrategia de IA en el programa MSAI de Northwestern, dirige talleres de innovación destacados en SXSW, y escribe para Packt. Lo que aprenderás: Durante el taller, aprenderás a: • Definir lo que significa correcto antes de construir, utilizando conjuntos de datos dorados, verificaciones determinísticas, un juez LLM calibrado y puntuación de trayectorias. • Evaluar el comportamiento del agente así como las respuestas finales, para que puedas distinguir el razonamiento sólido de una respuesta que por casualidad puede ser correcta. • Construir y diagnosticar un agente Claude de un solo contexto, utilizando salidas estructuradas y registros de trayectorias para identificar dónde se descompone la fiabilidad. • Diseñar una arquitectura de orquestador y subagente, con roles especializados, ventanas de contexto aisladas, superficies de herramientas restringidas y niveles de modelo. • Medir la compensación entre calidad y costo, y usar evidencia del arnés de evaluación para decidir qué cambios arquitectónicos mejoran genuinamente el sistema. • Aplicar controles de producción, incluyendo reglas de permisos, registros de auditoría legibles, telemetría, techos de gasto y pruebas adversariales. • Tomar una decisión de despliegue basada en evidencia, utilizando precisión medida, calidad del razonamiento, modos de fallo, controles, costo y riesgo residual. Quién debería asistir a este taller: Este es un taller avanzado y práctico para profesionales que ya han construido o lanzado productos con Claude y ahora enfrentan preguntas de producción más difíciles: ¿Cómo sabes que el agente es correcto? ¿Qué se le permite hacer? ¿Qué evidencia permitiría a alguien aprobarlo? Es más adecuado para: • gerentes de producto, ingenieros de producto responsables de productos o flujos de trabajo de IA agentes que necesitan ir más allá del prototipo. • Ingenieros de software e IA que construyen sistemas multistep, que utilizan herramientas o sistemas de múltiples agentes con Claude. • Ingenieros de plataformas de IA que estandarizan patrones de agentes reutilizables, métodos de evaluación y controles a lo largo de una organización. • Líderes de ingeniería que revisan o aprueban sistemas autónomos y necesitan criterios explícitos y defendibles. • Fundadores y equipos de producto cuyo producto depende de la fiabilidad del agente y que necesitan más que una demostración pulida para justificar el despliegue. Este taller no es adecuado para principiantes. No es una introducción a la indicación o construcción básica de agentes. Los participantes deben sentirse cómodos utilizando LLM más allá de una interfaz de chat estándar y siguiendo código en Python. Construye el Agente. Luego Prueba Su Eficiencia. Construir un agente ya no es la parte difícil. El problema más difícil es demostrar que una salida fluida y segura está realmente respaldada por un proceso fiable. Las pruebas de software convencionales no son suficientes para agentes analíticos: varias salidas pueden ser válidas, y una respuesta que parece correcta aún puede ser producida a través de un razonamiento inventado. Eso deja a los constructores sin evidencia, a los aprobadores sin criterios, y a los agentes prometedores atascados en un prototipo. Esta maestría invierte la usual secuencia de desarrollo. Primero construyes el aparato de medición. Cada decisión arquitectónica que sigue es luego probada contra un estándar fijo y visible. El sistema práctico: un agente de evaluación de riesgo de proveedores de terceros. El agente absorbe un paquete de seguridad y contratos de proveedores - incluyendo un informe SOC 2, acuerdo de procesamiento de datos, acuerdo de servicios maestros y cuestionario de seguridad completado - y lo evalúa contra un estándar de control de la organización. Devuelve un memorando de riesgo estructurado con hallazgos, gravedad, controles violados, evidencia y recomendaciones. El ejercicio está diseñado para que algunos hallazgos solo puedan ser descubiertos al combinar evidencia a través de documentos. Eso hace que las respuestas correctas sean distinguibles de las respuestas afortunadas y le da al arnés de evaluación algo significativo que medir. El mismo patrón de orquestación, evaluación y control se transfiere a otras cargas de trabajo analíticas mult-documento, como revisión de contratos, inteligencia competitiva, monitoreo regulatorio y evaluación de reclamaciones. Lo que te llevarás: Te llevarás activos prácticos que puedes adaptar a tus propios proyectos de IA agentes: • Un repositorio funcional que puedes apuntar a tus propios conjuntos de documentos después del taller. • Un método reutilizable para definir la corrección antes de que comience el desarrollo. • Un arnés de evaluación puntuado que combina un conjunto dorado escrito a mano, verificaciones determinísticas, un juez LLM y evaluación de caminos de razonamiento. • Una arquitectura de orquestador y subagente con contextos aislados y acceso restringido a herramientas. • Una capa de control de producción práctica que cubre permisos, auditabilidad, límites de costo y manejo de fallos. • Un enfoque de prueba adversarial repetible para verificar si los documentos o inputs pueden manipular al agente fuera de sus límites destinados. • Una evaluación de despliegue de una sola página que lleva tus propias cifras medidas de precisión, solidez en el razonamiento, modos de fallo, controles, costo y riesgo residual.
Herramientas que se utilizarán en el evento
Claude
Dile a tu red que vas a ir
Comparte este evento para iniciar conversaciones, invitar colegas y conectar antes de que comience.










