
Noche de ModelOps: Evaluaciones, Enrutamiento y Referencias
Descripción
Una inmersión técnica sobre la evaluación de productos, agentes y flujos de trabajo de IA en comparación con tareas del mundo real.A medida que los modelos mejoran, la pregunta difícil ya no es solo "¿cuál modelo es el mejor?" Se trata de si tu producto, agente o flujo de trabajo realmente funciona bien en las tareas que preocupan a tus usuarios.Los puntos de referencia públicos rara vez capturan tus casos extremos. Los sistemas de producción en realidad tienen entradas desordenadas, flujos de trabajo de varios pasos, llamadas a herramientas, restricciones de latencia, compensaciones de costos y modos de falla que solo se muestran en la práctica.Este evento reúne a equipos que construyen la infraestructura para evaluar sistemas de IA en el mundo real.Escucharemos de Composio sobre la construcción de evaluaciones para flujos de trabajo del mundo real, de GMI Cloud sobre el enrutamiento de modelos para optimizar rendimiento y costos, de Handshake sobre la creación de referencias de alta calidad que definen la frontera, y de Oqoqo sobre cómo evaluar y mejorar la experiencia del agente construyendo tu propia referencia.Si estás construyendo herramientas para agentes, agentes personalizados o flujos de trabajo internos, esta es una sala para conversaciones prácticas sobre cómo medir lo que realmente funciona.Programa5:30 Abrida de puertas · comida y bebidas6:00 Composio: construyendo evaluaciones para flujos de trabajo del mundo real (Jayesh Sharma, Ingeniero de IA en Composio)6:15 GMI Cloud: enrutamiento de modelos para optimizar rendimiento y gastos6:30 Handshake: Construyendo referencias para trabajos de agentes de valor económico (Jonas Mueller, Director de Investigación de IA, Handshake AI)6:45 Oqoqo: evaluando y mejorando la experiencia del agente construyendo tu propia referencia (Haritha Nair, CTO, Oqoqo)7:00 Networking¿Quién debería venir?Fundadores, ingenieros de producto, ingenieros de IA y equipos que construyen productos orientados a agentes, flujos de trabajo internos o sistemas que necesitan ser probados contra tareas de usuarios reales.
Destacados
Inmersión técnica sobre la evaluación de productos y flujos de trabajo de IAAbordando tareas del mundo real y casos extremos en sistemas de IAPresentaciones de Composio, GMI Cloud, Handshake y OqoqoTemas incluyen la construcción de evaluaciones, enrutamiento de modelos y creación de referenciasOportunidades de networking con ingenieros de IA y equipos de producto
Ubicación del evento
Dile a tu red que vas a ir
Comparte este evento para iniciar conversaciones, invitar colegas y conectar antes de que comience.
