Enviar evento
24 de septiembre - Encuentro sobre IA, ML y Visión por Computadora

24 de septiembre - Encuentro sobre IA, ML y Visión por Computadora

24 sep. 20264:00 PM UTCSan Francisco, United StatesOpen
LearnNetwork
CodeImageVideo

Descripción

Únete a nuestro encuentro virtual el 24 de septiembre para escuchar charlas de expertos sobre temas de vanguardia en IA, ML y visión por computadora. Fecha, Hora y Ubicación 24 de septiembre de 2026 9:00 AM - 11:00 AM PST En línea. ¡Regístrate para el Zoom! ¿Cómo Impulsan nuestros Principios de IA de Mercedes-Benz nuestra Innovación? En Mercedes-Benz, nuestros Principios de IA guían cada paso de la innovación, enfatizando el uso responsable, la seguridad y fiabilidad, la explicabilidad y la protección de la privacidad. Estos principios van más allá de declaraciones y moldean activamente cómo diseñamos, probamos y desplegamos sistemas de IA en entornos automotrices y empresariales del mundo real. En esta charla, presentaré cómo estos principios inspiraron nuestra investigación reciente sobre cuándo es efectivo reutilizar LoRA (Adaptación de Bajo Rango). Al combinar análisis teórico con datos sintéticos como un proxy para escenarios empresariales, descubrimos las fortalezas y limitaciones de los componentes de IA modulares bajo acceso de datos restringido. Nuestros hallazgos proporcionan orientaciones prácticas sobre cuándo los LoRA reutilizados podrían ofrecer resultados de alta calidad. Sobre la Ponente Mei-Yen Chen es Científica de Datos Senior en Mercedes-Benz Tech Innovation GmbH en Alemania con 10 años de experiencia en la industria en soluciones de IA y datos. Ella lidera proyectos de IA en etapas tempranas a través de funciones empresariales y colabora con instituciones de investigación en aprendizaje automático e IA responsable. Tokens de Región como el Primitivo Visual: De Reconocimiento a Modelado del Mundo La tokenización basada en parches se ha convertido en la interfaz predeterminada entre los codificadores de visión y los modelos descendentes, sin embargo, los parches no llevan ninguna estructura semántica y escalan mal con la resolución y la extensión temporal. Esta charla presenta un programa de investigación centrado en reemplazar tokens de parches por representaciones a nivel de región: tokens semánticamente densos anclados en entidades visuales en lugar de recortes de cuadrícula arbitrarios. Describiré RELOCATE, REN y T-REN, una progresión de métodos que producen tokens de región a través de agrupamiento, los entrenan con objetivos a nivel de región y los extienden a video con coherencia temporal. Luego presentaré trabajos en curso integrando tokens de región en VLMs para expandir directamente la capacidad de contexto visual, y resultados preliminares sobre la predicción de trayectoria de región futura como base para el modelado del mundo. La tesis más amplia es que los tokens a nivel de región son una unidad de computación visual más natural que los parches, y su ventaja se acumula a medida que la complejidad de la tarea, la resolución y el horizonte temporal aumentan. Sobre el Ponente Savya Khosla es estudiante de segundo año de doctorado en la Universidad de Illinois Urbana-Champaign, asesorado por el Prof. Derek Hoiem y el Prof. Alex Schwing. Explotando Modelos de Difusión de Texto a Imagen para Generación Consistente de Conjuntos Las colecciones de imágenes son la principal forma de los humanos para capturar el mundo, sin embargo, los avances en edición generativa siguen siendo en gran medida inaplicables a esta modalidad. Abordamos esta brecha introduciendo Match-and-Fuse - un método sin entrenamiento, libre de capacitación para la generación consistente de conjuntos a partir de colecciones de imágenes que comparten un elemento visual común pero difieren en punto de vista, tiempo de captura y contenido circundante. Nuestra idea clave es un marco unificado basado en grafos que combina correspondencias densas con un prior emergente en modelos de difusión de texto a imagen para generar lienzos coherentes. Logramos una consistencia y calidad visual de vanguardia, y desbloqueamos nuevas capacidades creativas para la generación de contenido. Sobre la Ponente Kate Feingold es estudiante de doctorado en Visión por Computadora en el Instituto Weizmann de Ciencias. Su investigación se sitúa en la intersección de modelos generativos, percepción 3D/4D y aprendizaje multimodal, enfocándose en problemas donde la visión se encuentra con otras modalidades o paradigmas en tareas creativas. Estimación de Rendimiento de un Café en un Entorno Denso Esta presentación proporciona un flujo de trabajo detallado relacionado con la estimación del rendimiento de café en un entorno denso. Con fotos de plantas de café pre-cosecha de un par de fincas de café, detalles relacionados con pre-procesamiento, anotación para detectar regiones de interés (ROI), entrenamiento de detección de objetos y resultados de inferencia con varios modelos Yolo y finalmente segmentación con SAM2 y Yolo*-seg con resultados de entrenamiento e inferencia para determinar el conteo de bayas de café crudas, prematuras, maduras y sobremaduras y finalmente el rendimiento de toda la finca. Todo esto se basa en datos del mundo real capturados en iPhone y teléfonos Android. Sobre el Ponente Raghu M. Rao es consultor trabajando en aplicaciones de modelos de IA de visión por computadora. Anteriormente trabajó en AMD y Xilinx. Tiene un Ph.D. en Comunicaciones Inalámbricas de UCLA y es Miembro Senior de IEEE. Sus intereses actuales están en aplicaciones de IA para la agricultura, la atención médica y las comunicaciones inalámbricas.

Ubicación del evento

Dile a tu red que vas a ir

Comparte este evento para iniciar conversaciones, invitar colegas y conectar antes de que comience.

Related events

Plataforma de inteligencia artificial

Precios en el sitio web
Obtener entradas