Helping computer vision and language models understand what they see

Helping computer vision and language models understand what they see

Los modelos de visión y lenguaje suelen destacar en la identificación de objetos, pero a menudo fracasan al comprender las relaciones espaciales y los atributos de los objetos, como entender que una taza está sobre una mesa. Esta limitación surge porque los métodos de entrenamiento estándar priorizan el aprendizaje por contraste, lo que hace que los modelos se centren principalmente en los sustantivos y pasen por alto el contexto semántico de cómo se disponen los elementos en una escena. En consecuencia, estos sistemas tienen dificultades para comprender conceptos complejos, a pesar de su competencia en el reconocimiento básico de objetos. Para abordar este problema, los investigadores desarrollaron una técnica que utiliza datos sintéticos generados por computadora para ajustar modelos existentes. Al crear un conjunto de datos diverso de imágenes fotorrealistas con anotaciones detalladas que describen las posiciones e interacciones de los objetos, el equipo logró enseñar a los modelos a reconocer conceptos semánticos más allá de la simple identificación. Este enfoque aprovecha la rentabilidad, la privacidad y la escalabilidad de los datos sintéticos para exponer a los modelos a una mayor variedad de escenarios de los que suelen proporcionar los conjuntos de datos naturales, mejorando significativamente su capacidad para interpretar arreglos visuales complejos. Este avance es altamente relevante para la comunidad de datos abiertos, ya que demuestra cómo los datos sintéticos pueden complementar eficazmente los datos del mundo real para superar limitaciones específicas de los modelos, sin necesidad de añadir más imágenes reales etiquetadas. La técnica mejora la precisión hasta en un diez por ciento, evitando que el modelo olvide el conocimiento previo, y ofrece una vía práctica para mejorar los sistemas de inteligencia artificial de código abierto. Tales mejoras benefician aplicaciones que van desde la generación automática de subtítulos en videos hasta el sector salud y el comercio electrónico, promoviendo herramientas de inteligencia artificial abierta más robustas y conscientes del significado semántico.

Fuente: news.mit.edu
Publicado el 2023-09-14