DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data

DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data

Las métricas perceptuales actuales se centran principalmente en similitudes de bajo nivel, como píxeles y texturas, y a menudo no logran captar relaciones estructurales, semánticas o basadas en la postura de nivel medio entre imágenes. Esta limitación dificulta la evaluación precisa de la similitud visual tal como la perciben los seres humanos, especialmente en lo que respecta a la disposición y el contenido de los objetos. Para abordar esta brecha, los autores presentan DreamSim, una nueva métrica diseñada para alinearse más estrechamente con la percepción humana al evaluar las imágenes de manera holística. El desarrollo de DreamSim aprovecha datos sintéticos generados mediante modelos de texto a imagen, lo que permite crear variaciones controladas de imágenes etiquetadas con juicios consistentes de similitud humana. A pesar de estar entrenada exclusivamente con datos sintéticos, la métrica demuestra una fuerte capacidad de generalización hacia imágenes del mundo real. Prioriza eficazmente los objetos en primer plano y el contenido semántico, mientras mantiene sensibilidad al color y la disposición, superando tanto a métricas aprendidas anteriores como a grandes modelos de visión en tareas como la recuperación por vecinos más cercanos y la inversión de características. Este trabajo es altamente relevante para las iniciativas de datos abiertos, ya que establece un nuevo estándar para evaluar la similitud visual que cierra la brecha entre el cálculo automatizado y la intuición humana. Al proporcionar una métrica robusta y de código abierto que funciona bien en diversos conjuntos de datos como ImageNet-R y COCO, DreamSim permite una evaluación más confiable de los sistemas de visión por computadora. Esto facilita una mejor transparencia y reproducibilidad en la investigación, asegurando que los modelos sean evaluados en dimensiones que realmente reflejan la comprensión semántica en lugar de la alineación superficial de píxeles.

Fuente: dreamsim-nights.github.io
Publicado el 2024-11-25