Google On How Googlebot Handles AI Generated Content

Google On How Googlebot Handles AI Generated Content

Martin Splitt, de Google, aclara que el aumento del contenido generado por inteligencia artificial no exige cambios en la forma en que Googlebot renderiza las páginas web. En lugar de simplificar los procesos de renderizado para gestionar un mayor volumen, Google sigue confiando en sus mecanismos existentes de control de calidad. La idea central es que los recursos de renderizado se reservan para las páginas que parecen potencialmente valiosas, mientras que el contenido claramente de baja calidad se identifica y excluye antes incluso de iniciar el paso de renderizado. Esta estrategia destaca un sistema de detección de calidad en múltiples etapas que filtra eficazmente el contenido deficiente, independientemente de si fue escrito por humanos o generado por máquinas. La investigación respalda que los algoritmos entrenados para distinguir entre texto humano y texto generado por IA también son buenos predictores de la calidad general de la página y del spam. En consecuencia, Google puede identificar con frecuencia el contenido de “mala calidad” mediante el análisis del HTML, haciendo innecesario el costoso proceso de descarga y ejecución de JavaScript para una parte significativa de estas páginas. Esta información es crucial para las comunidades de open_data y SEO, ya que subraya que la principal defensa de Google contra el spam generado por IA es la evaluación de la calidad, en lugar de tecnologías específicas de detección. Esto sugiere que el enfoque debe seguir centrado en comprender cómo funcionan las señales de calidad a lo largo de todo el pipeline de rastreo. Al demostrar que los sistemas existentes escalan de manera efectiva, Google indica que el volumen de contenido generado por IA es manejable mediante la eficiencia, reforzando la importancia de prácticas de datos transparentes y de alta calidad en la indexación de búsqueda.

Fuente: searchenginejournal.com
Publicado el 2023-08-29