Anthropic cracks open the black box to see how AI comes up with the stuff it says
Anthropic cracks open the black box to see how AI comes up with the stuff it says
La investigación reciente de Anthropic aborda la opacidad fundamental de los modelos de lenguaje grandes, planteando la pregunta crítica de si estos sistemas simplemente memorizan los datos de entrenamiento o construyen un modelo genuino del mundo para generar respuestas. Al utilizar funciones de influencia y análisis de trayectorias, el estudio revela que los modelos no dependen de la memorización mecánica. En cambio, diferentes capas neuronales procesan los datos de manera distinta: las capas inferiores se centran en la redacción específica, mientras que las capas intermedias gestionan información semántica más amplia, lo que indica una síntesis compleja y creativa del conocimiento en lugar de una simple recuperación. Esta investigación es crucial para la transparencia de datos y la seguridad de la IA, ya que cuestiona la suposición de que las salidas de los modelos son copias directas de sus conjuntos de entrenamiento. La incapacidad de rastrear salidas específicas hasta sus fuentes destaca la naturaleza de "caja negra" de la IA, planteando preocupaciones sobre la alineación engañosa y el comportamiento impredecible. Comprender si los modelos están razonando o simplemente combinando fragmentos de texto es esencial para evaluar los riesgos, ya que el verdadero razonamiento implica capacidades más difíciles de controlar y predecir que la simple coincidencia de patrones. Los hallazgos sugieren que, aunque las técnicas actuales están limitadas a modelos preentrenados, ofrecen un camino prometedor hacia la interpretabilidad mecanicista. Al ir más allá del análisis superficial, los investigadores pueden comenzar a desentrañar los circuitos internos de los sistemas de IA. Este progreso es fundamental para la comunidad de datos abiertos, ya que allana el camino hacia tecnologías de IA más transparentes, auditables y confiables, asegurando que los desarrollos futuros estén alineados con los valores humanos en lugar de depender de correlaciones estadísticas opacas.
Fuente: cointelegraph.comPublicado el 2023-08-11