GitHub - adamkarvonen/chess_llm_interpretability: Evaluating an LLM trained on chess PGN strings using techniques from the Othello World Models paper.

Esta investigación demuestra que los modelos de lenguaje grandes (LLM) entrenados con partidas de ajedrez codifican representaciones internas ricas de los estados del tablero y de los niveles de habilidad de los jugadores. Mediante el empleo de sondas lineales, el estudio revela que estos modelos mantienen un "modelo del mundo" implícito de las posiciones de las piezas y estimaciones de la calificación (rating), lo que permite a los investigadores visualizar e interpretar los procesos de razonamiento del modelo durante la predicción del siguiente token. Esta capacidad va más allá de la simple coincidencia de patrones, lo que indica una comprensión funcional de las reglas estructurales del juego y de sus dinámicas competitivas. Además, la posibilidad de realizar intervenciones sobre estas representaciones internas ofrece perspectivas poderosas para la interpretabilidad mecanicista. Al alterar el estado interno del modelo, como "eliminar" piezas de su representación mental, los investigadores pueden observar los cambios correspondientes en la salida, confirmando que el modelo razona activamente sobre el estado del juego en lugar de depender únicamente de correlaciones estadísticas superficiales. Este enfoque proporciona un método concreto para probar relaciones causales dentro de las capas de procesamiento de la red neuronal. Este trabajo es altamente relevante para el movimiento open_data, ya que muestra cómo los modelos preentrenados de acceso abierto y los conjuntos de datos públicamente disponibles pueden aprovecharse para avanzar en la transparencia de la inteligencia artificial. La publicación integral del código, los datos y los modelos preentrenados garantiza que estas técnicas de interpretabilidad sean reproducibles e inclusivas. Al democratizar el acceso a herramientas para analizar el interior de los modelos, este proyecto fomenta esfuerzos impulsados por la comunidad para hacer que los sistemas de IA sean más comprensibles, confiables y alineados con las expectativas humanas en dominios estratégicos complejos.

Source: github.com
Published on 2024-01-08