Lesson 9 of 22· El corazón del modelo: atención
Lee estas dos frases:
La palabra banco es idéntica en ambas, pero significa cosas completamente distintas: una entidad financiera en la primera y un asiento en la segunda. Tú lo resolviste sin esfuerzo porque miraste las palabras de alrededor: cheque y deposité apuntan al dinero; parque, senté y descansar apuntan al mueble.
Ese acto tan natural —fijarse más en unas palabras que en otras para entender una palabra concreta— es exactamente lo que hace el mecanismo estrella de los LLMs modernos: la atención. En esta lección vas a entenderlo con intuición, sin una sola fórmula, y verás paso a paso cómo un modelo "mira" el contexto para desambiguar.
Recuerda de módulos anteriores que un LLM procesa el texto convertido en tokens, y que cada token se representa como un vector de números (su embedding) que captura significado. El problema es que el significado de una palabra no es fijo: depende de sus vecinas. El embedding inicial de banco es el mismo en las dos frases; algo tiene que ajustarlo según el contexto.
Ahí entra la atención. La regla intuitiva es simple:
Al procesar cada palabra, el modelo mira a todas las demás palabras de la frase y les asigna un peso (cuánta atención les presta). Luego mezcla la información de las palabras más relevantes para refinar el significado de la palabra actual.
Dos ideas clave dentro de esa frase:
Puedes imaginar cada palabra como alguien en una mesa de reunión que, antes de hablar, escucha con más atención a los compañeros que le resultan relevantes e ignora el ruido de fondo. Esos "niveles de escucha" son los pesos de atención.
Tomemos la primera frase y sigamos qué ocurre cuando el modelo llega a la palabra ambigua banco:
"Deposité el cheque en el banco"
Al procesar banco, la atención reparte su "foco" entre las demás palabras. Las conexiones fuertes serán hacia cheque y deposité, porque son las que aportan pistas sobre de qué tipo de banco hablamos. Las conexiones hacia el y en serán débiles: no ayudan a decidir el significado.
El resultado es que el vector que representa a banco se "tiñe" de información financiera, y el modelo lo interpreta como institución, no como asiento. Si la frase fuera "Me senté en el banco del parque", los pesos fuertes irían hacia senté, parque y descansar, y el mismo token acabaría interpretado como mueble.
El siguiente step-through recorre la frase palabra por palabra y muestra, con flechas, hacia qué otras palabras "presta atención" con más peso el modelo. Avanza paso a paso y lee la narración de cada uno.
Antes de la atención, los modelos de lenguaje procesaban el texto palabra por palabra en orden, arrastrando una especie de "resumen" mental que se iba actualizando (esta era la idea de las redes recurrentes o RNN). Tenía dos problemas graves:
La atención rompe con ambas cosas: crea una conexión directa entre cualquier par de palabras, sin importar cuánta distancia haya entre ellas. La palabra 100 puede mirar a la palabra 1 con exactamente la misma facilidad que a la palabra 99.
El siguiente diagrama contrasta los dos enfoques: en el secuencial la información viaja de eslabón en eslabón (y se degrada); con atención, la última palabra mira directamente a todas las anteriores.
Esto es lo que permite a un LLM mantener la coherencia en párrafos largos: resolver a qué se refiere un pronombre varias líneas después, recordar un nombre mencionado al principio, o entender que banco significa una cosa u otra según una palabra que apareció mucho antes. Es también la base de la arquitectura Transformer, que verás en la próxima lección: en el fondo, un Transformer es "muchas capas de atención apiladas".
Matiz importante y honesto: hemos usado "palabras" para que la intuición sea clara, pero recuerda que el modelo trabaja en realidad con tokens y con vectores de números; la atención opera sobre esos vectores, no sobre las letras. Y los pesos del ejemplo son ilustrativos: un modelo real aprende millones de estos patrones por sí solo durante el entrenamiento.
Antes de pasar a la arquitectura Transformer, responde la siguiente pregunta para fijar la intuición de la atención.
Free