topcat:~/blog/quitar-es-mas-dificil-que-anadir$ cat entrada.md
2026-08-08
Quitar es más difícil que añadir
El Transformer no ganó por añadir un mecanismo nuevo, sino por atreverse a borrar la recurrencia entera.
Sobre Vaswani et al., «Attention Is All You Need», 2017 · leer el original
Qué propone
Hasta 2017 la traducción automática se construía sobre redes recurrentes: el modelo leía la frase palabra a palabra y arrastraba un estado interno. El paper elimina esa recurrencia por completo y deja únicamente atención.
La consecuencia práctica no es de calidad, es de forma. Una red recurrente obliga a procesar la posición n después de la n-1. Sin recurrencia, todas las posiciones se calculan a la vez, y una GPU es exactamente una máquina para hacer muchas cosas a la vez.
Lo que me llevo
- El resultado se consigue quitando una pieza, no añadiéndola.
- El diseño se adapta al hardware que existe, en vez de pelearse con él.
- El coste crece al cuadrado con la longitud de la secuencia: la simplificación se paga en otro sitio, y el paper no lo esconde.
Dónde está el límite
Ese coste cuadrático es la letra pequeña. Con secuencias cortas no importa; con documentos largos se convierte en el problema principal, y buena parte de la literatura posterior existe para esquivarlo.
We propose a new simple network architecture, the Transformer, based solely on attention mechanisms, dispensing with recurrence and convolutions entirely.
Para leerlo
Vale la pena leer primero la sección 3.2 y volver luego a la introducción. El mecanismo se entiende mejor antes de que te cuenten por qué es importante.