github.com/blasdecrespo

topcat:~/blog/quitar-es-mas-dificil-que-anadir$ cat entrada.md

Quitar es más difícil que añadir

El Transformer no ganó por añadir un mecanismo nuevo, sino por atreverse a borrar la recurrencia entera.

  • arquitectura
  • atención
  • ejemplo

Sobre Vaswani et al., «Attention Is All You Need», 2017 · leer el original

Qué propone

Hasta 2017 la traducción automática se construía sobre redes recurrentes: el modelo leía la frase palabra a palabra y arrastraba un estado interno. El paper elimina esa recurrencia por completo y deja únicamente atención.

La consecuencia práctica no es de calidad, es de forma. Una red recurrente obliga a procesar la posición n después de la n-1. Sin recurrencia, todas las posiciones se calculan a la vez, y una GPU es exactamente una máquina para hacer muchas cosas a la vez.

Lo que me llevo

  • El resultado se consigue quitando una pieza, no añadiéndola.
  • El diseño se adapta al hardware que existe, en vez de pelearse con él.
  • El coste crece al cuadrado con la longitud de la secuencia: la simplificación se paga en otro sitio, y el paper no lo esconde.

Dónde está el límite

Ese coste cuadrático es la letra pequeña. Con secuencias cortas no importa; con documentos largos se convierte en el problema principal, y buena parte de la literatura posterior existe para esquivarlo.

We propose a new simple network architecture, the Transformer, based solely on attention mechanisms, dispensing with recurrence and convolutions entirely.
— del resumen del paper

Para leerlo

Vale la pena leer primero la sección 3.2 y volver luego a la introducción. El mecanismo se entiende mejor antes de que te cuenten por qué es importante.

topcat:~/blog/quitar-es-mas-dificil-que-anadir$ cd ..