Se presenta la arquitectura IAFormer, basada en el modelo Transformer, que integra eficazmente las interacciones por pares de partículas mediante un mecanismo dinámico de atención dispersa. A diferencia de los modelos anteriores, la matriz de atención se construye a partir de cantidades por pares predefinidas invariantes de Lorentz, lo que reduce sustancialmente el número de parámetros. La segunda innovación es la «atención diferencial», que permite priorizar dinámicamente los tokens de partículas relevantes y reducir el costo computacional en los de baja información. Gracias a esto, la complejidad del modelo se reduce en un orden de magnitud en comparación con el Particle Transformer sin pérdida de precisión: IAFormer logra resultados de vanguardia en tareas de clasificación en conjuntos de datos de quarks top y chorros quark-gluón. El análisis de interpretabilidad confirma que el modelo extrae información físicamente significativa capa por capa a través del mecanismo de atención dispersa, produciendo una salida robusta frente a fluctuaciones estadísticas. Los resultados subrayan la necesidad de emplear la atención dispersa en el análisis basado en Transformer para reducir el tamaño de la red y, al mismo tiempo, mejorar el rendimiento.
El chef en una cocina concurrida no vigila cada olla: echa un vistazo solo a lo que hierve, chisporrotea o está a punto de quemarse. Así, IAFormer, la red neuronal para analizar colisiones de partículas, no pierde tiempo en todos los pares posibles de partículas. Su «atención perezosa» selecciona dinámicamente solo aquellas combinaciones que son realmente importantes, de manera similar a como Стандартная модель describe solo las interacciones clave, ignorando el ruido.
Pero el truco principal de IAFormer es que utiliza números especiales que no dependen de la velocidad de las partículas: como una receta que funciona igual, ya sea que la cocina esté inmóvil o viaje en un tren. Estos invariantes, relacionados con скоростью света, reducen drásticamente los parámetros de la red, haciendo que el modelo sea transparente. Los físicos observan cómo, capa por capa, filtra las fluctuaciones aleatorias y acumula comprensión de la física.
Sorprendentemente, el modelo es tan ligero que funciona en una computadora portátil, procesando datos más rápido de lo que ocurren las colisiones.
🎯 El quark top es la partícula elemental más pesada conocida, su masa es aproximadamente la de un átomo entero de tungsteno, pero se desintegra en 10^−25 segundos, sin llegar a interactuar con nada.