El trabajo investiga la eficacia del reentrenamiento paramétricamente eficiente (PEFT) de grandes modelos de lenguaje, como LoRA, desde la perspectiva de la teoría de la información cuántica. Las parametrizaciones de bajo rango corresponden a representaciones de baja dimensión en forma de productos de matrices de estados (MPS), lo que permite introducir el concepto de «entrelazamiento artificial»: la entropía de entrelazamiento de los parámetros de la red neuronal. Se comparan LoRA y el reentrenamiento completo (FFT) en modelos LLaMA (1B y 8B) entrenados con los conjuntos de datos Tulu3 y OpenThoughts3. El entrelazamiento artificial interno en las actualizaciones de las matrices de consulta y valor para LoRA sigue una ley de volumen con una supresión en el centro — un «valle de entrelazamiento», sensible a los hiperparámetros, y difiere del FFT. El entrelazamiento externo en las matrices de atención, correspondiente a las correlaciones entre tokens en el espacio de representaciones, sigue una ley de área con correcciones logarítmicas y es robusto frente a hiperparámetros y pasos de entrenamiento. Se establece un paralelismo con el teorema de la ausencia de pelo de los agujeros negros: a pesar de las diferencias en el entrelazamiento interno, los datos de salida de la atención permanecen similares, lo que explica la eficacia de las actualizaciones de bajo rango.
Reentrenar una red neuronal es como intentar cambiar un agujero negro sin tocar su horizonte de eventos: solo se modifica una pequeña parte de los parámetros. Los investigadores miraron en su interior y vieron patrones sorprendentes — fuertes conexiones entre fragmentos del modelo, como en el entrelazamiento cuántico. Al medir la entropía (medida del caos), descubrieron un 'valle de entrelazamiento' — una caída abrupta del orden que depende del método de entrenamiento.
En la práctica, esto significa que no importa qué patrones haya en el interior, lo que importa es el comportamiento externo. Por eso se pueden desarrollar métodos ligeros de adaptación de IA sin profundizar en los detalles.
🎯 El teorema 'de la calvicie': un agujero negro se describe solo por su masa, carga y rotación. Toda la demás información sobre la materia absorbida se borra.