Avanzado

Por qué las redes neuronales se parecen a los agujeros negros: lección de los modelos 'calvos' ⚡ экспресс

Original: "Artificial Entanglement in the Fine-Tuning of Large Language Models"
Al medir el 'entrelazamiento' dentro de las redes neuronales, los científicos comprendieron: se comportan como agujeros negros — exteriormente iguales ante cualquier cambio interno.
Abstract

El trabajo investiga la eficacia del reentrenamiento paramétricamente eficiente (PEFT) de grandes modelos de lenguaje, como LoRA, desde la perspectiva de la teoría de la información cuántica. Las parametrizaciones de bajo rango corresponden a representaciones de baja dimensión en forma de productos de matrices de estados (MPS), lo que permite introducir el concepto de «entrelazamiento artificial»: la entropía de entrelazamiento de los parámetros de la red neuronal. Se comparan LoRA y el reentrenamiento completo (FFT) en modelos LLaMA (1B y 8B) entrenados con los conjuntos de datos Tulu3 y OpenThoughts3. El entrelazamiento artificial interno en las actualizaciones de las matrices de consulta y valor para LoRA sigue una ley de volumen con una supresión en el centro — un «valle de entrelazamiento», sensible a los hiperparámetros, y difiere del FFT. El entrelazamiento externo en las matrices de atención, correspondiente a las correlaciones entre tokens en el espacio de representaciones, sigue una ley de área con correcciones logarítmicas y es robusto frente a hiperparámetros y pasos de entrenamiento. Se establece un paralelismo con el teorema de la ausencia de pelo de los agujeros negros: a pesar de las diferencias en el entrelazamiento interno, los datos de salida de la atención permanecen similares, lo que explica la eficacia de las actualizaciones de bajo rango.

Links in the knowledge graph 1

📄 Mostrando la version "Simple" — "Avanzado" aun no esta lista. Anadelo a favoritos para ayudar a priorizarla.

Reentrenar una red neuronal es como intentar cambiar un agujero negro sin tocar su horizonte de eventos: solo se modifica una pequeña parte de los parámetros. Los investigadores miraron en su interior y vieron patrones sorprendentes — fuertes conexiones entre fragmentos del modelo, como en el entrelazamiento cuántico. Al medir la entropía (medida del caos), descubrieron un 'valle de entrelazamiento' — una caída abrupta del orden que depende del método de entrenamiento.

Al igual que un agujero negro, que según la expresión de John Archibald Wheeler 'no tiene pelo', el modelo de lenguaje produce un resultado que no depende de los patrones internos. Esta 'calvicie' fue relacionada con la entropía por Jacob Bekenstein.

En la práctica, esto significa que no importa qué patrones haya en el interior, lo que importa es el comportamiento externo. Por eso se pueden desarrollar métodos ligeros de adaptación de IA sin profundizar en los detalles.

🎯 El teorema 'de la calvicie': un agujero negro se describe solo por su masa, carga y rotación. Toda la demás información sobre la materia absorbida se borra.

Scientists
Ludwig BoltzmannStephen HawkingJacob BekensteinAlbert EinsteinFritz ZwickyVera Rubin
Tags
entropía agujero negro
Laws
distribución de Boltzmannsegunda ley de la termodinámicaradiación de Hawkinglente gravitacionalEntropía de Bekenstein-HawkingEcuaciones de Einstein
Original: arXiv:2601.06788 · CC BY · bridge42worlds