Работа исследует эффективность параметрически эффективного дообучения (PEFT) больших языковых моделей, таких как LoRA, с позиций квантовой теории информации. Низкоранговые параметризации соответствуют малоразмерным представлениям в виде матричных произведений состояний (MPS), что позволяет ввести понятие «искусственной запутанности» — энтропии запутанности параметров нейросети. Сравниваются LoRA и полное дообучение (FFT) на моделях LLaMA (1B и 8B), обученных на наборах данных Tulu3 и OpenThoughts3. Внутренняя искусственная запутанность в обновлениях матриц запросов и значений для LoRA подчиняется объёмному закону с подавлением в центре — «долиной запутанности», чувствительной к гиперпараметрам, и отличается от FFT. Внешняя запутанность в матрицах внимания, соответствующая корреляциям токенов в пространстве представлений, следует закону площади с логарифмическими поправками и устойчива к гиперпараметрам и шагам обучения. Проводится параллель с теоремой об отсутствии волос у чёрных дыр: несмотря на различия во внутренней запутанности, выходные данные внимания остаются схожими, что объясняет эффективность низкоранговых обновлений.
Дообучение нейросети похоже на попытку изменить чёрную дыру, не коснувшись её горизонта событий: меняют лишь малую часть параметров. Исследователи заглянули внутрь и увидели удивительные узоры — сильные связи между кусочками модели, как в квантовой запутанности. Измеряя энтропию (меру хаоса), они обнаружили «долину запутанности» — резкий провал упорядоченности, который зависит от метода обучения.
На практике это значит: неважно, какие узоры внутри, важно внешнее поведение. Поэтому можно разрабатывать лёгкие методы адаптации ИИ, не вникая в детали.
🎯 Теорема «об отсутствии волос»: чёрную дыру описывают лишь масса, заряд и вращение. Вся остальная информация о поглощённой материи стирается.