Подробно

Почему нейросети похожи на чёрные дыры: урок «лысых» моделей ⚡ экспресс

Original: "Artificial Entanglement in the Fine-Tuning of Large Language Models"
Измерив «запутанность» внутри нейросетей, учёные поняли: они ведут себя как чёрные дыры — внешне одинаковы при любых внутренних изменениях.
Аннотация

Работа исследует эффективность параметрически эффективного дообучения (PEFT) больших языковых моделей, таких как LoRA, с позиций квантовой теории информации. Низкоранговые параметризации соответствуют малоразмерным представлениям в виде матричных произведений состояний (MPS), что позволяет ввести понятие «искусственной запутанности» — энтропии запутанности параметров нейросети. Сравниваются LoRA и полное дообучение (FFT) на моделях LLaMA (1B и 8B), обученных на наборах данных Tulu3 и OpenThoughts3. Внутренняя искусственная запутанность в обновлениях матриц запросов и значений для LoRA подчиняется объёмному закону с подавлением в центре — «долиной запутанности», чувствительной к гиперпараметрам, и отличается от FFT. Внешняя запутанность в матрицах внимания, соответствующая корреляциям токенов в пространстве представлений, следует закону площади с логарифмическими поправками и устойчива к гиперпараметрам и шагам обучения. Проводится параллель с теоремой об отсутствии волос у чёрных дыр: несмотря на различия во внутренней запутанности, выходные данные внимания остаются схожими, что объясняет эффективность низкоранговых обновлений.

Связи в графе знаний 1

📄 Показана версия «Просто» — «Подробно» пока не готова. Добавьте ★ в избранное, если хотите её ускорить.

Дообучение нейросети похоже на попытку изменить чёрную дыру, не коснувшись её горизонта событий: меняют лишь малую часть параметров. Исследователи заглянули внутрь и увидели удивительные узоры — сильные связи между кусочками модели, как в квантовой запутанности. Измеряя энтропию (меру хаоса), они обнаружили «долину запутанности» — резкий провал упорядоченности, который зависит от метода обучения.

Подобно чёрной дыре, которая, по выражению Джона Уилера, «не имеет волос», языковая модель выдаёт результат, не зависящий от внутренних узоров. Эту «лысость» связал с энтропией Якоб Бекенштейн.

На практике это значит: неважно, какие узоры внутри, важно внешнее поведение. Поэтому можно разрабатывать лёгкие методы адаптации ИИ, не вникая в детали.

🎯 Теорема «об отсутствии волос»: чёрную дыру описывают лишь масса, заряд и вращение. Вся остальная информация о поглощённой материи стирается.

Учёные
Ludwig BoltzmannJacob BekensteinStephen HawkingFritz ZwickyBernhard RiemannJoseph Weber
Теги
энтропия чёрная дыра
Законы
второй закон термодинамикиэнтропия Бекенштейна–Хокингаизлучение хокингагравитационное линзированиеуравнения Эйнштейнараспределение Больцмана
Оригинал: arXiv:2601.06788 · CC BY · bridge42worlds