LoRA meets Riemannion: Muon Optimizer for Parametrization-independent Low-Rank Adapters
18:35
О чём пойдёт речь?
Современные большие языковые модели (LLM) требуют колоссальных вычислительных ресурсов при полном дообучении. Поэтому методы малопараметрической настройки, такие как Low-Rank Adaptation (LoRA), стали стандартом для задач дообучения. Однако классическая LoRA страдает от фундаментальной проблемы — неоднозначности параметризации: одно и то же обновление весов может быть представлено множеством пар матриц (A, B), и выбор конкретного разложения влияет на качество обучения.
Мы предлагаем полностью «риманову» формулировку задачи, которая устраняет эту неоднозначность и позволяет использовать геометрию адаптеров при оптимизации моделей. Новый оптимизатор Riemannion обобщает идею Muon (2024) на многообразие фиксированного ранга, сохраняя эффективность и обеспечивая инвариантность к выбору параметризации.
На семинаре обсудим:
— Как некоторые представления LoRA могут привести к неэффективности обучения;
— Как работает Muon-оптимизатор и его представление в виде задачи LMO;
— Как работает Muon-оптимизатор и его представление в виде задачи LMO;
— Что такое многообразие фиксированного ранга и как на нём можно оптимизировать адаптеры напрямую;
— LOI (Locally Optimal Initialization) — как выбрать начальные параметры LoRA на основе римановой геометрии;
— Сравнение с другими методами (DoRA, LoRA+, LoRA-GA, RPrecAdamW) и результаты на Llama 3-8B и Stable Diffusion 2;
— Практическую реализацию и почему Riemannion почти не увеличивает время обучения, но стабильно улучшает метрики.