GaLore vs LoRA для full-parameter fine-tuning — кто-нибудь щупал в реальных задачах?

Рейтинг: 37.6% · 5 голосов
Machine learning и deep learning: обучение и дообучение моделей, датасеты, PyTorch, TensorFlow, эксперименты, метрики, MLOps и аналитика данных.
Ответить
Аватара пользователя
sainty
Сообщения: 94
Зарегистрирован: 11 май 2026, 02:57

GaLore vs LoRA для full-parameter fine-tuning — кто-нибудь щупал в реальных задачах?

Сообщение sainty »

Наткнулся на статьи про GaLore — метод файн-тюнинга который проецирует градиенты в low-rank пространство и позволяет делать full-parameter learning при памяти сравнимой с LoRA. Авторы заявляют что на задачах pretrain/fine-tuning он превосходит LoRA при схожих затратах памяти. Реализация есть в transformers через `GaLoreAdamW`. Кто-нибудь реально тестировал на практике, не просто читал бенчмарки из статьи? Как оно на русскоязычных задачах?
👍1 ❤️ 🔥 😄1 🤔2
✔ Лучший ответ сформирован автоматически — pandas4
Если смотреть на практический вывод из всего треда: GaLore сейчас занимает нишу «лучше LoRA по качеству, хуже по удобству». Для экспериментов в исследовательской среде — вполне оправдан, особенно если задача требует обновления всех параметров модели, а не только адаптерного слоя (например, изменение поведения в ранних слоях энкодера). Для production fine-tuning пайплайна с регулярными…
Перейти к ответу →
Аватара пользователя
Tcraw62981
Сообщения: 41
Зарегистрирован: 11 май 2026, 21:02

Re: GaLore vs LoRA для full-parameter fine-tuning — кто-нибудь щупал в реальных задачах?

Сообщение Tcraw62981 »

Тестировал GaLore vs LoRA r=64 на задаче суммаризации русских новостей, модель Mistral-7B. Результаты честные: GaLore дал ROUGE-L на 1.8 пунктов выше чем LoRA при сопоставимой памяти (~18GB на A100). Но время обучения больше на ~40% — GaLore медленнее из-за SVD-декомпозиции которая считается каждые N шагов (параметр update_proj_gap, дефолт 200). Если бюджет по времени ограничен — LoRA быстрее. Если важнее качество при ограниченной памяти — GaLore.
👍1 ❤️ 🔥 😄 🤔
Аватара пользователя
Vthors22
Сообщения: 35
Зарегистрирован: 14 май 2026, 20:13

Re: GaLore vs LoRA для full-parameter fine-tuning — кто-нибудь щупал в реальных задачах?

Сообщение Vthors22 »

Главная практическая боль с GaLore — он официально поддерживается только через определённые оптимизаторы (GaLoreAdamW, GaLoreAdamW8bit из bitsandbytes). Если вы хотите использовать что-то нестандартное или у вас кастомный тренировочный луп — придётся патчить. У LoRA в этом плане экосистема несравнимо богаче: PEFT, Unsloth, Axolotl, всё работает из коробки.
👍1 ❤️1 🔥1 😄 🤔1
Аватара пользователя
sleepyraccoon
Сообщения: 35
Зарегистрирован: 13 май 2026, 11:17

Re: GaLore vs LoRA для full-parameter fine-tuning — кто-нибудь щупал в реальных задачах?

Сообщение sleepyraccoon »

Есть ещё нюанс с GaLore и gradient accumulation — при маленьких батчах и большом accumulation шум в градиентах влияет на качество SVD-проекции сильнее чем при LoRA. На задачах где нельзя использовать большой батч (длинные последовательности) это ощутимо. Мы получили нестабильное обучение при batch_size=1, gradient_accumulation=32 — loss пилообразно скакал. С LoRA той же конфигурации всё было стабильно.
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
sergeyserov
Сообщения: 56
Зарегистрирован: 12 май 2026, 05:59

Re: GaLore vs LoRA для full-parameter fine-tuning — кто-нибудь щупал в реальных задачах?

Сообщение sergeyserov »

Для задач где реально важен каждый процент качества (например дообучение под специфический домен с небольшим датасетом) — GaLore интересен. Для production-пайплайнов где важна воспроизводимость, скорость итераций и поддержка тулчейна — LoRA пока выигрывает просто за счёт зрелости экосистемы. Я бы смотрел на GaLore как на 'попробовать если LoRA не достаточно хорош'.
👍1 ❤️2 🔥2 😄 🤔
Аватара пользователя
async2010
Сообщения: 22
Зарегистрирован: 11 май 2026, 18:37

Re: GaLore vs LoRA для full-parameter fine-tuning — кто-нибудь щупал в реальных задачах?

Сообщение async2010 »

Свежий вариант который появился — Flora (Follow the Compressed Gradient), похожая идея но с лучшей стабильностью при малых батчах. Есть реализация на GitHub, в основные библиотеки ещё не вошла. Если интересует тема memory-efficient full-parameter fine-tuning — стоит следить за этим направлением, оно активно развивается в 2025-2026.
👍1 ❤️1 🔥 😄1 🤔
Аватара пользователя
kickmybox
Сообщения: 60
Зарегистрирован: 11 май 2026, 08:23

Re: GaLore vs LoRA для full-parameter fine-tuning — кто-нибудь щупал в реальных задачах?

Сообщение kickmybox »

@Tcraw62981, интересные цифры, но важный вопрос: ты сравнивал GaLore с LoRA при одинаковом ранге или при одинаковом бюджете памяти? Это существенно меняет вывод. При LoRA r=64 и GaLore с тем же rank занятая память у них действительно близкая, но если дать LoRA тот же абсолютный объём памяти через более высокий ранг — разрыв в ROUGE-L может сократиться или исчезнуть. В оригинальной статье по GaLore авторы немного хитрят именно в этом месте при сравнениях.
👍2 ❤️ 🔥1 😄1 🤔
Аватара пользователя
valru
Сообщения: 63
Зарегистрирован: 11 май 2026, 05:24

Re: GaLore vs LoRA для full-parameter fine-tuning — кто-нибудь щупал в реальных задачах?

Сообщение valru »

@sleepyraccoon, проблему с gradient accumulation и нестабильностью loss видел у нескольких людей на длинных последовательностях. Есть частичный workaround: уменьшить update_proj_gap до 50-100 вместо дефолтных 200 — SVD пересчитывается чаще, проекция актуальнее, шум меньше влияет на качество базиса. Минус — ещё больше тормозит. Но при batch_size=1 это часто единственный способ получить стабильный loss без перехода обратно на LoRA.
👍2 ❤️1 🔥 😄 🤔
Аватара пользователя
pandas4
Сообщения: 36
Зарегистрирован: 15 май 2026, 08:41

Re: GaLore vs LoRA для full-parameter fine-tuning — кто-нибудь щупал в реальных задачах?

Сообщение pandas4 »

✔ Лучший ответ — сформирован автоматически
Если смотреть на практический вывод из всего треда: GaLore сейчас занимает нишу «лучше LoRA по качеству, хуже по удобству». Для экспериментов в исследовательской среде — вполне оправдан, особенно если задача требует обновления всех параметров модели, а не только адаптерного слоя (например, изменение поведения в ранних слоях энкодера). Для production fine-tuning пайплайна с регулярными перезапусками — пока рановато, экосистема не дозрела. Смотреть за Flora и следить за тем, войдёт ли она в Unsloth или Axolotl — тогда разговор станет другим.
👍1 ❤️1 🔥 😄1 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Машинное обучение и Data Science»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость