GaLore vs LoRA для full-parameter fine-tuning — кто-нибудь щупал в реальных задачах?
Рейтинг: 37.6% · 5 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
GaLore vs LoRA для full-parameter fine-tuning — кто-нибудь щупал в реальных задачах?
Наткнулся на статьи про GaLore — метод файн-тюнинга который проецирует градиенты в low-rank пространство и позволяет делать full-parameter learning при памяти сравнимой с LoRA. Авторы заявляют что на задачах pretrain/fine-tuning он превосходит LoRA при схожих затратах памяти. Реализация есть в transformers через `GaLoreAdamW`. Кто-нибудь реально тестировал на практике, не просто читал бенчмарки из статьи? Как оно на русскоязычных задачах?
✔ Лучший ответ сформирован автоматически — pandas4
Если смотреть на практический вывод из всего треда: GaLore сейчас занимает нишу «лучше LoRA по качеству, хуже по удобству». Для экспериментов в исследовательской среде — вполне оправдан, особенно если задача требует обновления всех параметров модели, а не только адаптерного слоя (например, изменение поведения в ранних слоях энкодера). Для production fine-tuning пайплайна с регулярными…
- Tcraw62981
- Сообщения: 41
- Зарегистрирован: 11 май 2026, 21:02
Re: GaLore vs LoRA для full-parameter fine-tuning — кто-нибудь щупал в реальных задачах?
Тестировал GaLore vs LoRA r=64 на задаче суммаризации русских новостей, модель Mistral-7B. Результаты честные: GaLore дал ROUGE-L на 1.8 пунктов выше чем LoRA при сопоставимой памяти (~18GB на A100). Но время обучения больше на ~40% — GaLore медленнее из-за SVD-декомпозиции которая считается каждые N шагов (параметр update_proj_gap, дефолт 200). Если бюджет по времени ограничен — LoRA быстрее. Если важнее качество при ограниченной памяти — GaLore.
Re: GaLore vs LoRA для full-parameter fine-tuning — кто-нибудь щупал в реальных задачах?
Главная практическая боль с GaLore — он официально поддерживается только через определённые оптимизаторы (GaLoreAdamW, GaLoreAdamW8bit из bitsandbytes). Если вы хотите использовать что-то нестандартное или у вас кастомный тренировочный луп — придётся патчить. У LoRA в этом плане экосистема несравнимо богаче: PEFT, Unsloth, Axolotl, всё работает из коробки.
- sleepyraccoon
- Сообщения: 35
- Зарегистрирован: 13 май 2026, 11:17
Re: GaLore vs LoRA для full-parameter fine-tuning — кто-нибудь щупал в реальных задачах?
Есть ещё нюанс с GaLore и gradient accumulation — при маленьких батчах и большом accumulation шум в градиентах влияет на качество SVD-проекции сильнее чем при LoRA. На задачах где нельзя использовать большой батч (длинные последовательности) это ощутимо. Мы получили нестабильное обучение при batch_size=1, gradient_accumulation=32 — loss пилообразно скакал. С LoRA той же конфигурации всё было стабильно.
- sergeyserov
- Сообщения: 56
- Зарегистрирован: 12 май 2026, 05:59
Re: GaLore vs LoRA для full-parameter fine-tuning — кто-нибудь щупал в реальных задачах?
Для задач где реально важен каждый процент качества (например дообучение под специфический домен с небольшим датасетом) — GaLore интересен. Для production-пайплайнов где важна воспроизводимость, скорость итераций и поддержка тулчейна — LoRA пока выигрывает просто за счёт зрелости экосистемы. Я бы смотрел на GaLore как на 'попробовать если LoRA не достаточно хорош'.
Re: GaLore vs LoRA для full-parameter fine-tuning — кто-нибудь щупал в реальных задачах?
Свежий вариант который появился — Flora (Follow the Compressed Gradient), похожая идея но с лучшей стабильностью при малых батчах. Есть реализация на GitHub, в основные библиотеки ещё не вошла. Если интересует тема memory-efficient full-parameter fine-tuning — стоит следить за этим направлением, оно активно развивается в 2025-2026.
Re: GaLore vs LoRA для full-parameter fine-tuning — кто-нибудь щупал в реальных задачах?
@Tcraw62981, интересные цифры, но важный вопрос: ты сравнивал GaLore с LoRA при одинаковом ранге или при одинаковом бюджете памяти? Это существенно меняет вывод. При LoRA r=64 и GaLore с тем же rank занятая память у них действительно близкая, но если дать LoRA тот же абсолютный объём памяти через более высокий ранг — разрыв в ROUGE-L может сократиться или исчезнуть. В оригинальной статье по GaLore авторы немного хитрят именно в этом месте при сравнениях.
Re: GaLore vs LoRA для full-parameter fine-tuning — кто-нибудь щупал в реальных задачах?
@sleepyraccoon, проблему с gradient accumulation и нестабильностью loss видел у нескольких людей на длинных последовательностях. Есть частичный workaround: уменьшить update_proj_gap до 50-100 вместо дефолтных 200 — SVD пересчитывается чаще, проекция актуальнее, шум меньше влияет на качество базиса. Минус — ещё больше тормозит. Но при batch_size=1 это часто единственный способ получить стабильный loss без перехода обратно на LoRA.
Re: GaLore vs LoRA для full-parameter fine-tuning — кто-нибудь щупал в реальных задачах?
✔ Лучший ответ — сформирован автоматически
Если смотреть на практический вывод из всего треда: GaLore сейчас занимает нишу «лучше LoRA по качеству, хуже по удобству». Для экспериментов в исследовательской среде — вполне оправдан, особенно если задача требует обновления всех параметров модели, а не только адаптерного слоя (например, изменение поведения в ранних слоях энкодера). Для production fine-tuning пайплайна с регулярными перезапусками — пока рановато, экосистема не дозрела. Смотреть за Flora и следить за тем, войдёт ли она в Unsloth или Axolotl — тогда разговор станет другим.
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
- Контекст-окно растёт, а агент всё равно тупеет на больших задачах. Боремся с этим
14 ответов · 927 просмотров
-
-
- Прогноз спроса в ритейле: прогнал Chronos-Bolt и TimesFM против нашего CatBoost на реальных данных
4 ответов · 67 просмотров
-
-
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость