LoRA vs полный файнтюн в 2026 — кто-нибудь реально видит разницу в качестве?

Теги: #LoRA#Qwen
Рейтинг: 64% · 16 голосов
Machine learning и deep learning: обучение и дообучение моделей, датасеты, PyTorch, TensorFlow, эксперименты, метрики, MLOps и аналитика данных.
Аватара пользователя
lentyaj
Сообщения: 68
Зарегистрирован: 11 май 2026, 00:17

LoRA vs полный файнтюн в 2026 — кто-нибудь реально видит разницу в качестве?

Сообщение lentyaj »

Дообучаю Qwen2.5-7B на своём датасете инструкций (~40k примеров). Раньше делал full fine-tune, но память кончается даже на A100 80GB с длинным контекстом. Стоит ли переходить на LoRA/QLoRA или потеряю в качестве на доменных задачах?
👍6 ❤️ 🔥2 😄1 🤔3
✔ Лучший ответ сформирован автоматически — thumper416
@fosl0002, про target_modules — это реально недооценённый момент. Я дополнительно всегда смотрю на gradient flow через хуки при первом прогоне: если какой-то слой получает нулевые градиенты — он в любом случае не обучается, и LoRA на нём бессмысленна. На Qwen2.5 оказалось что gate_proj в нижних слоях почти не двигается, зато up/down в средних дают основной вклад. После ручного отбора модулей…
Перейти к ответу →
Аватара пользователя
misha12
Сообщения: 67
Зарегистрирован: 11 май 2026, 04:09

Re: LoRA vs полный файнтюн в 2026 — кто-нибудь реально видит разницу в качестве?

Сообщение misha12 »

На 40k примерах full FT почти всегда оверфитит, если домен узкий. LoRA с rank 32-64 у меня давала практически тот же результат на бенчах, а тренируется в 3 раза дешевле.
👍3 ❤️1 🔥2 😄 🤔
Аватара пользователя
Bill2001
Сообщения: 86
Зарегистрирован: 16 май 2026, 20:24

Re: LoRA vs полный файнтюн в 2026 — кто-нибудь реально видит разницу в качестве?

Сообщение Bill2001 »

Подтверждаю. QLoRA 4-bit на одной A100 спокойно тянет 7B с контекстом 4k. Главное alpha не задирать, ставь alpha = 2*rank как базу и дальше тюнь.
👍1 ❤️ 🔥1 😄 🤔
Аватара пользователя
k8s_master
Сообщения: 44
Зарегистрирован: 11 май 2026, 19:55

Re: LoRA vs полный файнтюн в 2026 — кто-нибудь реально видит разницу в качестве?

Сообщение k8s_master »

А кто-нибудь rsLoRA пробовал? Говорят на больших rank стабильнее, потому что скейлинг по sqrt(rank), а не по rank.
👍2 ❤️ 🔥 😄 🤔
Аватара пользователя
fosl0002
Сообщения: 15
Зарегистрирован: 21 май 2026, 01:32

Re: LoRA vs полный файнтюн в 2026 — кто-нибудь реально видит разницу в качестве?

Сообщение fosl0002 »

rsLoRA включил флагом use_rslora=True в peft, на rank 128 действительно перестало взрываться. Спасибо, попробую.
👍 ❤️ 🔥2 😄1 🤔
Аватара пользователя
cmout098
Сообщения: 15
Зарегистрирован: 11 май 2026, 00:49

Re: LoRA vs полный файнтюн в 2026 — кто-нибудь реально видит разницу в качестве?

Сообщение cmout098 »

Не забывайте, что LoRA сильно зависит от того, какие модули таргетите. Только q_proj/v_proj это вчерашний день, накидывайте все линейные слои включая gate/up/down, разница заметная.
👍3 ❤️1 🔥 😄1 🤔2
Аватара пользователя
vuemaker
Сообщения: 34
Зарегистрирован: 22 май 2026, 16:44

Re: LoRA vs полный файнтюн в 2026 — кто-нибудь реально видит разницу в качестве?

Сообщение vuemaker »

Плюс к этому. target_modules=all-linear в новых версиях peft делает это автоматом. На MMLU-доменном у меня +1.8 пункта только от этого.
👍2 ❤️2 🔥5 😄 🤔1
Аватара пользователя
alansmit
Сообщения: 84
Зарегистрирован: 13 май 2026, 00:35

Re: LoRA vs полный файнтюн в 2026 — кто-нибудь реально видит разницу в качестве?

Сообщение alansmit »

А full FT хоть в каком случае ещё имеет смысл? Или это полностью legacy?
👍 ❤️ 🔥 😄 🤔
Аватара пользователя
envoy69
Сообщения: 20
Зарегистрирован: 12 май 2026, 19:29

Re: LoRA vs полный файнтюн в 2026 — кто-нибудь реально видит разницу в качестве?

Сообщение envoy69 »

Если меняешь поведение модели глобально (новый язык, новый формат рассуждений) full FT всё ещё лучше. Для доменной адаптации LoRA выигрывает по цене/качеству, согласен с тредом.
👍1 ❤️ 🔥 😄 🤔
Аватара пользователя
thumper416
Сообщения: 66
Зарегистрирован: 12 май 2026, 19:00

Re: LoRA vs полный файнтюн в 2026 — кто-нибудь реально видит разницу в качестве?

Сообщение thumper416 »

✔ Лучший ответ — сформирован автоматически
@fosl0002, про target_modules — это реально недооценённый момент. Я дополнительно всегда смотрю на gradient flow через хуки при первом прогоне: если какой-то слой получает нулевые градиенты — он в любом случае не обучается, и LoRA на нём бессмысленна. На Qwen2.5 оказалось что gate_proj в нижних слоях почти не двигается, зато up/down в средних дают основной вклад. После ручного отбора модулей получил +0.9 на своём домене при той же ranks.
👍 ❤️ 🔥1 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Машинное обучение и Data Science»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость