глоссарий

Low-rank adaptation

Low-rank adaptation

LoRA (Low-Rank Adaptation) — приём для дообучения больших нейросетей без пересчёта всех весов. Вместо изменения огромной матрицы к ней добавляют две компактные, которые в сумме дают нужное смещение. Это как прикрутить деталь к механизму, а не пересобирать его.

Полная тонкая настройка модели на 70 млрд параметров требует ресурсов уровня дата-центра и огромных затрат. После неё получается новая гигантская версия, которую нужно хранить и запускать. LoRA же обучает лишь крошечный процент параметров — иногда меньше одного процента. Это позволяет адаптировать модель под задачу на одной видеокарте и в разы быстрее.

Интуитивно: в таблице чисел, определяющей поведение модели, обычное обучение правит каждое число. LoRA оставляет оригинал нетронутым и добавляет небольшое смещение, представленное произведением двух узких матриц — их общий размер гораздо меньше исходного. При загрузке базовые веса не меняются, к ним на лету добавляются маленькие множители. В итоге одна базовая модель может иметь десятки дешёвых «настроек» под разные задачи.

Пример: техподдержка банка адаптирует языковую модель под свои сценарии. Вместо обучения семимиллиардной модели с нуля или переобучения всех слоёв на дорогих серверах берут LoRA и за несколько часов на обычном GPU получают адаптацию. К базовой модели добавляется файл на несколько мегабайт, и она понимает специфическую терминологию, форматы сообщений и правила вежливости банка. Оригинал остаётся нетронутым и может использоваться другими компаниями со своими адаптациями.

Коротко: LoRA — элегантный способ сделать мощную модель специалистом в своей нише без гигантских затрат. Он дёшев, прост и стал стандартом индустрии для кастомизации больших языковых моделей. Благодаря ему адаптация ИИ перестала быть привилегией корпораций и стала повседневным инструментом разработчиков.