Low-rank adaptation
Полная тонкая настройка модели на 70 млрд параметров требует ресурсов уровня дата-центра и огромных затрат. После неё получается новая гигантская версия, которую нужно хранить и запускать. LoRA же обучает лишь крошечный процент параметров — иногда меньше одного процента. Это позволяет адаптировать модель под задачу на одной видеокарте и в разы быстрее.
Интуитивно: в таблице чисел, определяющей поведение модели, обычное обучение правит каждое число. LoRA оставляет оригинал нетронутым и добавляет небольшое смещение, представленное произведением двух узких матриц — их общий размер гораздо меньше исходного. При загрузке базовые веса не меняются, к ним на лету добавляются маленькие множители. В итоге одна базовая модель может иметь десятки дешёвых «настроек» под разные задачи.
Пример: техподдержка банка адаптирует языковую модель под свои сценарии. Вместо обучения семимиллиардной модели с нуля или переобучения всех слоёв на дорогих серверах берут LoRA и за несколько часов на обычном GPU получают адаптацию. К базовой модели добавляется файл на несколько мегабайт, и она понимает специфическую терминологию, форматы сообщений и правила вежливости банка. Оригинал остаётся нетронутым и может использоваться другими компаниями со своими адаптациями.
Коротко: LoRA — элегантный способ сделать мощную модель специалистом в своей нише без гигантских затрат. Он дёшев, прост и стал стандартом индустрии для кастомизации больших языковых моделей. Благодаря ему адаптация ИИ перестала быть привилегией корпораций и стала повседневным инструментом разработчиков.
Поделиться