Robust fine-tuning
Классическое дообучение часто ведёт к катастрофической забывчивости: модель теряет старые навыки ради новых и слишком самоуверенно реагирует на отклонения во входных данных. А реальный мир полон шума, опечаток и редких случаев. Ошибка здесь может стоить дорого — от неверного диагноза до сбоя беспилотника. Поэтому устойчивость критически важна.
Идея проста: в процессе обучения модель специально кормят «затруднёнными» примерами — с шумом, искажениями, нестандартными формулировками. При этом следят, чтобы её внутренние представления оставались плавными. Сеть учится видеть суть понятия, а не конкретную «фотографию». Возникает иммунитет к неожиданным вариациям.
Пример: виртуальный помощник страховой компании. Обычное дообучение на жалобах узнаёт только фразы вроде «не выплатили компенсацию» и теряет понимание сленга. Устойчивое дообучение корректно реагирует на «ну где мои бабки за ремонт?» — распознаёт суть и предлагает помощь.
Коротко: robust fine-tuning — прививка от хрупкости. Она делает сеть не только умнее, но и надёжнее в живом, противоречивом мире.
Поделиться