глоссарий

SFT

SFT

SFT (Supervised Fine-Tuning) — это этап дообучения готовой языковой модели на размеченных примерах, где каждая пара «запрос — идеальный ответ» показывает модели желаемый стиль поведения. Если предварительное обучение даёт модели широкие знания о языке, то SFT превращает её в полезного ассистента, который не просто продолжает текст, а отвечает на вопросы, следует инструкциям и соблюдает формат.

Важность SFT сложно переоценить: именно этот этап отделяет «сырую» нейросеть, способную генерировать правдоподобный текст, от продукта, которым можно пользоваться. Без SFT модель не понимает, что от неё хотят, и вместо ответа на вопрос может выдать продолжение в духе романа или случайную цепочку ассоциаций. Тонкая настройка задаёт рамки: как начинать ответ, как быть вежливой, как признавать незнание.

Интуитивно это похоже на обучение стажёра. Сначала он изучает теорию — читает тысячи книг и статей (предварительное обучение). Но чтобы начать работать, ему показывают конкретные примеры: «Клиент спрашивает X — отвечай Y», «Вот так оформляй отчёт». Стажёр запоминает паттерны и постепенно перенимает стиль и логику решения задач. В SFT модель точно так же «натаскивают» на множестве пар «вопрос — образцовый ответ», корректируя веса так, чтобы предсказывать нужные токены после заданного промпта.

Прикладной пример: компания делает медицинский чат-бот. Базовая модель умеет говорить о чём угодно, но опасно. Инженеры собирают датасет из тысяч диалогов врачей и пациентов, где ответы безопасны, содержат отказ от диагнозов и ссылки на специалистов. После SFT модель перестаёт давать опасные советы и начинает отвечать в рамках протокола. Это не гарантирует полную безопасность, но серьёзно снижает риски.

Коротко: SFT — мостик между «знающей, но неуправляемой» моделью и полезным ассистентом. Это первый и обязательный шаг, без которого любые более сложные методы — вроде RLHF или самокритики — просто не имеют смысла.