Group split
Зачем: если дать модели все данные сразу, она запомнит ответы наизусть и блестяще сработает только на знакомых примерах. На новых — потеряется. Это переобучение. Group split помогает его заметить: если на «учебной» и «проверочной» частях результаты сильно различаются, модель не обобщает, а вызубрила материал.
Аналогия: школьник, решивший только задачи из учебника, может получить пятёрку, но на экзамене с другими формулировками провалится. Group split — честный экзамен: один набор для учёбы, другой, похожий, но не совпадающий, для проверки. Части нельзя перемешивать, иначе модель подсмотрит ответы.
Пример: банк одобряет кредиты. Есть история тысяч клиентов. Если обучить модель на всех данных, она идеально предскажет только старых клиентов. Правильно: случайно разделить историю на 80% для обучения и 20% для проверки. Если на отложенных данных точность падает — система не заработает в реальности. Банк корректирует модель, пока не получит стабильный результат.
Коротко: group split — страховка от самообмана. Разделяя данные, мы заставляем модель доказывать, что она понимает закономерности, а не помнит цифры. Это простой и действенный инструмент для создания честного ИИ.
Поделиться