Prioritized experience replay
Зачем это важно? В классическом обучении с подкреплением агент получает тысячи шагов, но большинство из них — рутинные и бесполезные. Если перемешивать их случайно, редкие, но критически важные эпизоды (например, столкновение с препятствием) будут теряться в массе однотипных действий. Prioritized experience replay решает эту проблему, концентрируя ресурсы на редких и информативных событиях, что резко ускоряет обучение и делает его стабильнее.
Как это работает интуитивно? Представьте студента, который готовится к экзамену. Если он перечитывает учебник от корки до корки каждый день, он быстро устанет. Вместо этого он выписывает ошибки из прошлых тестов и разбирает именно их. Чем сильнее ошибка — тем больше внимания. В алгоритме каждая запись из памяти получает «вес» — величину ошибки предсказания. При формировании батча эти веса используются как вероятности выбора, а затем корректируются, чтобы агент не переобучился на нескольких сюжетах.
Прикладной пример: робот обучается собирать конструктор. Большинство попыток — удачные и скучные. Но иногда рука соскальзывает, и робот роняет деталь. Это событие даёт большую ошибку. Без приоритетного воспроизведения робот будет долго «перемалывать» успешные сборки и не поймёт причину падения. С методом же система мгновенно извлекает этот сбой из памяти, анализирует его многократно и корректирует стратегию захвата — уже через несколько десятков итераций.
Коротко: prioritized experience replay — это память с приоритетами, которая учит ИИ на важных ошибках, а не на скучных повторениях, делая обучение быстрым и целенаправленным.
Поделиться