глоссарий

Experience replay

Experience replay

Experience replay — приём в обучении с подкреплением, когда агент сохраняет прошлый опыт в памяти и периодически пересматривает его. Это тренировка на воспоминаниях, а не только на свежих событиях. Без неё нейросеть быстро забывает редкие удачи и застревает на частых, но малополезных повторах; соседние кадры эпизода слишком похожи, и сеть «переучивается» на однотипных данных.

Как это работает: агент совершает действие, получает награду и попадает в новое состояние — эта четвёрка складывается в карточку-переход. Карточки хранятся в буфере, а при обучении алгоритм случайно выбирает пачку записей, перемешивая события из начала и конца игры. Поэтому редкие успешные моменты агент может повторно пережить многократно, извлекая из них урок.

Классический пример — DeepMind и игра Breakout на Atari. Очки там начисляются редко, и без replay агент почти не начал бы учиться. С replay он запоминал каждый редкий отскок мяча и строил стратегию, превосходящую человека. Метод позволил обучить одну сеть разным играм без ручной настройки.

Итог: experience replay — это «память с акцентом на важное», делающая обучение стабильным и быстрым. Агент не повторяет ошибок, использует редкие успехи и избегает хаоса потока последних событий. Без этого ИИ был бы похож на человека с амнезией, начинающего всё заново каждый день.