Experience replay
Как это работает: агент совершает действие, получает награду и попадает в новое состояние — эта четвёрка складывается в карточку-переход. Карточки хранятся в буфере, а при обучении алгоритм случайно выбирает пачку записей, перемешивая события из начала и конца игры. Поэтому редкие успешные моменты агент может повторно пережить многократно, извлекая из них урок.
Классический пример — DeepMind и игра Breakout на Atari. Очки там начисляются редко, и без replay агент почти не начал бы учиться. С replay он запоминал каждый редкий отскок мяча и строил стратегию, превосходящую человека. Метод позволил обучить одну сеть разным играм без ручной настройки.
Итог: experience replay — это «память с акцентом на важное», делающая обучение стабильным и быстрым. Агент не повторяет ошибок, использует редкие успехи и избегает хаоса потока последних событий. Без этого ИИ был бы похож на человека с амнезией, начинающего всё заново каждый день.
Поделиться