глоссарий

Padding

Padding

Padding (дополнение) в контексте искусственного интеллекта — это добавление специальных служебных символов (чаще всего токена [PAD]) к началу или концу последовательности данных, чтобы сделать все входные примеры одинаковой длины. В компьютерном зрении padding может означать добавление нулевых пикселей по краям изображения, но в NLP речь идет именно о токенах.

Зачем это важно: современные модели глубокого обучения, особенно трансформеры, обрабатывают данные батчами. Они предполагают, что все последовательности в одном батче имеют фиксированную размерность. Если предложения разной длины, без padding невозможно запустить вычисления на графическом процессоре эффективно. Приходилось бы либо группировать данные по длине, либо обрезать длинные, что теряет информацию. Именно padding позволяет поддерживать высокую скорость обучения.

Как это работает на интуитивном уровне: представьте библиотеку, где все книги лежат в одинаковых коробках. Короткие книги вы кладете и заполняете оставшееся пространство пенопластом. В ИИ этот пенопласт — токены [PAD]. Модель знает, что они ничего не значат, и не учитывает их в расчетах весов. Более того, в трансформерах используется маска внимания, которая скрывает позиции с padding, чтобы сеть не обучалась на пустых местах.

Прикладной пример: в машинном переводе предложения «Рим» и «Столица Италии — Рим» имеют разную длину. Чтобы скормить их модели одновременно, токенизатор добавляет к первому предложению три токена [PAD], доводя длину до пяти. Модель обрабатывает оба примера параллельно, игнорируя пустые места.

Вывод: padding — это крошечная, но критическая техническая деталь, без которой невозможно представить быстрое обучение и инференс нейросетей, работающих с текстом, аудио, видео и другими последовательностями. Она делает данные единообразными, экономя время и ресурсы, поэтому считается незаметным, но важным строительным блоком современных ИИ.