глоссарий

Soft parameter sharing

Soft parameter sharing

Soft parameter sharing — способ обучения нейросетей, при котором разные задачи или подсистемы имеют раздельные веса, но штраф за их расхождение заставляет параметры стремиться к похожести. В отличие от жёсткого разделения, где веса общие, здесь каждая часть сохраняет индивидуальность, но между ними действует «сила притяжения». Это полезно в многозадачном обучении: полностью общие веса мешают задачам друг другу, полностью раздельные — теряют общий смысл. Мягкий подход даёт баланс: знания переносятся, но задачи остаются гибкими.

Интуитивно это как два художника в одной студии: каждый пишет свою картину, но их мазки не должны слишком расходиться по стилю, иначе штраф. В нейросети такой штраф добавляется в функцию потерь — например, среднеквадратичная разница между матрицами весов. Чем сильнее расхождение, тем больше потеря, и оптимизация подталкивает веса к компромиссу.

Пример: система, распознающая эмоции в голосе и очищающая речь от шума. Жёсткое общее ядро может сглаживать шум ценой потери эмоций; полностью раздельные сети требуют обучения с нуля дважды. Мягкое разделение позволяет использовать общие акустические представления, но нижние слои специализируются: одна ветка — на шумах, другая — на интонациях.

Вывод: soft parameter sharing — гибкий механизм баланса между универсальностью и специализацией. Он ценен, когда задачи связаны, но не тождественны, и позволяет модели учиться на опыте «соседа», не теряя уникальности.