глоссарий

DVC

DVC

DVC — это инструмент для управления версиями данных и моделей машинного обучения. Git хорошо версионирует код, но плохо справляется с большими файлами: датасетами, весами нейросетей. DVC расширяет Git, позволяя отслеживать и такие тяжёлые объекты. По сути, это «Git для данных».

Без DVC легко потерять связь между версией датасета, кодом и результатом модели. DVC сохраняет метаданные, связывающие все компоненты эксперимента в единую контрольную точку. Благодаря этому результат месячной давности можно воспроизвести одной командой.

Как это работает? DVC не кладёт большие файлы в Git. Он помещает их во внешнее хранилище (облако, сетевой диск, папку), а в Git сохраняет лишь небольшие файлы-маркеры с контрольными суммами. Команда синхронизирует код через Git, а данные подтягивает по `dvc pull`. Это похоже на библиотечный каталог: книги хранятся в закрытом хранилище, а в каталоге указан только шифр для поиска. Если книгу заменят — изменится шифр, и вы это заметите.

Пример: исследователь обучает модель на датасете из 100 тысяч фотографий. Он создаёт версию `dataset_v1`. Через неделю приходит уточнённый датасет — появляется `dataset_v2`. Точность падает. С DVC можно вернуться к `dataset_v1`, переобучить модель и понять, что проблема именно в новых данных, а не в коде. Сэкономленное время окупает всё.

Коротко: DVC — это мостик между кодом и данными. Он привносит в машинное обучение ту же гигиену версионирования, что Git — в программирование. Если вам важны воспроизводимые и упорядоченные эксперименты, DVC станет надёжным помощником.