глоссарий

Data quality

Data quality

Качество данных (data quality) — это мера того, насколько набор данных пригоден для решения конкретной задачи. Оно складывается из полноты, точности, непротиворечивости и актуальности информации. Высокое качество означает, что данные можно использовать для анализа и принятия решений без опасений получить искажённую картину.

Почему это важно? Любая аналитика и особенно модели искусственного интеллекта опираются на данные. Если в них ошибки или пропуски, то выводы будут неверными. В сфере ИИ это критично: модель, обученная на грязных данных, будет давать ошибочные прогнозы, даже если сам алгоритм идеален. Это называют «мусор на входе — мусор на выходе».

На интуитивном уровне можно представить приготовление блюда по отличному рецепту. Если взять испорченные продукты или перепутать соль с сахаром, то результат будет ужасным, сколько ни старайся. Данные — это тот же исходный продукт для интеллектуальной системы. Хороший алгоритм не сможет компенсировать плохое сырьё.

Пример из жизни: банк хочет предсказывать возврат кредитов. Он собирает данные о доходах клиентов, истории платежей и расходах. Если в базе появились старые или неверные сведения, например у клиента сменилась работа, а доход указан с прошлого места, то скоринговая модель может отказать надёжному заёмщику или, наоборот, выдать кредит мошеннику. Проблема решается регулярной проверкой, очисткой и валидацией данных.

Вывод прост: data quality — это фундамент, на котором строятся аналитика и искусственный интеллект. Без него даже самые современные модели становятся бесполезными. Поэтому компаниям стоит вкладываться в процессы управления данными не меньше, чем в разработку алгоритмов.