Чтобы извлечь из данных какие-то инсайты или обучать на них модели машинного обучения, необходимо чтобы они были собраны в удобном, единообразном формате. К препроцессингу относится: сбор информации из разрозненных файлов, объединение таблиц, нормализация, фильтрация, обработка NA и многие другие процедуры. К сожалению, очень часто данные, с которыми мы работаем, — грязные. Львиная доля времени машинленеров уходит именно на доведение данных до кондиции, а отнюдь не на креативную часть — построение алгоритмов машинного обучения, осмысление результатов и т.д. На вебинаре Александр Ильин покажет мастер-класс с помощью Python.