Когда речь заходит о ML, все бросаются загибать пальцы и перечислять модели, архитектуры и функции потерь. За этим занятием многие забывают, что вообще-то любая, даже самая навороченная нейросеть — не вещь в себе. Она выучивает закономерности из данных.
Данные сегодня — «новый бензин». За ними идет настоящая охота. Ради обучения LLM-ок гиганты Бигтеха воруют книги из онлайн-библиотек или без спроса транскрибируют видео с YouTube. Сила машинного и глубокого обучения заключена именно в данных.
Но найти их — лишь часть дела. Реальные данные — грязные, шумные и смещенные. Это вам не ирисы Фишера. Их надо чистить и всячески готовить, ведь принцип GIGO никто не отменял: мусор на входе — мусор на выходе. Причем неудачные решения на стадии предобработки могут отправить все-все-все последующие труды коту под хвост.
Вот занялись вы компьютерным зрением и хотите классифицировать фотографии. Чтобы скормить снимки модели, которая понимает только язык чисел, нужно порой пройти девять кругов Данте. Скажем, привести картинки к единому размеру и форме, удалить шум на фоне, нормализовать значения в цветовых каналах или преобразовать RGB-изображения в черно-белые. Данных не хватает? Тогда разумно применить аугментацию: повертеть, покрутить, отзеркалить картинки. И разделить выборку на трейн и тест, соблюдая баланс. Если такими процедурами не заморочиться, то либо ваш код вовсе не запустится, либо вы получите модель, которая будет бесполезна в реальном мире.
В среде датасатанистов ходит байка про хаски. Исследователи из Вашингтонского университета поставили эксперимент. Они обучали логрег отличать волков от хаски на фотках. На вход классификатору подавали выход первого пулингового слоя предобученной нейросети Inception. Но тренировочную выборку подобрали так, что волки в ней встречались преимущественно на фоне сугробов. Когда ученые посмотрели, на что же ориентируется алгоритм, то выяснилось: он детектирует... снег. Зверей можно было вообще закрыть черным квадратом — результат предсказаний не менялся! Вижу зиму — говорю «волк», даже если на фото собакен. Кейс показывает, что ИИ чувствителен к артефактам, ищет легчайший путь (shortcut learning) и цепляется за ложные корреляции.
Поэтому если к подготовке данных подойти спустя рукава, то последствия не заставят себя долго ждать. Любишь кататься, люби и саночки возить 💻