Что в плейлисте у машинленера? Конечно, ансамбли 🎶
🐂 Начнем с байки про «белого бычка». В 1906 году пожилой Фрэнсис Гальтон заглянул на животноводческую выставку в Плимуте. Как и его кузен Чарльз Дарвин, он очень интересовался селекцией. В одном из павильонов внимание статистика привлекла забавная лотерея. Посетители пытались на глазок угадать, сколько будет весить бык после забоя и разделки. Люди покупали проштампованные бланки за шесть пенсов, вписывали туда свое имя и суждение о массе туши. Публика собралась разношерстная: и опытные мясники, и клерки, и просто зеваки. Кто подберется ближе к истине — тот уносит приз.
🧐 По завершении конкурса Гальтон выпросил у организаторов 800 заполненных карточек. Проведя анализ, он констатировал, что каждый отдельный ярмарочник серьезно ошибся. Но если усреднить оценки, то полученное значение (1197 фунтов) практически не отличалось от реального веса быка (1198 фунтов). Поразительно! Народ оказался даже точнее экспертов по крупному рогатому скоту. Гальтон ожидал увидеть невежественность простолюдинов и желал высмеять принципы демократического голосования, а вышло ровно наоборот. Тем не менее ученый честно изложил случай на сельхозярмарке и отправил заметку под названием «Vox Populi» в журнал Nature. В наши дни этот кейс приводят как хрестоматийный пример мудрости толпы. Феномен обрел особую известность после выхода одноименной книги журналиста Джеймса Шуровьески.
🤖 Именно эта идея лежит в основе ансамблевых методов в машинном обучении. Если взять несколько разнообразных (пусть даже и глупеньких) алгоритмов и агрегировать их предсказания, «коллективный разум» превзойдет индивидуальные модели. Бэггинг (случайный лес), стекинг, бустинг — эти термины прочно вошли в лексикон млщиков. Градиентный бустинг вообще считается лучшим классическим подходом и до последнего времени стабильно одерживал верх над нейронками на табличках — излюбленном типе данных у ученых.
Популяризации ансамблей способствовали ML-соревнования. Скажем, на финальном этапе Netflix Prize, о котором Бластим писал ранее, команда-победитель объединила прогнозы больше сотни моделей! И сегодня без композиции алгоритмов не выигрывается буквально ни один конкурс на Kaggle.
В подноготной ансамблей мы разбираемся на второй неделе курса по ML