26 июля 2009 года. Ровно 17 лет назад. Волнение зашкаливает: остается менее часа до дедлайна растянувшегося на три года конкурса по машинному обучению. В 18:18 команда BellKor сабмитит свое итоговое решение. Через 20 минут то же самое делает их главный соперник The Ensemble и вырывается вперед, оказавшись на 0,0001 точнее. В 18:42 прием заявок завершается. Но тут случается неожиданный поворот сюжета…
В начале нулевых Netflix занимался видеопрокатом. Пользователи заказывали DVD-диски через интернет и получали их по почте. В личном кабинете зрители могли ставить фильмам звездочки по пятибалльной шкале. У компании существовал собственный алгоритм Cinematch, который советовал контент под вкус конкретного подписчика. Однако директор Рид Хастингс был им недоволен и искал свежие идеи.
Бизнесы редко раскрывают внутреннюю кухню, а Netflix поступил иначе. В октябре 2006 года компания выложила колоссальный датасет публично. 100 млн оценок, более 17 тыс. фильмов, 480 тыс. юзеров. И объявила соревнование Netflix Prize, задача которого — улучшить качество текущей рекомендательной системы на 10% по метрике RMSE. Награда внушительная: $1 млн.
Контест вызвал ажиотаж и привлек десятки тысяч информатиков, математиков, аналитиков со всего света. Испытать свои силы из любопытства решили старшекурсники факультета компьютерных наук Принстона, собрав команду Dinosaur Planet. Приняли вызов и матерые статистики из телекоммуникационного конгломерата AT&T. Люди вообще обожают кино: многие бросили привычные занятия, засели копаться в интересных данных и погружаться в тогда еще малоизвестную область — машинное обучение.
В течение двух лет заветные проценты оставались недосягаемыми. Но прогресс шел. Например, в первые же месяцы участники внедрили матричные разложения — они до сих пор очень актуальны в мире рекомендательных систем. Не обошлось без подковерных интриг. Группы то и дело распадались и объединялись. Летом 2009 года вырисовались два фаворита — The Ensemble, сборная солянка команд, куда вошли и «динозавры» из Принстона, и BellKor's Pragmatic Chaos, костяк которого составили инженеры AT&T.
26 июня 2009 года коллектив BellKor загрузил решение, которое наконец-то преодолело 10%-ный барьер. Событие запустило обратный отсчет: по правилам у остальных игроков оставалось 30 суток, чтобы предложить что-то лучше. Страсти накалялись, конкурсанты судорожно допиливали свои методы, пытаясь обскакать друг друга. Ко времени крайнего срока произошло то, что мы описали в первом абзаце. The Ensemble на финише выбился в лидеры. Но это только на публичном наборе. Когда открылись результаты на приватной части, выяснилось, что показатели метрики качества обоих претендентов совпали с точностью до четырех знаков после запятой (RMSE = 0.8567)! Организаторы вручили венок триумфатора тем, кто отправил заявку раньше — BellKor. Второму месту не досталось ни цента. Поистине драматическая развязка.
Ирония в том, что алгоритмы топов лидерборда так и не были внедрены в продакшн, оказавшись чересчур сложными. К тому же произошел переход от DVD к стримингу, где предпочтения пользователей отслеживаются по-другому. Тем не менее соревнование фантастически повлияло на мир айти. Научное сообщество познакомилось с реальной биг-датой. Были протестированы нестандартные техники, в том числе нейросети. Под впечатлением от конкурса возник Kaggle.
Сегодня ИИ интегрирован в нашу повседневность. Машинное обучение нужно вам как воздух, и вы тоже нужны машинному обучению с новыми мыслями. Уже завтра стартует бластимовский курс по ML, который может стать для вас лично таким же поворотным, как когда-то был Netflix Prize для человечества. Не упустите возможность!
В начале нулевых Netflix занимался видеопрокатом. Пользователи заказывали DVD-диски через интернет и получали их по почте. В личном кабинете зрители могли ставить фильмам звездочки по пятибалльной шкале. У компании существовал собственный алгоритм Cinematch, который советовал контент под вкус конкретного подписчика. Однако директор Рид Хастингс был им недоволен и искал свежие идеи.
Бизнесы редко раскрывают внутреннюю кухню, а Netflix поступил иначе. В октябре 2006 года компания выложила колоссальный датасет публично. 100 млн оценок, более 17 тыс. фильмов, 480 тыс. юзеров. И объявила соревнование Netflix Prize, задача которого — улучшить качество текущей рекомендательной системы на 10% по метрике RMSE. Награда внушительная: $1 млн.
Контест вызвал ажиотаж и привлек десятки тысяч информатиков, математиков, аналитиков со всего света. Испытать свои силы из любопытства решили старшекурсники факультета компьютерных наук Принстона, собрав команду Dinosaur Planet. Приняли вызов и матерые статистики из телекоммуникационного конгломерата AT&T. Люди вообще обожают кино: многие бросили привычные занятия, засели копаться в интересных данных и погружаться в тогда еще малоизвестную область — машинное обучение.
В течение двух лет заветные проценты оставались недосягаемыми. Но прогресс шел. Например, в первые же месяцы участники внедрили матричные разложения — они до сих пор очень актуальны в мире рекомендательных систем. Не обошлось без подковерных интриг. Группы то и дело распадались и объединялись. Летом 2009 года вырисовались два фаворита — The Ensemble, сборная солянка команд, куда вошли и «динозавры» из Принстона, и BellKor's Pragmatic Chaos, костяк которого составили инженеры AT&T.
26 июня 2009 года коллектив BellKor загрузил решение, которое наконец-то преодолело 10%-ный барьер. Событие запустило обратный отсчет: по правилам у остальных игроков оставалось 30 суток, чтобы предложить что-то лучше. Страсти накалялись, конкурсанты судорожно допиливали свои методы, пытаясь обскакать друг друга. Ко времени крайнего срока произошло то, что мы описали в первом абзаце. The Ensemble на финише выбился в лидеры. Но это только на публичном наборе. Когда открылись результаты на приватной части, выяснилось, что показатели метрики качества обоих претендентов совпали с точностью до четырех знаков после запятой (RMSE = 0.8567)! Организаторы вручили венок триумфатора тем, кто отправил заявку раньше — BellKor. Второму месту не досталось ни цента. Поистине драматическая развязка.
Ирония в том, что алгоритмы топов лидерборда так и не были внедрены в продакшн, оказавшись чересчур сложными. К тому же произошел переход от DVD к стримингу, где предпочтения пользователей отслеживаются по-другому. Тем не менее соревнование фантастически повлияло на мир айти. Научное сообщество познакомилось с реальной биг-датой. Были протестированы нестандартные техники, в том числе нейросети. Под впечатлением от конкурса возник Kaggle.
Сегодня ИИ интегрирован в нашу повседневность. Машинное обучение нужно вам как воздух, и вы тоже нужны машинному обучению с новыми мыслями. Уже завтра стартует бластимовский курс по ML, который может стать для вас лично таким же поворотным, как когда-то был Netflix Prize для человечества. Не упустите возможность!