BIG DATA. Вся технология в одной книге. Андреас ВайгендЧитать онлайн книгу.
поисковых роботов, и эти визиты надо идентифицировать и отделить от посещений людей (если, конечно, обработку данных не проводят с целью оптимизации роботов).
Существует также искушение разделять пользователей на экспериментальные и контрольные группы по каким-то признакам, а не произвольно. Однако, каким бы разумным это ни выглядело на первый взгляд, большинство неслучайных способов выборки искажают результаты экспериментов и загрязняют аналитику. Например, если пользователь часто удаляет со своего компьютера cookie-файлы, его могут отнести к одной группе во время первого визита на сайт и к другой во время следующего. В некоторых экспериментах отнесение к той или иной группе коррелирует с сайтом, на котором был пользователь, прежде чем попасть на экспериментальную или контрольную страницу. Действительно ли люди более склонны кликать рекламу зонтиков на сайте WeatherChannel, где постоянно предупреждают о грядущих ураганах? Если выборки делались не по принципу случайности, результаты окажутся искаженными.
Кроме того, ученые стараются учитывать переменные, которые могут влиять на поведение пользователя, но не включены в эксперимент. Результаты эксперимента могут быть искажены багом, который появился в версии программного обеспечения, предложенной одной группе, но отсутствует во всех остальных. Проблемой могут быть и особенности работы программного обеспечения на различных платформах. Люди, использующие для доступа в сеть айфоны, и люди, использующие для этого телефоны на Андроиде, не являются равномерно распределенными и не зависимыми друг от друга группами населения. По результатам эксперимента может казаться, что на сайт чаще заходят пользователи с айфонами, но на самом деле различались не клиентские базы, а программное обеспечение – частота обновления страниц по умолчанию в айфонах выше. Придумывать такого рода версии и расследовать их – ежедневная работа детективов мира данных.
Компании экспериментировали на потребителе, предлагая новые товары или упаковки, задолго до появления интернета. Новизна состоит в возможности экспериментировать в режиме реального времени и моментально получать обратную связь, которая может быть использована для совершенствования продуктов и услуг, в том числе информационных. В прошлом цикл «идея – результат» измерялся месяцами. Теперь же, в мире с выходом в интернет, его продолжительность сократилась до минут. Это в корне отличается от временных параметров медицинских исследований, где эффекты от изменения рецептуры лекарства могут проявляться через недели, месяцы, годы, а то и десятилетия.
По мере дальнейшей интеграции социальных данных в процессы решения проблем и принятия решений обычными людьми инфопереработка будет создавать продукты и услуги в таких важнейших областях человеческой жизни, как здравоохранение и образование. Нам как обществу нужно будет решать, какие эксперименты с социальными данными желательны и каким результатам мы можем доверять. Когда достаточно данных, собранных за