Пособие по журналистике данных

Текст добавлен: 26 сентября 2016, 16:16

Текст книги "Пособие по журналистике данных"

Автор книги: Д. Грей

Жанр:

Справочники

сообщить о нарушении

Текущая страница: 14 (всего у книги 21 страниц)

Назад к карточке книги

Сеть как источник данных

Как можно узнать больше о том, что существует только в Интернете? Будь то адрес электронной почты, веб–сайт, изображение или статья в Википедии – в данной главе я расскажу вам об инструментах, которые помогут вам получить больше информации об этих элементах.

Веб–инструменты

Для начала назовем некоторые сервисы, с помощью которых можно узнать больше информации о веб–сайтах в целом.

Whois

Если вы посетите сайт whois.domaintools.com(или просто введете whois www.example.comв приложении Terminal.app, если вы работаете на компьютере Mac), вы получите базовую регистрационную информацию практически о любом сайте. В последние годы некоторые владельцы выбирают «приватную» регистрацию, которая не позволяет просматривать их данные, однако в большинстве случаев вы увидите имя, адрес, электронную почту и номер телефона лица, зарегистрировавшего сайт. Вы также можете ввести цифровой IP–адрес и получить данные об организации или физическом лице, являющихся владельцами этого сервера. Это особенно удобно, когда вы пытаетесь получить больше информации о лицах, которые, например, нарушают условия пользования каким–либо сервисом, так как большая часть веб–сайтов регистрирует IP–адрес своих посетителей.

Blekko

Поисковый движок Blekkoпредлагает необычно большой объем информации о внутренней статистике, которую он собирает в Интернете. Если вы введете доменное имя, и дополните его сочетанием «/seo», вы получите страницу с информацией об этом адресе. В первой табличке на Рис 57показано, какие другие сайты ссылаются на данный домен (в порядке популярности). Это может оказаться полезным, когда вы хотите понять, какое освещение получает сайт, и если вы хотите понять, почему он занимает высокие места в результатах поиска Google, так как эти результаты основываются именно на этих ведущих на сайт ссылках. Рис 59показывает, какие другие сайты размещаются на той же машине. Мошенники и спамеры нередко придают законный вид своей деятельности, создавая многочисленные сайты, которые ссылаются друг на друга. Внешне они выглядят как независимые домены и могут даже иметь разные регистрационные данные, однако зачастую они размещаются на одном и том же сервере, так как это значительно дешевле. Эта статистика позволит вам заглянуть внутрь скрытой бизнес–структуры исследуемого вами сайта.

Рис 57. The Blekko search engine (Blekko.com)

Рис 58. Understanding web popularity: who links to who? The other handy tab is »Crawl stats», especially the »Cohosted with» section. (Blekko.com)

Рис 59. Spotting web spammers and scammers (Blekko.com)

Compete.com

Ресурс Compete.comзанимающийся опросом мнений американских потребителей, составляет подробную статистику использования большого количества сайтов, и некоторые из основных данных предоставляются бесплатно. Выберите вкладку «Site Profile» и введите доменное имя ( Рис 60). В результате вы увидите график трафика сайта за последний год, данные о количестве посетителей и частоте посещений (см. Рис 61). Так как в основе получаемых данных лежат опросы, эти данные являются приблизительными, однако, когда у меня появлялась возможность сравнить их с внутренними аналитическими данными, я понимал, что они являются довольно точными. В частности, их можно принимать во внимание при сравнении между собой двух сайтов, т. к., несмотря на отсутствие абсолютных цифр для этих сайтов, они хорошо показывают относительную разницу в их популярности. Данный ресурс исследует только американских потребителей, поэтому данные по большей части иностранных сайтов будут довольно бедными.

Рис 60. Compete.com’s site profile service (Compete.com)

Рис 61. What’s in vogue? What’s in demand?: hotspots on the web (Compete.com)

Google’s Site Search

Функция, которая может оказаться чрезвычайно полезной, когда вы хотите исследовать содержание какого–либо конкретного домена – это ключевое слово «site:». Если вы добавите фразу «site:example.com» к вашему поисковому запросу, Google покажет только те результаты, которые находятся на указанном вами сайте. Вы можете еще больше сузить запрос, указывая префикс тех страниц, которые вас интересуют, например, «site:example.com/pages/», в результате чего вам будут показаны, отвечающие этому конкретному запросу. Это может оказаться полезным при поиске информации, которая находится в открытом доступе, но которая не рекламируется владельцами домена, поэтому выбор правильных ключевых слов может привести к обнаружению очень важной для вас информации.

Веб–страницы, изображения и видео

Иногда у вас может возникнуть желание исследовать активность, связанную с отдельным материалом, а не со всем веб–сайтом. Описанные далее инструменты помогут вам под разными углами посмотреть на то, как люди читают, комментируют, копируют и делятся контентом в Интернете.

Bit.ly

Я всегда пользуюсь bit.ly, когда я хочу узнать, как люди делятся друг с другом какой–то конкретной ссылкой. Чтобы воспользоваться сервисом, введите интересующий вас URL–адрес и щелкните по ссылке «Info Page+». В результате вы перейдете на страницу с полной статистикой (хотя вам может понадобиться нажать сначала «aggregrate bit.ly link», если вы зарегистрированы в этом сервисе). Вы сможете понять, насколько популярной является страница, включая ее обсуждение в Facebook и Twitter, а ниже вы увидите разговоры об этой ссылке, предоставленные сервисом backtype.com. Это сочетание данных о трафике и разговоров бывает весьма полезным, когда необходимо понять причины популярности сайта или страницы, а также узнать, кем именно являются их фанаты. Например, благодаря этим данным я получил весомые доказательства того, что преобладающие комментарии относительно низов и Сары Пэйлин были ошибочны.

Twitter

С бурным ростом популярности сервиса микроблогов он становится все более полезным в качестве показателя того, как люди делятся тем или иным контентом и что они о нем говорят. Получить результаты обсуждений какой–либо ссылки подозрительно легко. Вы просто вставляете интересующую вас ссылку в строку поиска, после чего вам может понадобиться только нажать «more tweets» (больше твитов), чтобы получить полный список результатов.

Кэш поисковика Google

Если страница становится причиной недовольства или конфликтов, издатель может решить удалить или изменить ее без признания данного факта. Если вы подозреваете, что происходит именно это, то прежде всего необходимо обратиться к кэшу Google, в котором эта страница хранится с момента последнего обхода Интернета поисковиком. Частота обходов постоянно возрастает, поэтому больше всего шансов получить желаемое будет в течение нескольких часов после предполагаемых изменений. Введите нужный URL в строку поиска, затем нажмите двойную стрелку, появляющуюся справа от результата для данной страницы. Появится окно предварительного просмотра, над которым, если вам повезет, будет ссылка «Сохраненная копия». Щелкните по ней, чтобы посмотреть сделанный поисковиком Google снимок страницы. Если вы сталкиваетесь с проблемами при загрузке, вы можете переключиться на более простую текстовую страницу, щелкнув по соответствующей ссылке вверху сохраненной страницы. Рекомендуется сделать скриншот или скопировать нужный вам контент, т. к. содержание кэша может измениться в любой момент в результате создания новых копий после очередного обхода.

Веб–сервис «Машина прошлого» проекта Архив Интернета

Если вы хотите знать, как изменялась конкретная страница на протяжении длительного периода времени, например, на протяжении месяцев или лет, вы можете воспользоваться веб–сервисом The Wayback Machine(Машина прошлого) проекта Internet Archive (Архив Интернета), который с определенной периодичностью делает снимки наиболее популярных страниц сети. Вы идете на сайт проекта, вводите адрес, который вы хотите изучить, и если в системе хранятся копии этой страницы, то вам будет показан календарь, на котором вы сможете выбрать нужный вам период времени. После этого вам будет показано, как выглядела страница в тот момент. Зачастую на страницах будут отсутствовать элементы стиля или изображения, однако и остального бывает вполне достаточно, чтобы понять, каков был основной контент страницы в прошлом.

Просмотр исходного кода

Это может отнять много времени, однако разработчики нередко оставляют комментарии или другую информацию в HTML–коде страницы. В любом браузере, пусть и в разных местах меню, имеется функция просмотра исходного кода, которая позволяет просматривать HTML–код. Вам не обязательно понимать, что означают машиночитаемые участки кода, просто просматривайте куски текста, которые нередко бывают раскиданы между ними Даже если это просто уведомления об авторском праве или имена разработчиков, эта информация может дать важные подсказки о создании и предназначении страницы.

TinEye

Иногда вам может понадобиться информация об источнике изображения, однако без сопроводительного текста такую информацию бывает трудно добыть с помощью традиционных поисковых движков, таких, как, например, Google. Сервис TinEyeосуществляет «обратный поиск изображений», т. е. вы предоставляете изображение, а он находит в Интернете другие изображения, похожие на предоставленное вами. Т. к. в процессе сравнивания используется распознавание изображений, результат можно получить, даже если копия была обрезана, деформирована или сжата. Этот сервис может оказаться очень полезным, если вы подозреваете, что изображение, которое выдается как оригинальное или новое, таковым не является, кроме того, этот сервис может привести вас к реальному источнику изображения.

YouTube

Щелкнув значок «Статистика» в нижнем правом углу любого видео, вы получите богатый набор информации об аудитории этого видео на протяжении определенного времени. Несмотря на то, что предоставляемая информация не является полной, она может оказаться полезной для понимания состава зрителей, того, откуда и когда они приходят.

Адреса электронной почты

При изучении адресов электронной почты вам зачастую хочется узнать больше о личности и местоположении отправителя. Хороших готовых инструментов для этого не существует, однако очень полезно обладать базовыми знаниями о скрытых заголовках, входящих в состав каждого электронного письма. Они работают как почтовые марки и могут раскрыть неожиданный объем информации об отправителе. В частности, они часто включают в себя IP–адрес компьютера, с которого было отправлено письмо, что напоминает функцию определителя номера в телефонном аппарате. Вы можете изучить этот адрес с помощью сервиса whois, чтобы найти информацию об организации, которой принадлежит этот компьютер. Если окажется, что владельцем является какой–нибудь крупный интернет–провайдер вроде Comcast или AT&T, вы можете посетить ресурс MaxMind, чтобы узнать приблизительное местоположение этого адреса. Чтобы посмотреть эти заголовки в Gmail, откройте письмо, затем откройте меню рядом с кнопкой «Ответить» в верхнем правом углу и выберите «Показать оригинал». Откроется новая страница, на которой будет показано скрытое содержимое. В начале письма будет пара десятков строк, представляющих собой слова с двоеточиями. Нужный вам IP–адрес может находиться где–то среди них, однако его название будет зависеть от того, откуда было отправлено это электронное письмо. Если оно было отправлено с Hotmail, имя будет выглядеть как «X–Originating–IP:», но если оно было отправлено из Outlook или Yahoo, имя будет находиться в первой строке и начинаться со слова «Received:». Проверка адреса с помощью сервиса whois показала, что он принадлежит компании Virgin Media, интернет–провайдеру из Великобритании, а после проверки с помощью сервиса геолокации MaxMind я выяснил, что письмо было отправлено из моего родного города Кембридж. Т. е. я небезосновательно могу быть уверенным в том, что это письмо было отправлено моими родителями, а не какими–нибудь самозванцами!

Тенденции

Если вы ведете расследование по какой–то широкой теме, а не по отдельному сайту или статье, вам может пригодиться пара инструментов.

Трафик статей Википедии

Если вы хотите знать, как менялся со временем общественный интерес к лицу или какой–то теме, на сайте stats.grok.se/вы можете получить данные о просмотре любой из страниц Википедии день за днем. Этот сайт немного сыроват и не доделан, однако он позволит вам получить необходимую информацию, приложив лишь толику усилий. Введите интересующее вас имя, чтобы получить информацию о месячном трафике этой страницы. Там будет график, показывающий, сколько раз в день просматривали данную страницу на протяжении выбранного месяца. К сожалению, за один раз вы можете посмотреть данные только за один месяц, поэтому, чтобы отследить более долгосрочные изменения, вам будет нужно выбрать новый месяц и задать новый поиск.

Сведения о поиске в Google

Вы можете получить ясное представление о поисковых предпочтениях пользователей с помощью сервиса Insights from Google. Введите пару распространенных поисковых фраз, например, «Justin Bieber» и «Lady Gaga», и вы увидите график, отображающий количество поисков на временной шкале. Сервис предлагает различные варианты представления данных, позволяет просматривать их по регионам или получать больше данных по тому или иному периоду. Единственный недостаток – отсутствие абсолютных показателей, вы получаете только относительные значения в процентах, которые бывает сложно интерпретировать.

Рис 62. Google Insights (Google)

– Пит Уорден, независимый разработчик и аналитик данных.

Краудсорсинг данных на сервисе guardian datablog

Краудсорсинг, согласно Википедии – это «распределенный процесс решения производственных задач, который предусматривает передачу этих задач для решения широкой общественности». Далее предлагаем вам информацию, полученную в ходе интервью, взятого у Саймона Роджерса, на тему о том, как сервис Datablog газеты Guardian использовал краудсорсинг для освещения скандала, связанного с расходами членов парламента, проблемы употребления наркотиков и темы документов Сары Пэйлин.

Рис 63. A redacted copy of Stephen Pound’s incidental expenses (The Guardian)

Может случиться так, что у вас окажется огромное количество файлов, статистических документов и отчетов, которые просто невозможно обработать в одиночку. Или имеющиеся у вас материалы не открываются или имеют не тот формат, и вы ничего не можете с этим поделать. В таких ситуациях вам может помочь краудсорсинг.

У Guardian есть очень много читателей, очень много пар глаз. Если у нас есть интересный проект, по которому нам необходима помощь, то мы можем за ней обратиться. Именно это мы и сделали в деле о расходах членов парламента. У нас было 45 000 документов и очень мало времени. Наилучшим вариантом было привлечение к данной задаче наших читателей.

В результате мы получили огромное количество материалов по этому проекту. Статей было больше, чем данных. Проект оказался очень успешным с точки зрения трафика. Он очень понравился читателям.

В настоящее время мы вместе с ресурсом MixMag изучаем проблему употребления наркотиков, что также приносит феноменальные результаты. Этот проект по количеству принявших в нем участие людей превосходит даже исследование преступности в Великобритании, что само по себе просто замечательно.

Объединяет эти проекты то, что они посвящены вопросам, которые действительно волнуют людей, и поэтому люди действительно готовы тратить на них время. Краудсорсинг в значительной мере зависит от помощи одержимых людей. В проекте по расходам парламентариям был огромный прирост трафика вначале, который потом сошел на нет. Однако до сих пор люди настойчиво просматривают каждую страницу в поисках фактов и материалов для статей. Один человек просмотрел 30 000 страниц материалов. Они обладают теперь огромной информацией.

Также мы прибегли к краудсорсингу в проекте с бумагами Сары Пэйлин. И читатели снова оказали нам большую помощь в поиске материалов для статей.

С точки зрения сбора информации для статей краудсорсинг нам очень помог. Читателям это нравится, и Guardian «хорошо выглядит» в их глазах. Что же касается генерирования данных, то в этой области не так активно пользовались краудсорсингом.

Некоторые из наших краудсорсинговых проектов, показавших хорошие результаты, больше походили на старые добрые опросы. Когда вы спрашиваете людей об их опыте, об их жизни, о том, чего они добились, вы получаете реальные данные, т. к. люди не склонны их приукрашивать. Они расскажут вам то, как у них обстоят дела на самом деле. Если же вы просите людей проделать за вас вашу работу, то вы должны найти таких людей, которые предоставят вам данные, которым вы сможете доверять.

Что касается надежности данных, то, я считаю, очень хороший подход применяет проект Old WeatherОни предлагают обрабатывать каждый элемент данных десяти людям, что позволяет обеспечить требуемую точность. В деле о расходах членов парламента мы пытались минимизировать риск того, что они отредактируют свои собственные отчеты в сети, чтобы выглядеть лучше. Однако обеспечить постоянную защиту от этого невозможно. Вы можете только искать определенные URL–адреса или смотреть, совершаются ли исправления из района Лондона SW1. Это довольно ненадежный способ. Данным, которые мы получали, не всегда можно было доверять. Несмотря на то, что у нас получились замечательные материалы, мы не получали в ходе проекта какие–то конкретные цифры, которые мы могли бы использовать.

Если бы я был должен дать совет журналистам, работающим в сфере данных, которые хотят использовать краудсорсинг для сбора данных, я бы рекомендовал им выбрать тему, которая действительно волнует людей и которая будет продолжать волновать их даже после того, как она сойдет с первых страниц газет. Так же можно устроить что–то вроде игры – это тоже хорошо помогает привлекать людей. Когда мы занимались проектом о расходах во второй раз, мы сделали его похожим на игру, в которой люди получали индивидуальные задания. То, что мы давали людям конкретные задачи, действительно помогло нам. Ведь когда вы просто даете людям горы информации и говорите им: «давайте, обработайте ее», то вы ставите перед ними трудную и в какой–то мере неблагодарную задачу. И поэтому, я считаю, очень важно превратить эту работу в развлечение или игру.

– Интервью Саймона Роджерса, журналиста Guardian, Марианне Баучарт, блог «Data Journalism»

Как сервис datablog использовал краудсорсинг для освещения темы распространения билетов на олимпийские игры

Рис 64. How many Olympic tickets did you get?: the readers' results (The Guardian)

Я думаю, что краудсорсинговым проектом, получившим наибольший отклик, был проект о распространении Олимпийских билетов. Тысячи жителей Великобритании пытались купить билеты на Олимпиаду 2012 года, и было очень много недовольства тем, что им не удалось это сделать. Люди размещали заказы на сотни фунтов стерлингов, и получали ответ, что им ничего не достанется. Но было непонятно – может быть, это просто были громкие жалобы нескольких человек, в то время как основная масса людей была всем довольна? Поэтому мы попробовали найти способ выяснить это.

Мы решили, что лучшее, что мы можем сделать в отсутствие каких–либо достоверных данных, это спросить людей. И мы считали, что мы должны будем с осторожностью относиться к результатам, так данная выборка респондентов не являлась сбалансированной.

Мы создали форму на сайте Google и наполнили ее вполне конкретными вопросам. Форма получилась действительно длинной, мы спрашивали, на какие суммы люди заказывали билеты, сколько в результате списывали с их кредитных карт, на какие соревнования они планировали пойти и т. д.

Мы разместили эту форму в виде небольшой картинки на главной странице сайта, и она очень быстро распространилась среди читателей. Важный момент здесь, я считаю, заключается в том, чтобы вы думали не только о том, «что мне необходимо знать для написания моей статьи», но и о том, «что люди хотят рассказать мне в данный момент». Только тогда, когда вы поймете, что люди хотят вам рассказать, вы сможете успешно применить краудсорсинг. Объем ответов, полученных в ходе данного проекта (который был одной из первых наших попыток краудсорсинга), был огромен. Мы получили тысячу ответов менее, чем за час, к концу дня количество ответов достигло семи тысяч.

Вполне понятно, что после этого мы стали более серьезно относиться к результатам. Изначально мы не предполагали, что получим так много ответов. Поэтому мы приняли для себя несколько оговорок: читатели Guardian могут быть более состоятельными, чем другие люди, лица, получившие меньше, чем они рассчитывали, будут более охотно общаться с нами, и т.д.

Мы не знали, какую ценность будут иметь результаты нашего проекта. В итоге мы получили семь тысяч ответов для нашего проекта, и мы выяснили, что около половины людей, запрашивавших билеты, ничего не получили. Мы изучили все полученные отклики, и, так как их было очень много, результаты представляли большой интерес.

Через несколько недель вышел официальный отчет, и наши данные были до невероятности близки к его цифрам. Они практически полностью совпадали с ними. Конечно, в этом была доля везения, однако сыграл свою роль и тот факт, что нам ответили столько много людей.

Если вы будете спрашивать читателей о подобных вещах в ленте комментариев, то вы будете ограничены в применении результатов. Поэтому следует подумать: «Какой инструмент лучше выбрать, чтобы получить нужную информацию?» Ленту комментариев? Или разработать приложение? И если вы решите разработать приложение, следует подумать, «Есть ли смысл тратить время на разработку? Оправдает ли оно затраченные на его разработку ресурсы?»

В данном случае мы сделали выбор в пользу форм на Google (Google Forms). Когда кто–то заполняет форму, вы видите результаты в виде строки таблицы. Т. е. даже если эта таблица еще пополняется, даже если ответы все еще продолжают поступать, вы все равно можете открыть ее и увидеть все имеющиеся на данный момент результаты.

Я мог попробовать проделать всю работу в Google, но я решил скачать их в Microsoft Excel и после этого отсортировать по возрастанию, чтобы найти ответы, в которых люди написали числа прописью, и исправить их. Я решил постараться исключать как можно меньше вариантов. Поэтому вместо того, чтобы принимать только действительные ответы, я пытался исправлять остальные. Люди использовали иностранные валюты, и я переводил их в фунты стерлингов, что было довольно утомительно.

Однако в целом анализ занял всего несколько часов, и в итоге я отмел все очевидно неуместные ответы. Многие люди решили заполнить форму, отметив при этом, что они ничего не платили за билеты. Забавно, но ладно. Таких оказалось менее сотни из более чем семи тысяч респондентов.

Несколько десятков человек написали откровенно большие суммы в попытке исказить результаты. Например, десять миллионов фунтов стерлингов. Оставшийся набор ответов я мог обрабатывать, исходя из обычных принципов работы с данными. Я сделал так называемую сводную таблицу. Я вывел средние значения. И т. д.

Мы не знали, какой ход наберет этот проект, поэтому над ним работали только я и редактор спортивного блога. Мы сели, подумали и решили, что этот проект может оказаться интересным. На весь проект, от начала до конца, у нас ушло 24 часа. У нас появилась идея, мы поразмышляли над ней за обедом, мы разместили форму на сайте, мы увидели, что идея пользуется популярностью, мы продержали форму на сайте до конца дня и на следующее утро поместили в сети ее результаты.

Выбор в пользу сервиса Google Docs был сделан потому, что он позволяет полностью контролировать результаты. Мне не пришлось пользоваться каким–то сторонними аналитическими инструментами. Я мог с легкостью поместить результаты в базу данных или в таблицу. Когда вы используете специальное программное обеспечение для опросов общественного мнения, вы зачастую можете использовать только предусмотренные им инструменты. Если бы информация, которую мы хотели собрать, требовала какого–то деликатного обращения, то мы могли бы не прибегать к сервисам Google и попробовать справиться со всем своими собственными силами. А в целом оказалось очень просто разместить форму Google Form на странице Guardian, при этом пользователю было практически не видно, что именно мы используем. Так что это оказалось очень удобно.

В качестве совета журналистам, работающим в сфере данных, которые хотят использовать краудсорсинг: вы должны очень точно знать, какую информацию вы хотите получить. Задавайте вопросы, которые могут иметь очень большое количество разных ответов. Попробуйте понять демографию аудитории, к которой вы обращаетесь, чтобы понять, не является ли ваша выборка предвзятой. Если вы спрашиваете о суммах и других подобных вещах, попробуйте указать, что ответ должен быть в цифрах, что пользователи должны использовать определенную валюту т. п. Многие все равно не выполнят эти указания, но чем больше вы регламентируете этот процесс, тем будет лучше. И всегда, всегда добавляйте поле для комментариев, так как большое количество людей заполнят поля опроса, но при этом им очень хочется довести до вас свое мнение по данному вопросу. Особенно если речь идет о нарушениях прав потребителей или произволе.

– Интервью Джеймса Болла, журналиста Guardian, Марианне Баучарт, блог «Data Journalism»

Назад к карточке книги "Пособие по журналистике данных"