Читаем Наука о данных. Базовый курс полностью

Поскольку современные люди взаимодействуют и живут в технически развитом обществе, они неизбежно оставляют цифровые следы. Повсеместное внедрение видеонаблюдения означает, что данные о человеке могут собираться в любое время и где бы он ни был — на улице, в магазине, на парковке, не говоря уже о возможности отслеживания мобильных телефонов. Реальные примеры сбора данных включают учет покупок по кредитным картам, использование схем лояльности в супермаркетах, снятие наличных в банкоматах, звонки по мобильному телефону и проч. В интернете данные о людях собираются, когда они посещают сайты или входят в систему, отправляют электронную почту, совершают онлайн-покупки, назначают даты, посещают ресторан или магазин, пользуются устройством для чтения электронных книг, смотрят лекцию на открытых онлайн-курсах или публикуют что-то в социальной сети. Чтобы можно было составить представление об объеме данных, собираемых в среднем на одного человека, отметим, что, согласно отчету голландского управления по защите данных за 2009 г., среднестатистический гражданин Нидерландов был включен в 250–500 различных баз, а для более социально активных людей этот показатель достигает 1000{38}. Собранные вместе точечные данные и определяют цифровой след человека.

Персональные данные собираются двумя способами, и оба являются проблематичными с точки зрения конфиденциальности. Во-первых, данные могут собираться без ведома человека. Во-вторых, даже если человек решил оставить свои данные или мнение, он не может знать, как они будут использованы, будут ли переданы третьим сторонам и каким образом. Термины «цифровая тень» и «цифровой след» используются для различения этих двух типов сбора данных: цифровая тень — это данные, собранные о человеке без его ведома, согласия или осведомленности, а цифровой след состоит из данных, сознательно опубликованных человеком{39}

.

Сбор персональных данных без ведома или согласия, конечно, вызывает беспокойство. Но не стоит забывать и того, что мощь современных методов выявления закономерностей в сочетании с интеграцией и многократным использованием данных из нескольких источников означает, что даже собранные с ведома и согласия человека они могут иметь для него негативные и непредсказуемые последствия. Эти методы науки о данных способны на основе открытой информации, которую мы охотно публикуем, например, в социальных сетях, вывести другую информацию, сугубо личную, которой мы делиться не планировали. Например, многие пользователи Facebook ставят лайки просто потому, что хотят продемонстрировать поддержку своим друзьям. Тем не менее, используя эти данные, модели, разработанные для Facebook, могут довольно точно предсказывать сексуальную ориентацию, политические и религиозные взгляды человека, умственные способности, особенности личности, склонность к употреблению вызывающих привыкание веществ, таких как алкоголь, наркотики и сигареты, и даже то, например, оставались ли вместе его родители до его совершеннолетия{40}. Среди неконтекстных связей, установленных этими моделями, встречаются, например, поддержка кампании за права человека как предиктор гомосексуальности (и для мужчин, и для женщин) или симпатия к бренду Honda как вероятный признак того, что человек не курит{41}

.

Вычислительные методы сохранения конфиденциальности

В последние годы растет интерес к вычислительным методам сохранения конфиденциальности на протяжении всего процесса анализа данных. Наиболее известны два из этих методов: дифференциальная приватность

и федеративное машинное обучение.

Дифференциальная приватность — это математический метод получения полезной информации о населении, без изучения отдельных людей. Дифференциальная приватность использует узкое определение конфиденциальности, когда та не считается нарушенной включением персональных данных в процесс анализа, если выводы, сделанные в результате этого анализа, совпадают с выводами, сделанными без включения данных отдельных лиц. Существует ряд процессов, реализующих дифференциальную приватность. В их основе лежит идея добавления шума либо на этапе сбора данных, либо в ответы на запросы к базе данных. Шум защищает конфиденциальность отдельных лиц, но может быть удален из данных на агрегированном уровне так, чтобы можно было рассчитать полезную статистику по населению в целом. Хорошим примером введения шума в данные является метод случайного ответа. Например, при анкетировании респондентам предлагается ответить «Да» или «Нет» на деликатный вопрос (касающийся нарушения закона, состояния здоровья и т. д.), используя следующую процедуру:

1. Подбросьте монету и держите результат в секрете.

2. Если выпал орел, отвечайте «Да».

3. Если выпала решка, отвечайте правдиво.

Перейти на страницу:

Похожие книги

C++ Primer Plus
C++ Primer Plus

C++ Primer Plus is a carefully crafted, complete tutorial on one of the most significant and widely used programming languages today. An accessible and easy-to-use self-study guide, this book is appropriate for both serious students of programming as well as developers already proficient in other languages.The sixth edition of C++ Primer Plus has been updated and expanded to cover the latest developments in C++, including a detailed look at the new C++11 standard.Author and educator Stephen Prata has created an introduction to C++ that is instructive, clear, and insightful. Fundamental programming concepts are explained along with details of the C++ language. Many short, practical examples illustrate just one or two concepts at a time, encouraging readers to master new topics by immediately putting them to use.Review questions and programming exercises at the end of each chapter help readers zero in on the most critical information and digest the most difficult concepts.In C++ Primer Plus, you'll find depth, breadth, and a variety of teaching techniques and tools to enhance your learning:• A new detailed chapter on the changes and additional capabilities introduced in the C++11 standard• Complete, integrated discussion of both basic C language and additional C++ features• Clear guidance about when and why to use a feature• Hands-on learning with concise and simple examples that develop your understanding a concept or two at a time• Hundreds of practical sample programs• Review questions and programming exercises at the end of each chapter to test your understanding• Coverage of generic C++ gives you the greatest possible flexibility• Teaches the ISO standard, including discussions of templates, the Standard Template Library, the string class, exceptions, RTTI, and namespaces

Стивен Прата

Программирование, программы, базы данных
Разработка приложений в среде Linux. Второе издание
Разработка приложений в среде Linux. Второе издание

Книга известных профессионалов в области разработки коммерческих приложений в Linux представляет СЃРѕР±РѕР№ отличный справочник для широкого круга программистов в Linux, а также тех разработчиков на языке С, которые перешли в среду Linux из РґСЂСѓРіРёС… операционных систем. РџРѕРґСЂРѕР±но рассматриваются концепции, лежащие в основе процесса создания системных приложений, а также разнообразные доступные инструменты и библиотеки. Среди рассматриваемых в книге вопросов можно выделить анализ особенностей применения лицензий GNU, использование СЃРІРѕР±одно распространяемых компиляторов и библиотек, системное программирование для Linux, а также написание и отладка собственных переносимых библиотек. Р

Майкл К. Джонсон , Эрик В. Троан

Программирование, программы, базы данных
3ds Max 2008
3ds Max 2008

Одни уверены, что нет лучшего способа обучения 3ds Мах, чем прочитать хорошую книгу. Другие склоняются к тому, что эффективнее учиться у преподавателя, который показывает, что и как нужно делать. Данное издание объединяет оба подхода. Его цель – сделать освоение 3ds Мах 2008 максимально быстрым и результативным. Часто после изучения книги у читателя возникают вопросы, почему не получился тот или иной пример. Видеокурс – это гарантия, что такие вопросы не возникнут: ведь автор не только рассказывает, но и показывает, как нужно работать в 3ds Мах.В отличие от большинства интерактивных курсов, где работа в 3ds Мах иллюстрируется на кубиках-шариках, данный видеокурс полностью практический. Все приемы работы с инструментами 3ds Мах 2008 показаны на конкретных примерах, благодаря чему после просмотра курса читатель сможет самостоятельно выполнять даже сложные проекты.

Владимир Антонович Верстак , Владимир Верстак

Программирование, программы, базы данных / Программное обеспечение / Книги по IT