Большие данные. Big Data. Учебник для вузов
Краткое содержаниеВ учебнике излагается содержание курса по дисциплине «Теория информационных процессов и систем», а также дополнительные материалы по дисциплинам «Системы поддержки принятия решений» и «Технологии интеллектуального анализа данных» по направлению «Информационные системы и технологии», в том числе профиля «Информационные технологии на транспорте» в соответствии с ФГОС 3++. Рассмотрены основные аспекты работы с большими данными, методы и технологии «Big Data» и «Data Mining», а также общие приемы интеллектуального анализа данных. В качестве инструментальной среды разработки используется интегрированный пакет MatLab версий 6.5 и выше. Учебник предназначен для формирования у студентов компетенций в соответствии с рабочей программой дисциплины «Теория информационных процессов и систем». Материалы учебника также могут быть использованы студентами, магистрантами и аспирантами других инженерно-технических специальностей, желающими самостоятельно изучить вопросы анализа больших данных.
Краткое содержание
Основы концепции больших данных
Учебник А. Е. Журавлева начинается с фундаментального определения понятия "Big Data". Автор подчёркивает, что большие данные — это не просто объём информации, а комплексный феномен, включающий пять ключевых характеристик: объём (Volume), скорость обработки (Velocity), разнообразие форматов (Variety), достоверность (Veracity) и ценность (Value). Каждый аспект раскрывается через примеры из реальных кейсов — от анализа социальных сетей до обработки сигналов IoT-устройств. Особое внимание уделяется эволюции концепции: от первых баз данных 1980-х до современных распределённых систем, способных обрабатывать эксабайты информации в реальном времени.
Технологическая инфраструктура
Журавлев детализирует архитектуру экосистемы Big Data, проводя параллели между классическими и инновационными подходами. Центральное место занимает объяснение Hadoop как ядра экосистемы: структура HDFS, принципы MapReduce и YARN разбираются на уровне взаимодействия между узлами кластера. Отдельная глава посвящена инструментам потоковой обработки данных — Apache Kafka и Apache Flink, с акцентом на их роли в конвейерах реального времени. Автор противопоставляет реляционные СУБД и NoSQL-решения (MongoDB, Cassandra), иллюстрируя выбор технологии под конкретные задачи — от транзакционных операций до горизонтального масштабирования.
Методы анализа и машинное обучение
В разделе о аналитических методах учебник переходит от теории к практике. Журавлев систематизирует подходы к обработке данных: описательная аналитика (Dashboards, SQL-агрегации), прогнозная аналитика (регрессионные модели, нейронные сети) и предписывающая аналитика (оптимизационные алгоритмы). Подробно разбирается процесс построения ML-моделей: от feature engineering и выбора метрик (Precision, Recall, F1-Score) до валидации через кросс-валидацию и A/B-тестирование. Кейс по распознаванию изображений в медицинской диагностике демонстрирует этапы работы с сверточными сетями — от нормализации данных до интерпретации результатов.
Проблемы этики и безопасности
Автор не обходит стороной острые вопросы цифровой эпохи. Глава о этических дилеммах Big Data построена вокруг концепции "цифрового следа" — сбора персональных данных без явного согласия пользователей. Журавлев анализирует GDPR и другие регуляторные框架, подчёркивая конфликт между инновациями и приватностью. Примеры утечек данных из соцсетей и кейс Cambridge Analytica служат иллюстрацией рисков злоупотребления аналитическими инструментами. Отдельный раздел посвящён методам анонимизации — дифференциальной приватности и токенизации, с объяснением математических основ и ограничений каждого подхода.
Прикладные области применения
Практическая ценность учебника раскрывается в главах о применении Big Data в различных отраслях. В ритейле разбирается система динамического ценообразования Amazon, где сочетаются потоковая обработка данных о спросе и ML-прогнозирование. В здравоохранении акцент сделан на предиктивной аналитике — предсказании эпидемий через анализ поисковых запросов и данных носимых устройств. Транспортный сектор представлен кейсом умных городов: оптимизация маршрутов общественного транспорта в Сингапуре с использованием графовых баз данных и reinforcement learning.
Инструменты визуализации и интерпретации
Журавлев подчёркивает: даже совершенная модель бесполезна без корректной визуализации. В учебнике сравниваются библиотеки Matplotlib, Seaborn и Plotly для статических отчётов, а также Tableau и Power BI для интерактивных дашбордов. На примере геоаналитики демонстрируется работа с Kepler.gl для картографической визуализации потоков данных. Особое внимание уделяется storytelling — методикам презентации результатов не техническим специалистам через нарративы и интерактивные сценарии.
Архитектура data-driven компаний
Заключительные главы посвящены организационным аспектам. Автор описывает трансформацию традиционных предприятий в data-driven организации, используя модель зрелости Capability Maturity Model Integration. Разбираются роли в команде данных: data engineer, data scientist, ML-ops, с детализацией зон ответственности. Кейс Netflix иллюстрирует полный цикл — от сбора данных о просмотрах до персоназации рекомендаций через гибридные системы коллаборативной фильтрации. Учебник завершается прогнозами о будущем Big Data: квантовые вычисления для оптимизации, нейроморфные чипы для edge-аналитики и этические императивы регулирования ИИ.





