- BrainTools - https://www.braintools.ru -
В последнее время традиционная бизнес-аналитика все сильнее пересекается с плоскостью аналитики данных (как в индустрии финтеха и банкинга, так и во многих других сферах). Некоторые профильные специалисты уже не первый год рассматривают Business Intelligence как супермножество Data Science, и все громче звучит мнение, что компаниям необходимо [1] объединять оба направления.
Поэтому сегодня мы в МКБ подготовили подборку материалов для желающих погрузиться в тему BI/Data Science. Под катом — открытые книги, которые помогут разобраться в современном аналитическом стеке, а также профильные учебники. А еще блоги, авторы которых простыми словами разбирают вопросы и проблемы по теме: от борьбы с «фактором автобуса» до принципов работы в индустрии BI.
Аналитический стек с нуля: пособие для чайников [2]. Справочник пригодится начинающим дата-аналитикам или менеджерам продукта, которые в общих чертах понимают устройство современного аналитического стека, но испытывают сложности при общении с дата-инженерами (особенно когда речь заходит о проблемах, связанных с пайплайнами). В материале все базовые концепции поясняются на картинках и примерах для наглядности.
Руководство стремится объяснить как можно большее число сценариев, с которыми сталкивается аналитик — например, про работу как с SQL, так и с NoSQL. При этом авторы — разработчики из сингапурской консалтинговой компании Holistic — открыто признают, что многие рекомендации отражают их собственные предпочтения. Это — облачное хранилище, MPP-аналитические базы данных и прочее. По их мнению, приоритет в построении стека данных стоит отдавать аналитическим процессам и моделированию, тогда как визуализация, хотя и важна, должна отходить на второй план. В любом случае оценить эти и другие рекомендации можно самостоятельно — книга выложена в открытый доступ в формате PDF [2].
Python для анализа данных [3]. Книга Уэса Маккинни, разработчика open source-пакета pandas. Как следует из названия, это — настольное руководство по обработке и анализу данных с использованием Python. Материал похож на справочник в стиле «бери и делай» — по утверждениям автора, примеры кода со страниц можно использовать в своих решениях и документации. Книга находится в открытом доступе, и в апреле 2023 года была обновлена, чтобы текст соответствовал изменениями в pandas 2.0.0 и Python 3.10.
«Python для анализа данных» будет полезна аналитикам, начинающим работать с этим языком программирования. Уэс рассказывает, как использовать Jupyter и терминал IPython для аналитики и вычислений, объясняет, как устроены базовые и продвинутые функции для подготовки данных: загрузки, очистки, преобразования и перегруппировки. Кроме того, Маккинни пишет про анализ и обработку регулярных и нерегулярных временных рядов. В конце книги Маккинни разбирает описанные им техники на реальных датасетах.
Стоит отметить, что материал перемежается с историческими справками от автора — например, как появлялись первые инструменты для векторизации в Python. Маккинни вспоминает, что все началось в 1995 году, когда Джим Хугунин создал библиотеку Numeric, а Трэвис Олифант в 2005 объединил ее с Numarray и представил NumPy. Также, помимо прочего, Уэс рассказывает, как и почему он разработал pandas.
Машинное обучение и анализ данных [4]. Эту книгу в 2024 году опубликовал Александр Дьяконов, руководитель направления наук о данных в Центральном университете и абсолютный чемпион на платформе Kaggle. Книга выложена на GitHub — в ней 31 глава. Автор пишет про алгоритмы для обучения [5] на размеченных данных, линейную регрессию и классификаторы, ансамбли, случайные леса и не только. Основной акцент Дьяконов делает на предобработке данных, отборе признаков, показателях качества. Книга начинается с основ аналитики, включая задачи, которые решаются с помощью машинного обучения. Материал во многом основан на публикациях в блоге автора (часть глав представлена в виде ссылок на соответствующие посты).
Продвинутый анализ данных: от простого к сложному [6]. Автор книги — Косма Шализи, профессор статистики и специалист кафедры машинного обучения Университета Карнеги — Меллона. Изначально материал представлял собой серию заметок для семестрового курса по продвинутому анализу данных для старшекурсников, но со временем дорос до полноценной книги объемом в 900 страниц (которая, вероятно, продолжит дополняться). Шализи улучшает ее содержание уже более десяти лет. Он планировал выпустить книгу еще в 2013 году, но затем сроки сдвинулись сперва на год, после — еще на пять. Сейчас автор уже не берется прогнозировать, когда именно выйдет печатная версия, однако материал доступен онлайн.
«Продвинутый анализ данных» ориентирован на математическую составляющую и статистический анализ; разделы книги посвящены распределениям, причинно-следственному анализу. Даже сам автор отмечает, что читателям необходимо понимание концепций теории вероятности и владение базовыми инструментами статистического анализа — без этих знаний материал покажется сложным. Помимо прочего, автор пишет о роли моделей машинного обучения в аналитике, затрагивает такие вещи, как переобучение и кросс-валидация.
Автор подкрепляет рассказ графиками, диаграммами, схемами и другим визуалом. Книгу стоит воспринимать как полноценный учебник (коим она и является), который содержит множество ссылок и сносок на научные работы для дополнительного чтения по теме. Кроме того, каждый раздел автор сопровождает практическими упражнениями для закрепления материала.
Байесовский вывод в анализе данных [7]. Эта книга была написана профессорами крупных американских вузов еще в 1995-м, однако в прошлом году вышло свежее переиздание с исправлениями и дополнениями. «Байесовский вывод в анализе данных» — это 700 страниц, которые, по сути, посвящены (внезапно!) одной теме — байесовскому выводу [8]. Этот метод остается одним из ключевых инструментов в арсенале аналитика данных и применяется для построения прогнозных моделей, детектирования аномалий и персонализации рекомендаций.
В первых главах книги описаны ключевые подходы к моделированию процессов, систем или анализа данных — например, однопараметрические и многопараметрические модели. Во второй части книги авторы начинают рассказывать, как можно сочетать байесовский вывод с другими методами анализа данных. Ближе к концу раскрывается идея превосходства такого подхода над традиционными. Эта книга — наверное, самая сложная в подборке. Относиться к ней стоит как к серьезному учебнику, для «общения» с которым необходимо понимать базовые математические методы, концепции теории вероятностей и статистики.
Блог дата-сайентиста с дипломом физика [9]. Блог ведет физик, который публиковался [10] в журнале Nature. Последние несколько лет он делится опытом [11] анализа данных: хотя последний пост на сайте датирован октябрем 2025 года, до этого момента материалы выходили регулярно — в некоторые месяцы автор мог опубликовать до семи заметок. Например, одна статья [12] посвящена байесовскому подходу к А/Б-тестированию. В ней аналитик опровергает миф о том, что при использовании этого метода можно в любой момент остановить тестирование, чтобы оценить промежуточные результаты. Автор ставит эксперимент, в ходе которого становится понятно, что частые «подглядывания» приводят к появлению ложных результатов.
Locally Optimistic [13]. Блог был основан в 2018 году группой американских дата- и бизнес-аналитиков, работающих в крупных облачных провайдерах. Посты выходят редко, но за пять лет авторы блога успели выпустить немало материалов — в том числе, с практическими советами. Так, одна статья [14] рассказывает, как находить боли [15] бизнеса с помощью данных. Автор предлагает использовать шаблон, который позволяет выявить ценность продукта для клиента.
Многие материалы также посвящены командной работе. Автор одной из статей разбирает [16] так называемый фактор лотереи (или «фактор автобуса») — риск того, что ключевой сотрудник, не успевший передать знания коллегам, может внезапно выпасть из проекта, и команда окажется в уязвимом положении. Специалист отмечает, что исключить такой риск нельзя, поэтому важно заранее реализовать хранилище знаний.
morling.dev [17]. Это — блог Гуннара Морлинга, разработчика открытого программного обеспечения из американской компании Confluent, который до этого десять лет проработал в RedHat. Спектр тем, на которые он пишет, обширен, но в основном они касаются аналитики, работы с данными, СУБД. Например, одна из последних статей посвящена [18] инструменту Hardwood — новому парсеру формата данных Apache Parquet, де-факто ставшего стандартом для аналитики больших данных. В статье разработчик показывает, как использовать инструмент, объясняет, за счет чего удалось добиться высокой производительности.
Потрясающая бизнес-аналитика [19]. Классическая awesome-подборка на GitHub, которую с этого года курирует канадский писатель и опенсорс-разработчик. В репозитории собраны материалы по ключевым концепциям бизнес-аналитики, а также широкий набор инструментов для разных рабочих сценариев. Внутри можно найти как решения для визуализации и дашбордов, так и инструменты для подготовки отчетности. Также есть список проектов с открытым исходным кодом. Кроме того, по ссылке представлены гайды, туториалы и курсы.
Учебная программа и ресурсы по анализу данных [20]. Это — учебное пособие от Microsoft, опубликованное в 2022 году. Занятия рассчитаны на месяц: каждому дню соответствует тема и задание. Внутри можно найти видеоматериалы, схемы, пояснения и шпаргалки в компактном виде. Курс начинается с изучения основ бизнес-аналитики, затем предлагает создать свой дашборд, изучить моделирование данных и проч. Есть и темы, посвященные шрифтам и выбору цветов в презентациях. В конце — проект для закрепления материала.
P.S. Предложенные в подборке книги, блоги и инструментарий помогут, если изучать аналитику данных самостоятельно. И это не первый материал в нашем блоге про обучение — до этого мы уже рассказывали [21], как проходило (и проходит) обучение банковских специалистов начиная с 18 века и заканчивая нашим временем.
Автор: MKB_blog
Источник [22]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/34165
URLs in this post:
[1] необходимо: https://www.itweek.ru/bigdata/article/detail.php?ID=224578
[2] Аналитический стек с нуля: пособие для чайников: https://cdn.holistics.io/guidebook/the-analytics-stack-guidebook.pdf
[3] Python для анализа данных: https://wesmckinney.com/book/
[4] Машинное обучение и анализ данных: https://github.com/Dyakonov/MLDM_BOOK/blob/main/book_001_intro_202401.pdf
[5] обучения: http://www.braintools.ru/article/5125
[6] Продвинутый анализ данных: от простого к сложному: https://www.stat.cmu.edu/~cshalizi/ADAfaEPoV/
[7] Байесовский вывод в анализе данных: https://sites.stat.columbia.edu/gelman/book/BDA3.pdf
[8] байесовскому выводу: https://en.wikipedia.org/wiki/Bayesian_inference
[9] Блог дата-сайентиста с дипломом физика: https://www.alexmolas.com/blog.html
[10] публиковался: https://www.nature.com/articles/s41467-019-11841-2
[11] опытом: http://www.braintools.ru/article/6952
[12] статья: https://www.alexmolas.com/2025/10/30/bayesian-ab-test-peeking.html
[13] Locally Optimistic: https://locallyoptimistic.com
[14] статья: https://locallyoptimistic.com/post/data-product-discovery-template/
[15] боли: http://www.braintools.ru/article/9901
[16] разбирает: https://locallyoptimistic.com/post/reducing-the-lottery-factor-for-data-teams/
[17] morling.dev: http://morling.dev
[18] посвящена: https://www.morling.dev/blog/hardwood-new-parser-for-apache-parquet/
[19] Потрясающая бизнес-аналитика: https://github.com/awesomelistsio/awesome-business-intelligence
[20] Учебная программа и ресурсы по анализу данных: https://techcommunity.microsoft.com/blog/educatordeveloperblog/learning-data-analysis-curriculum-and-resources/3497797
[21] рассказывали: https://habr.com/ru/companies/mkb/articles/1028200/
[22] Источник: https://habr.com/ru/companies/mkb/articles/1068344/?utm_campaign=1068344&utm_source=habrahabr&utm_medium=rss
Нажмите здесь для печати.