Аналитика данных, BI и статистика: практическое введение

Аналитика данных, BI и статистика: практическое введение

Обновлено 2 сентября 2026 года.

Аналитика данных помогает ответить на конкретный вопрос: почему снизились продажи, сколько товара заказать, отличается ли конверсия двух вариантов страницы. Полезный результат — проверяемый вывод с понятными ограничениями и действием, которое можно выполнить на его основе.

Это руководство связывает бизнес-задачу, BI, статистику, машинное обучение и устройство данных. Все числовые примеры ниже учебные. Они показывают ход расчёта и не являются результатами клиентских проектов.

Аналитика данных, BI и бизнес-анализ

Аналитика данных включает исследование данных, расчёты, проверку гипотез и прогнозирование. Business Intelligence (BI) — процессы и инструменты подготовки управленческой информации, в том числе регулярных отчётов и интерактивных панелей. BI использует методы анализа; строгой границы между этими областями нет.

Бизнес-анализ как работа с требованиями и процессами — ещё одно понятие. Бизнес-аналитик помогает определить нужное изменение, аналитик данных исследует и рассчитывает показатели, инженер данных организует получение и хранение, специалист по моделям разрабатывает прогнозы. В небольшой команде один человек может выполнять несколько ролей.

BI не гарантирует данные в реальном времени. Если источник выгружается ночью, интерактивный дашборд днём показывает состояние последней выгрузки. В отчёте нужно указывать дату данных и отдельно контролировать успешность обновления.

Четыре типа задач

Тип Вопрос Учебный пример Что нельзя заключить автоматически
Описательная аналитика Что наблюдаем? В августе было 120 заказов против 100 в июле Рост обязательно вызван рекламой
Диагностическая Где произошло изменение и какие объяснения возможны? Разложить рост по регионам, каналам и новым клиентам Совпадение по времени доказывает причину
Прогностическая Чего ожидать при заданных условиях? Оценить спрос следующей недели с интервалом неопределённости Прогноз обязательно сбудется
Предписывающая Какое действие выбрать с учётом ограничений? Распределить закупочный бюджет между товарами Рекомендация оптимальна при ошибочных данных и предпосылках

Это типы задач, а не обязательная лестница, на которой каждый следующий отчёт полезнее предыдущего. Точная ежедневная сверка остатков может иметь больший эффект, чем сложная модель, которую никто не использует.

Как устроен аналитический проект

Методология CRISP-DM выделяет понимание бизнеса, понимание данных, подготовку, моделирование, оценку и внедрение. IBM подчёркивает, что порядок не жёсткий: проект возвращается к предыдущим этапам по мере появления новых вопросов.

  1. Вопрос. Вместо «сделать красивый дашборд» сформулируйте решение: какие товары нужно дозаказать до пятницы?
  2. Определения. Что считать заказом, выручкой, возвратом и доступным остатком? В каком часовом поясе заканчивается день?
  3. Источники. Где находятся данные, кто отвечает за доступ и с какой задержкой появляются изменения?
  4. Проверка. Сходятся ли итоговые суммы с системой учёта? Есть ли дубли ключей, пропуски и изменения задним числом?
  5. Метод. Достаточно ли группировки и сравнения или нужна модель и статистический вывод?
  6. Использование. Кто получает результат, какое действие выполняет и как будет проверена польза?

Время подготовки данных нужно оценивать по своему проекту. Процент из чужого опроса без года, выборки и определения работ не является нормативом для команды.

Описательная статистика: начните с распределения

Среднее показывает сумму, делённую на число наблюдений. Медиана — центральное значение упорядоченного ряда. Перцентили описывают положение в распределении, а стандартное отклонение — разброс относительно среднего. Одной средней величины часто недостаточно.

Пример пяти заказов: 1 000, 1 200, 1 500, 1 300 и 20 000 рублей. Всего 25 000 рублей, средний чек — 5 000, медиана — 1 300. Среднее верно, но плохо описывает обычный заказ в этом маленьком наборе.

Нельзя удалить заказ на 20 000 только потому, что он большой. Если это реальная покупка, удаление изменит анализ: среднее оставшихся четырёх заказов станет 1 250. Сначала выясните, что перед вами — ошибка ввода, отдельный сегмент клиентов или редкое нормальное событие. Правило обработки выбросов должно быть объяснимым.

Для сравнения среднего чека периодов считайте отношение общей суммы к общему числу заказов. Простое среднее дневных средних будет неверным, если по дням разное число заказов. Отсутствие данных и нулевой результат также нельзя считать одним состоянием.

Корреляция не исчерпывает зависимость

Коэффициент Пирсона характеризует линейную связь. Значение около нуля не исключает нелинейную зависимость. Для x = −2, −1, 0, 1, 2 и y = x² значения y равны 4, 1, 0, 1, 4. Корреляция Пирсона равна нулю, хотя y полностью определяется через x.

Коэффициент Спирмена применяют для монотонной связи по рангам; он тоже не обнаруживает любую возможную зависимость. Перед интерпретацией полезно построить диаграмму рассеяния, проверить выбросы и состав выборки.

Читай также:  Как выбрать визуализацию в Power BI: от вопроса к графику

Даже сильная связь не доказывает причинность. Расходы на рекламу и выручка могут одновременно расти в сезон. Причинный эффект требует подходящего дизайна исследования: например, корректной рандомизации или обоснованного метода для наблюдательных данных.

Проверка гипотез и p-value

Сначала задайте нулевую гипотезу, альтернативу, метрику и правило анализа. Метод выбирают по устройству наблюдений: независимые группы, парные измерения и временной ряд требуют разных предпосылок. t-тест, ANOVA и критерий хи-квадрат нельзя выбирать только по числу столбцов в таблице.

p-value описывает, насколько необычен наблюдаемый или более экстремальный результат при нулевой гипотезе и остальных предпосылках теста. Это не вероятность истинности гипотезы и не вероятность того, что результат «случаен». Малое значение не измеряет величину эффекта. Эти ограничения изложены в заявлении Американской статистической ассоциации.

Порог 0,05 — распространённая договорённость, но не автоматическое правило бизнес-решения. Укажите оценку эффекта, интервал неопределённости, число наблюдений и ограничения. При множестве проверок нужна стратегия контроля ложных находок. Большой p-value сам по себе не доказывает равенство вариантов.

Пример: сравнение конверсии

Вариант A: 100 покупателей из 1 000 участников, конверсия 10%. Вариант B: 140 из 1 200, конверсия примерно 11,67%. Наблюдаемое отличие — 1,67 процентного пункта, или примерно 16,7% относительно A. Эти два способа записи нельзя смешивать.

По этим числам ещё нельзя объявить B победителем. Для полноценного A/B-теста проверьте:

  • Распределяли ли участников случайно и оставались ли они в одном варианте?
  • Одинаковы ли окно наблюдения, определение покупки и правила исключения?
  • Не посчитаны ли несколько сессий одного человека как независимые участники?
  • Были ли заранее выбраны основная метрика, длительность и правило остановки?
  • Учтены ли неопределённость, побочные метрики и практически полезный размер эффекта?

Сравнение двух последовательных месяцев не становится A/B-тестом после применения статистической функции. Сезонность, источники трафика и изменение состава покупателей могут объяснить разницу.

Машинное обучение: когда оно нужно

В обучении с учителем модель использует примеры с известным ответом: классификация предсказывает категорию, регрессия — числовую величину. Обучение без учителя ищет структуру, например кластеры. Обучение с подкреплением рассматривает выбор действий и вознаграждение в среде; для обычного отчёта по продажам оно не требуется.

Метод Пример задачи Что проверить
Линейная регрессия Связь числового результата с признаками Ошибки, устойчивость, разумность формы связи
Логистическая регрессия Вероятность события Качество вероятностей и выбранный порог решения
Дерево, случайный лес, бустинг Классификация или регрессия по табличным данным Переобучение, подготовку признаков, качество на новых данных
k-means и другие методы кластеризации Группировка похожих клиентов Масштаб признаков, устойчивость групп и их практический смысл
Модели временных рядов Прогноз спроса Сезонность, временное разделение выборки, сравнение с простым прогнозом

Возможности зависят от реализации алгоритма. Например, деревья scikit-learn не принимают категориальные переменные напрямую: их нужно подготовить. У других библиотек правила могут отличаться.

Больше данных или более сложная модель не гарантируют большей точности. Сначала задайте простой ориентир: для спроса — прошлое значение или сезонный прогноз, для классификации — базовое правило. Сравнивайте модели на данных, которые не использовались для настройки.

Разделите данные на обучение и оценку до подбора преобразований. Например, средние для заполнения пропусков и параметры нормализации нельзя оценивать на будущем тестовом периоде. Для временных рядов сохраните порядок времени. Для повторных наблюдений по клиенту продумайте разделение по клиентам. Документация scikit-learn объясняет утечку данных и использование Pipeline.

После запуска контролируйте качество и изменение данных. Автоматическое переобучение само по себе не доказывает улучшение: новая модель должна пройти ту же оценку и иметь понятный способ отката.

Базы данных и подготовка витрины

В реляционной базе данные организованы в таблицы; ключи и ограничения помогают поддерживать целостность. Например, первичный ключ определяет уникальную запись, внешний ключ связывает её со справочником. Конкретное поведение ограничений описано в документации PostgreSQL.

Оперативная система принимает и изменяет заказы, аналитическая витрина подготавливает данные для отчётов. Это разные нагрузки, но они не требуют разных СУБД в каждом проекте. Колоночное хранение, реляционная модель и язык SQL также не являются взаимоисключающими категориями: ClickHouse — пример колоночной SQL-системы для OLAP.

Перед объединением таблиц определите гранулярность — что означает одна строка. Если расходы находятся на уровне «кампания–день», а заказы — на уровне отдельных заказов, соединение может многократно повторить дневной расход. Сначала приведите данные к совместимому уровню либо стройте модель со справочниками и корректными мерами.

  • Храните устойчивые идентификаторы и дату изменения источника.
  • Проверяйте уникальность ключей и отсутствие потерянных связей.
  • Учитывайте возвраты, отмены и исправления прошлых периодов.
  • Повторная загрузка одного пакета не должна повторно увеличивать показатели.
  • Делайте резервные копии и проверяйте восстановление.
  • Предоставляйте доступ к необходимому набору данных и контролируйте публичную публикацию отчётов.
Читай также:  Power Apps и Power Automate в Power BI: формы, кнопки и обновление данных

ETL преобразует данные до целевого хранилища, ELT — внутри него после загрузки. Выбор и проверка повторного запуска разобраны в отдельной статье про ETL и ELT.

Инструменты: выбирайте по задаче

Инструмент Для чего использовать Ограничение выбора
Excel и Google Sheets Небольшие расчёты, сверки, сводные таблицы Контролировать версии, формулы, доступ и ручные правки; Power Query и DAX относятся к экосистеме Microsoft, а не к Google Sheets
SQL Фильтровать, соединять и агрегировать данные в СУБД Диалекты и функции различаются; неверное соединение искажает суммы
BI-платформа Регулярная отчётность, интерактивные представления и разграничение доступа Проверить коннекторы, обновление, модель прав и условия использования
Python или R Исследование, статистика, автоматизация и модели Нужны воспроизводимая среда, сопровождение и проверка кода
Распределённая обработка Задачи, для которых подтверждена нехватка одного узла Дополнительные затраты на эксплуатацию и передачу данных

Для выбора BI составьте короткий пилот на реальных данных. Проверьте доступность покупки и поддержки для вашей организации, способ размещения, стоимость всех необходимых ролей, ограничения обновления и возможность выгрузить данные при миграции. Старый прайс или доля рынка без методики исследования не заменяют эти проверки.

Открытый исходный код не делает весь проект бесплатным: остаются серверы, настройка доступа, обновления и поддержка. И наоборот, наличие коммерческой лицензии не гарантирует готовый коннектор или правильный расчёт показателей.

Когда нужны Big Data и потоковая обработка

Нет универсального количества строк, после которого задача становится Big Data. Важны объём, скорость поступления, сложность расчётов и требуемая задержка. Сначала измерьте время запросов и потребление ресурсов; иногда проблему решают фильтрация, правильная модель и индекс, а не кластер.

Apache Spark предоставляет средства распределённых вычислений, SQL и Structured Streaming. Выигрыш зависит от нагрузки, разбиения данных, обмена между узлами и инфраструктуры. Утверждение «всегда на порядок быстрее MapReduce» не является правилом выбора.

Передача событий, их обработка и показ в BI — отдельные этапы. Потоковый брокер не гарантирует мгновенный отчёт: добавляются задержки обработчика, хранилища и интерфейса. Определите допустимую задержку и измеряйте её от события до видимого результата.

Как показать результат

Для сравнения категорий подойдут столбцы, для динамики — линия, для связи числовых признаков — диаграмма рассеяния. Добавьте период, единицы, определение метрики и дату обновления. Не прячьте малое число наблюдений за точными процентами.

Цвет должен помогать различать данные; важное состояние дублируйте текстом или символом. У столбцов обычно нужна нулевая база; для линейного графика иной диапазон может быть оправдан, если шкала явно показана. Практические примеры — в руководстве по визуализации без искажения масштаба.

В выводе отделяйте наблюдение от объяснения: «заказов стало меньше в канале X» подтверждается расчётом, а «причина — смена алгоритма площадки» требует дополнительных данных. Сгенерированное ИИ пояснение проверяйте тем же способом: числа, фильтры, период, источник и логика вывода.

Первый учебный проект

  1. Возьмите обезличенную таблицу заказов с ID, датой, клиентом, суммой и статусом. Опишите одну строку и правила возвратов.
  2. Проверьте уникальность заказов, типы сумм и дат, пропуски и дубли клиентов.
  3. Посчитайте за месяц сумму продаж, число заказов, средний чек и медиану. Сверьте несколько строк вручную.
  4. Постройте динамику и сравнение сегментов. Добавьте дату данных и размер выборки.
  5. Сформулируйте один подтверждённый вывод, одну гипотезу и проверку, которая позволит её уточнить.
  6. Повторите расчёт после добавления нового месяца и исправления старого заказа. Итоги должны меняться по заранее установленным правилам.

После этого можно переходить к ABC, XYZ и RFM, экспериментам и прогнозам. Основа остаётся той же: определённый вопрос, согласованные данные, проверяемый расчёт и честная оценка неопределённости.