Графики как инструмент разведки: увидеть распределения, связи и до того, как обучена первая модель.
Ключевые тезисы
- Выборочная визуализация (sampling): репрезентативное подмножество вместо миллиардов строк — общие паттерны сохраняются, время отклика падает на порядки.
- Агрегация в бины (hexbin, datashader) — второй способ показать большой массив, не рисуя каждую точку.
- Один график отвечает на один вопрос; распределение, связь и динамика во времени требуют разных типов графиков.
Подробный разбор
- Выборочная визуализация (sampling) — взять репрезентативное подмножество: случайное, стратифицированное по важному признаку или систематическое по времени. Общие паттерны сохраняются, время построения падает на порядки.
- Агрегация в бины — hexbin, 2D-гистограммы, datashader: рисуется не точка, а плотность в ячейке; ничего не теряется вообще.
- Предагрегация в хранилище — считать сводки SQL-запросом и визуализировать уже результат, а не сырые строки.
У сэмплирования есть цена: редкие события (доли процента) в подвыборку могут не попасть, а именно они часто и есть предмет анализа. Поэтому для выборку берут стратифицированной, а не равномерной.
Проверка адекватности подвыборки простая: постройте один и тот же график на двух независимых сэмплах. Если картинки заметно отличаются — размер выборки мал.
| Вопрос | График |
|---|---|
| Как распределена величина | гистограмма, boxplot, скрипичный график |
| Как связаны две величины | диаграмма рассеяния, hexbin при больших объёмах |
| Как меняется во времени | линия, площадь, календарная тепловая карта |
| Чем группы отличаются | столбцы с интервалами, small multiples |
| Что важно в модели | beeswarm , |
Среднее и скрывают форму данных: квартет Энскомба — четыре набора с одинаковыми средними, и коэффициентом корреляции и совершенно разными графиками. Смотреть на распределение нужно до того, как считать статистики.
Видеолекции
Тайм-кода именно на эту тему в записях нет. Но глава «Данные» разобрана в курсах целиком — с той оговоркой, что место в записи придётся искать самому.
Связанные темы
Интерпретируемая статистика
Correlation75%
Корреляция · Математический справочникНормированная мера связи двух величин: ковариация, поделённая на разброс каждой из них.
Generalized Additive Models75%
Обобщённые аддитивные модели · Классическое машинное обучениеСумма гладких функций от отдельных признаков: нелинейность есть, а интерпретируемость линейной модели сохраняется.
Linear Regression75%
Линейная регрессия · Классическое машинное обучениеПредсказывает число как взвешенную сумму признаков. Самый интерпретируемый бейзлайн и основа для более сложных моделей.
Partial Dependence75%
Partial Dependence Plot · Интерпретируемость моделейПоказывает средний эффект признака на предсказание при усреднении по остальным признакам.
Feature selection75%
Отбор признаков · ДанныеУбираем шумные и избыточные признаки, чтобы снизить переобучение, ускорить инференс и упростить интерпретацию.
Профильная компетенция для роли: Аналитик данных.
Усиливает профиль: Data Scientist.
Спрашивают на собеседовании: Совкомбанк — Продуктовая аналитика и эксперименты, ЮMoney — Конверсия платежа и эксперименты.
Глава «Данные» последний раз правилась . Нашли ошибку — напишите.