ElenaNKn/data_projects_ru

Проекты по анализу данных

★ 0Forks 0Jupyter NotebookGitHub ↗Compare

README

Проекты по анализу данных

Данный репозиторий содержит проекты по анализу данных, выполненные Еленой Князевой.

Проекты по анализу и визуализации данных

Название проекта Описание Инструменты и области знаний
Анализ персонала и окладов Автоматизирован учёт сотрудников с расчётом окладов через справочники, начислением премий по баллам и доплат за стаж, а также реализованы отчёты по кадровым показателям с помощью сводных таблиц и фильтрации Автоматизация учёта и формирования отчетности средствами Excel. Инструменты: MS Excel (pivot tables, VLOOKUP, MATCH, IF, filtering)
Визуализация воронки конверсии Построена интерактивная визуализация воронки конверсии пользователей из визита на сайт в участие в игре в динамике по неделям Подключение к базе данных из jupyter notebook. Построение интерактивных визуализаций c библиотекой plotly. Инструменты: SQL, Python (pandas, plotly)
Карта пользовательских потоков (User Flow Sankey Diagram) Построена карта пользовательских потоков для пользователей, заказавших товар на ecomerce b2c ресурсе и отказавшихся от него. Выявлены проблемные места и даны рекомендации по снижению возвратов Подключение к базе данных из jupyter notebook. EDA и построение sankey-диаграммы. Инструменты: SQL, Python (pandas, sqlalchemy, requests, tqdm, plotly)

Проекты по дизайну и анализу А/В-тестов

Название проекта Описание Инструменты и области знаний
Анализ результатов А/В-теста Полный цикл A/B-теста: от формулировки гипотезы до интерпретации результатов и продуктового решения. Тест показал статистически значимое падение 7-Day Retention. Продуктовое решение: откатить фичу. Дизайн эксперимента, проверка однородности, статистическая значимость отличия 2 переменных, анализ результатов A/B-теста бинарной метрики. Инструменты: библиотеки python (pandas, numpy, math, scipy.stats, statsmodels.stats)

Проекты по машинному обучению

Название проекта Описание Инструменты и области знаний
Многоклассовая классификация при дисбалансе классов Построение модели многоклассовой классификации при дисбалансе классов, включая анализ данных, построение и настройку четырёх моделей (логистической регрессии, SVM, KNN, дерева решений) с оценкой качества по метрике f1_weighted. Многоклассовая классификация (one-vs-rest и one-vs-one подходы), модели классификации (логистическая регрессия, метод опорных векторов, KNN, дерево решений), оценка качества модели по кросс-валидации, подбор гиперпараметров по кросс-валидации, построение матрицы ошибок (confusion matrix). Инструменты: библиотеки python (pandas, scikit-learn, matplotlib),
CatBoost для решения задачи регрессии. Подбор гиперпараметров с Optuna Построение бустиновых модели для задач регрессии с выполнением отбора признаков и байесовская оптимизации гиперпараметров через Optuna. Бустинговые модели (CatBoost), корреляция текстовых признаков (V-мера Крамера), feature engineering, оценка моделей по кросс-валидации, оценка значимости признаков - feature importance (библиотека shap), байесовский поиск гиперпараметров. Инструменты: библиотеки python (pandas, scikit-learn, matplotlib, catboost, optuna)
Отбор признаков. Кластеризация данных На примере дерева решений рассмотрены методы улучшения качества медели регрессии путем обработки признаков (логарифмирование, полиномиальные признаки, стандартизация, отбор и кодирование признаков), а также показано применение кластеризации для анализа данных и оценки статистических характеристик кластеров Поиск гиперпараметров по кросс-валидации, оценка значимости признаков - feature importance, логарифмирование целевой переменной, построение пайплайнов, отбор признаков - feature selection, кластеризация данных. Инструменты: библиотеки python (pandas, scikit-learn, matplotlib)

Контакты

LinkedIn: www.linkedin.com/in/alena-n-kniazeva

Email: [email protected]

Telegram: https://t.me/KniazevaAlena (@KniazevaAlena)

Contributors

ElenaNKn

Issues