Данный репозиторий содержит проекты по анализу данных, выполненные Еленой Князевой.
| Название проекта | Описание | Инструменты и области знаний |
|---|---|---|
| Анализ персонала и окладов | Автоматизирован учёт сотрудников с расчётом окладов через справочники, начислением премий по баллам и доплат за стаж, а также реализованы отчёты по кадровым показателям с помощью сводных таблиц и фильтрации | Автоматизация учёта и формирования отчетности средствами Excel. Инструменты: MS Excel (pivot tables, VLOOKUP, MATCH, IF, filtering) |
| Визуализация воронки конверсии | Построена интерактивная визуализация воронки конверсии пользователей из визита на сайт в участие в игре в динамике по неделям | Подключение к базе данных из jupyter notebook. Построение интерактивных визуализаций c библиотекой plotly. Инструменты: SQL, Python (pandas, plotly) |
| Карта пользовательских потоков (User Flow Sankey Diagram) | Построена карта пользовательских потоков для пользователей, заказавших товар на ecomerce b2c ресурсе и отказавшихся от него. Выявлены проблемные места и даны рекомендации по снижению возвратов | Подключение к базе данных из jupyter notebook. EDA и построение sankey-диаграммы. Инструменты: SQL, Python (pandas, sqlalchemy, requests, tqdm, plotly) |
| Название проекта | Описание | Инструменты и области знаний |
|---|---|---|
| Анализ результатов А/В-теста | Полный цикл A/B-теста: от формулировки гипотезы до интерпретации результатов и продуктового решения. Тест показал статистически значимое падение 7-Day Retention. Продуктовое решение: откатить фичу. | Дизайн эксперимента, проверка однородности, статистическая значимость отличия 2 переменных, анализ результатов A/B-теста бинарной метрики. Инструменты: библиотеки python (pandas, numpy, math, scipy.stats, statsmodels.stats) |
| Название проекта | Описание | Инструменты и области знаний |
|---|---|---|
| Многоклассовая классификация при дисбалансе классов | Построение модели многоклассовой классификации при дисбалансе классов, включая анализ данных, построение и настройку четырёх моделей (логистической регрессии, SVM, KNN, дерева решений) с оценкой качества по метрике f1_weighted. | Многоклассовая классификация (one-vs-rest и one-vs-one подходы), модели классификации (логистическая регрессия, метод опорных векторов, KNN, дерево решений), оценка качества модели по кросс-валидации, подбор гиперпараметров по кросс-валидации, построение матрицы ошибок (confusion matrix). Инструменты: библиотеки python (pandas, scikit-learn, matplotlib), |
| CatBoost для решения задачи регрессии. Подбор гиперпараметров с Optuna | Построение бустиновых модели для задач регрессии с выполнением отбора признаков и байесовская оптимизации гиперпараметров через Optuna. | Бустинговые модели (CatBoost), корреляция текстовых признаков (V-мера Крамера), feature engineering, оценка моделей по кросс-валидации, оценка значимости признаков - feature importance (библиотека shap), байесовский поиск гиперпараметров. Инструменты: библиотеки python (pandas, scikit-learn, matplotlib, catboost, optuna) |
| Отбор признаков. Кластеризация данных | На примере дерева решений рассмотрены методы улучшения качества медели регрессии путем обработки признаков (логарифмирование, полиномиальные признаки, стандартизация, отбор и кодирование признаков), а также показано применение кластеризации для анализа данных и оценки статистических характеристик кластеров | Поиск гиперпараметров по кросс-валидации, оценка значимости признаков - feature importance, логарифмирование целевой переменной, построение пайплайнов, отбор признаков - feature selection, кластеризация данных. Инструменты: библиотеки python (pandas, scikit-learn, matplotlib) |
LinkedIn: www.linkedin.com/in/alena-n-kniazeva
Email: [email protected]
Telegram: https://t.me/KniazevaAlena (@KniazevaAlena)