Senior Data Scientist

Москва, Россия
Миддл • Сеньор
Аналитика, Data Science, Big Data • Data scientist • Data Science • Machine Learning • RND • Python • C++ • Bash • R • SQL • Apache Spark • Hadoop • MapReduce • ClickHouse • Hive • Map Reduce • PostgreSQL • Redis • Spark • Vertica
Удаленная работа • Работа в офисе
Опыт работы от 3 до 5 лет
от 150 000 до 300 000 ₽
Есть файл резюме (защищен)
О себе

На данный момент Data Scientist.

Мои компетенции и опыт

Inventive Retail Group, ML-engineer
OCR для таможенных документов. Разработал к OCR-решение для перевода и автоматического заполнения таможенных документов: распознавание полей по координатам, извлечение и нормализация текста (Hugging Face / CV-стек) → заполнение целевых форм. Сократил ручной труд и ускорил обработку документов в операционном процессе (20 рабочих часов в месяц на одного сотрудника)

 

ИИ-агент для бизнес-аналитики (RAG + Qdrant). Построил пайплайн, в котором аналитический запрос бизнеса на естественном языке переводится в SQL и выполняется по витринам данных: NL → RAG (эмбеддинги + векторный поиск в Qdrant) → генерация SQL → запрос к витринам → ответ. Снизил порог входа к данным и время получения ответов для сотрудников без постоянного написания SQL вручную.

 

Б1-ИТ ( нужен доступ к резюме &Young), Data Scientist

Построил фреймворк для бенчмаркинга моделей прогнозирования спроса и продаж (sales&demand) на больших исторических массивах данных: XGBoost, LightGBM, Prophet, Chronos, TFT, PatchTST — с учётом горизонтов планирования (кратко-, средне-, долгосрочное) и SLA бизнеса.

Разработал с нуля систему оптимизации промо-ценообразования для retail-клиента (MINLP → жадный алгоритм, Pyomo/Gekko, OR-Tools): внедрение позволило увеличить процентную маржу продаж на 3 п.п. Разработал математический движок оценки эластичности спроса на ассортиментной матрице 80–100 тыс. SKU в федеральной географии — выбор сценариев с учётом влияния на спрос, выручку и маржинальность.

Оптимизировал ETL-пайплайны на PySpark (broadcast join, partition pruning, checkpoint): рефакторинг вычислений и настройка партиционирования сократили время выполнения джобов на 30%, ускорив подготовку данных для аналитики и ML. Использовал Trino для аналитических запросов к данным в HDFS-экосистеме.

Мигрировал решение ценообразования на локальную вычислительную инфраструктуру с обновленными GPU-ресурсами и внедрил наблюдаемый production-пайплайн с мониторингом в Grafana, контролем артефактов и CI/CD в GitLab, что сократило стоимость сопровождения модели на 5 млн рублей в год.

Проектировал и анализировал эксперименты для оценки эффективности ценовых-промо: метрики влияния на спрос, выручку и маржинальность. При выборе моделей учитывал не только ML-метрики (MAPE, WAPE), но и ожидаемый бизнес-эффект и операционные ограничения.

Обучал transformer-модели и строил товарные эмбеддинги для NLP-задач e-commerce: нормализация, кластеризация каталогов, автоматическое извлечение и генерация атрибутов для иерархии товаров.

Разработал коммерческий ИИ-агент для интерактивной ритейл-аналитики: NL -> RAG -> SQL (ClickHouse) -> визуализация; Использовал векторную БД (Qdrant) и семантический поиск по эмбеддингам для обогащения промта актуальными кусками документации.



Есть файл резюме (защищен)


Интересные кандидаты