Иван
Шамаев
Проектирую DWH и DataLake, строю ETL/ELT-пайплайны — и автоматизирую работу дата-команды AI-агентами (RAG, text-to-SQL, harness). 6+ лет в хранилищах и платформах данных, 15+ лет в данных — от BI-консалтинга до DWH-архитектуры в e-commerce.
Инженер данных + AI-агенты для инженерии данных
Senior Data Engineer / AI Data Engineer. Сейчас — в Ozon Tech: batch-пайплайны на Vertica, Trino и PySpark, DWH-домены по якорной модели и AI-агенты для автоматизации инженерии данных.
Путь начинался с финансового консалтинга (SAS, Oracle Hyperion) и Qlik-разработки, прошёл через 3-слойный DataLake и BI-платформы на ClickHouse, Qlik Sense и Apache Superset, а сегодня сфокусирован на современном data-stack — dbt, Airflow, Trino, ClickHouse, Vertica — и практическом применении LLM в инженерии данных.
Data Engineering
Batch ETL/ELT-пайплайны, архитектура DWH (Anchor Modeling), витрины данных, data quality, миграции и оптимизация.
AI Agents
RAG-пайплайны, LLM-интеграция, агенты по базам знаний, SQL-копилоты, автоматизация на метаданных.
Технологический стек
Инструменты инженерии данных, DWH, AI и инфраструктуры — по востребованности на рынке
15+ лет в данных
От финансового консалтинга и BI-платформ до DWH-архитектуры, DataLake и AI-агентов
— настоящее время
- Разрабатываю платформу данных DWH: бизнес-потоки в DDS-слое по якорной модели (Anchor Modeling), batch ETL-пайплайны на Airflow (Vertica, Trino, PySpark) — 40+ ключевых витрин / 20+ доменов
- Оптимизирую сложные аналитические SQL-запросы на Vertica — ускорение до 30–50%: перерабатываю join-паттерны и устраняю статические дефекты планировщика
- Мигрирую тяжёлые ETL-процессы Vertica → Trino: запросы, падавшие с out-of-memory (50 ГБ/узел), после оптимизации join'ов и подбора session-параметров Trino стали стабильно выполняться
- Строю Airflow DAG'и (dag-factory) (Vertica, Trino, PySpark, HDFS; шаблоны инкрементальной загрузки) и интеграции MSSQL ↔ Vertica; ad-hoc-выгрузки больших объёмов на PySpark + Hadoop/HDFS (MPP / распределённые вычисления)
- Веду Data Quality мониторинг ETL в Grafana с контролем ключевых точек отказа в рамках DWH-домена в MSSQL
- Как техлид проектов провожу code review и design review; на дежурствах (on-call) — поддержка ETL (сенсоры, перезапуски, доезд данных) и пользователей, ревью кода, учения по отказоустойчивости (DR) при отключении дата-центров
- Собираю MVP AI-агента по DWH (RAG по метаданным и связям таблиц + text-to-SQL): как DWH-эксперт проектирую архитектуру решения — доступы, производительность, RnD процесса — чтобы 100+ бизнес-пользователей платформы могли самостоятельно получать ответы и готовый SQL, разгружая дата-инженеров
- Внедряю агентную разработку (OpenCode, Claude Code, Cursor, MCP, specs/rules) и обучаю команду инструментам и технологиям
— Ноя 2024
- Построил и автоматизировал ELT-пайплайны витрин DWH MSSQL, ClickHouse: оркестрация в Airflow, трансформации на dbt (ELT) и Python — core-слой и data marts (~20 витрин)
- Курировал миграцию BigQuery → Yandex Cloud (ClickHouse, Airflow, dbt) с zero-downtime по ключевым витринам; обучил кросс-функциональные команды новому стеку
- Как тимлид вёл команду 11 человек (5 data-инженеров, 3 DWH-аналитика, 3 аналитика); нанял 4 (3 аналитика + BI-тимлид) и стабилизировал DWH после ухода data-инженеров — восстановил загрузки в Airflow, оптимизировал MSSQL/ClickHouse, онбордил новых
- Провёл аудит и оптимизацию хранилища и BI: перевёл таблицы в columnar-формат, убрал views, формализовал регламент обновления — устранил проблемы производительности DataLens
- Настроил мониторинг MSSQL и инфраструктуры DWH в Grafana; контролировал обновление данных в MSSQL / ClickHouse через Airflow
- Построил витрины (data marts) для операционной аналитики e-commerce и дерево метрик (semantic layer / OKR) как единый источник для отчётности C-Level
— Ноя 2023
- Спроектировал и построил 3-слойный Data Lake (raw → staging → marts): ETL из Facebook Graph API на Python с ежедневным обновлением — ~9 источников / 0.6 ТБ данных
- Разрабатывал и поддерживал ETL по внутрикорпоративным системам (MySQL, Microsoft Navision, PostgreSQL)
- Смоделировал и построил витрины ClickHouse (marts-слой Data Lake) для финансовой и performance-аналитики (PnL, Balance Statement); план-факт-инструменты дали −90% времени на подготовку отчётности
- Внедрил Apache Superset как замену Qlik — сократил лицензионные затраты и расширил доступ к данным без роста бюджета
- Внедрил data catalog (OpenMetadata): каталогизировал метаданные слоёв Data Lake и построил прототип data lineage — дал аналитикам прозрачность происхождения данных (data governance)
- Разработал кастомные плагины Superset (React/TypeScript) и настроил CI/CD (GitLab CI) для автосборки Docker-образов; провёл миграции Superset 1.3.2 → 2.1.1
- Разработал Python SSE-плагины для Qlik Sense (server-side extensions)
— Июл 2020
- Построил ETL-пайплайны и интеграции данных из 1С ERP (бухучёт) и API (Bitrix24 CRM, Yandex Metrika, Google Analytics, Mango Office) — сначала на PHP, затем переписал на Python
- Разработал аналитику воронки продаж интернет-витрины, расчёт внутригрупповых операций в PnL и приложение оценки маркетинговых акций — рост активности с контрагентами в разы
- Внедрил версионирование кода в Git (.qvs-архитектура) и автоматизацию на PowerShell
- Разработал на C# Windows Service для интеграции QVS с NPrinting API
- Грамота «Лучший сотрудник IV квартала 2019»
— Май 2017
- Внедрение системы бюджетирования на Hyperion Planning; развёртывание QlikView EPM (аналитика к ERP GOLD)
- Разработка интеграций данных и расчётов в кубах Hyperion
- Оптимизация загрузок данных и постпроектная поддержка
— Ноя 2014
- Поддержка и развитие Oracle Hyperion Planning (расчеты, интеграции)
- Разработка аналитических моделей данных в QlikView
— Авг 2013
- SAS Base, SAS FM, SAS ABM; консультирование клиентов, пресейлы; Oracle EPM, SAP BO PCM
— Сен 2011
- Поддержка системы Галактика, проектирование бизнес-процессов, написание ТЗ для разработчиков
Избранные кейсы
Результаты с измеримым бизнес-эффектом
Реализован Harness AI Agent Support Assistant поверх DWH для получения ответов на вопросы бизнес-пользователей платформы данных:
- VectorDB Qdrant: Confluence данные разбиты на чанки и загружены в векторное хранилище
- MCP: Confluence, Jira, DataHub для поиска актуальных метаданных, проектов и инструментов
- Tooling: поиск по dwh repos (даги, таблицы, логические модели, описательные характеристики)
Апробирован подход по разработке data pipeline на базе OpenCode, Claude Code с помощью spec-driven development.
Куратор полной миграции DWH в облако, команда 8 человек. Перестроил ETL-пайплайны и витрины на ClickHouse, Airflow и dbt; обучил кросс-функциональные команды новому стеку.
Результат: переведена продуктовая аналитика на новый стек (мигрированы DDS- и DM-слои — более 15 витрин).
Инструменты план-факт анализа сократили время подготовки performance-отчётности по подразделениям на 90%.
Выбор и запуск Superset как дополнения к Qlik. Кастомные React/TypeScript плагины. GitLab CI автосборка образов. Миграции 1.3.2 → 2.1.1.
Grafana-дашборды для мониторинга критических точек отказа и состояния пайплайнов. 100% покрытие DWH-домена.
Спроектировал и построил DataLake на 3 слоя (raw → staging → marts): ETL из Facebook Graph API на основе Python и s3, с ежедневным обновлением и витринами в ClickHouse. Основа для операционной аналитики производства контента.
Образование и развитие
Давайте
пообщаемся
Если есть вопросы по моему опыту или интересный проект — напишите удобным способом.