Привет! Мы X-Cart – разработчик e-commerce платформы на базе PHP/MySQL. На нашей платформе построены десятки тысяч магазинов среднего и крупного бизнеса более чем в 130 странах мира (большинство наших клиентов находится в США, Канаде, Великобритании и Австралии).
Мы ищем человека, который возьмёт на себя весь дата-контур X-Cart – от ETL-пайплайнов и хранилища до аналитики и дашбордов – и при этом умеет строить поверх данных AI-инструменты и агентов, а не просто писать SQL. Это не «чистый» дата-инженер и не «чистый» аналитик. Роль на стыке: половина времени – надёжные пайплайны и модели данных, другая половина – LLM-агенты и автоматизация рутины через ИИ. У нас уже есть такие наработки, и мы хотим развивать это направление. Роль предполагает высокую автономность: вы сами ведёте задачи от вопроса до результата, поэтому важна и техническая широта, и умение работать самостоятельно.
Чем предстоит заниматься:
Data Engineering
- Поддерживать и развивать ETL: ~21 DAG в Airflow (`SaaS API → PostgreSQL STG → dbt → ClickHouse CDM`)
- Развивать хранилище: PostgreSQL (staging + DDS), ClickHouse (OLAP-аналитика) - Писать и поддерживать dbt-модели (сейчас ~29 CDM + витрины), следить за качеством данных
- Настраивать CDC-репликацию (MariaDB → ClickHouse через PeerDB) и потоковую доставку данных
- Интегрировать источники: платёжки (PayPal, Stripe), CRM (Jira, Intercom, Aircall, Salesforce), маркетинг, продуктовые метрики (Amplitude)
Analytics
- Строить дашборды и отчёты в Superset (с embedding, RLS) - Считать бизнес-метрики: GMV, revenue share, churn, продуктовая и клиентская аналитика
- Разбираться в «грязных» данных и доводить их до вида, пригодного для решений - Работать с продуктом и финансами как внутренний аналитик — от вопроса до цифры AI / Агенты (обязательная часть роли)
- Разрабатывать LLM-агентов и пайплайны автоматизации (Slack-боты, скоринг тикетов, обработка данных ИИ)
- Работать с LLM-инференсом (Ollama локально, а также облачные модели)
- Применять агентные инструменты (Claude Code / оркестрация субагентов) для ускорения собственной работы и построения продуктовых фич
- Оценивать качество AI-выводов: где LLM надёжен, где нужна калибровка и gold-set
Что мы ждём от кандидата:
Обязательно
- Уверенный SQL и опыт проектирования моделей данных (staging → marts, звёзды/DDS)
- Практика с Airflow (или аналогичным оркестратором) и dbt - ClickHouse: практический опыт с колоночной аналитической БД (движки, партиционирование, оптимизация запросов) — это наше основное OLAP-хранилище
- Python на уровне автоматизации (ETL-скрипты, работа с API, обработка данных)
- CDC-репликация: практический опыт с PeerDB (или Debezium/аналогом) для доставки данных из боевой БД в аналитическое хранилище near-real-time
- BI на Superset: построение дашбордов и отчётов, датасеты, embedding, RLS — это основной инструмент аналитики у нас
- Реальный опыт с LLM и агентами: prompt engineering, вызов моделей через API, автоматизация задач через ИИ — не «читал статьи», а собирал работающее
- Самостоятельность: умение взять расплывчатую задачу и довести до результата без микроменеджмента
Будет плюсом
- Опыт с другими BI-инструментами (Metabase / Looker / Tableau)
- Опыт со стримин