Interview Prep PackНабор для подготовки

Data Engineering Interview CheatsheetsШпаргалки к собеседованиям Data Engineer

A self-contained set of fast-revision cheatsheets for Senior/Lead Data Engineering interviews: concepts, diagrams, gotchas, interviewer probes, and flip-card self-quizzes. Every page is bilingual (EN/RU) with a dark/light theme. Самодостаточный набор шпаргалок для быстрого повторения перед собеседованиями на Senior/Lead Data Engineer: концепции, схемы, подводные камни, вопросы интервьюера и карточки для самопроверки. Каждая страница двуязычная (EN/RU), с тёмной и светлой темой.

Distributed systemsРаспределённые системы Spark · Kafka · Flink SQL · Iceberg · Airflow Data quality & testingКачество данных и тесты System designСистемный дизайн
01

Streaming & MessagingСтриминг и обмен сообщениями

Logs, partitions, delivery semantics, watermarks and stateful stream processing.Логи, партиции, семантики доставки, watermarks и stateful-обработка потоков.

Apache Kafka

Topics, partitions, ISR, delivery semantics, EOS, retention, failure modes.Топики, партиции, ISR, семантики доставки, EOS, хранение, режимы сбоев.
🟢 BeginnerНовичок 🔴 AdvancedПродвинутый
🌊

Apache Flink

Event vs processing time, watermarks, windowing, keyed state, checkpoint EOS.Event vs processing time, watermarks, окна, keyed state, EOS через чекпоинты.
🟢 BeginnerНовичок 🔴 AdvancedПродвинутый
02

Batch Compute & LanguageБатч-вычисления и язык

Distributed compute engines and the JVM language behind them.Движки распределённых вычислений и JVM-язык под ними.

✴️

Apache Spark

Driver/executors, DAG, shuffles, skew, broadcast joins, caching, Catalyst.Driver/executors, DAG, shuffle, перекос, broadcast join, кэширование, Catalyst.
Open →Открыть →

PySpark

DataFrame API, lazy eval, joins/windows, then shuffles, skew, partitioning, UDFs & tuning.DataFrame API, ленивые вычисления, join/окна, затем shuffle, перекос, партиционирование, UDF и тюнинг.
🟢 EssentialsОсновы 🔴 PerformanceПроизводительность 🟣 Coding drillsЗадачи
📕

Scala for Big DataScala для Big Data

Case classes, pattern matching, Option/Either, immutability, Dataset API.Case-классы, pattern matching, Option/Either, иммутабельность, Dataset API.
Open →Открыть →
🧠

Coding & AlgorithmsКод и алгоритмы

Arrays, hash maps, two pointers, heaps, trees/graphs, data-flavoured prompts.Массивы, хеш-таблицы, два указателя, кучи, деревья/графы, задачи на данные.
Open →Открыть →
🐍

Python & SQL

Idiomatic Python, pandas, typed/testable code, SQL windows, CTEs, optimization.Идиоматичный Python, pandas, типизированный код, оконные функции SQL, CTE, оптимизация.
Open →Открыть →
🐼

Pandas

Series/DataFrame, loc/iloc, groupby, merge, dtypes; then vectorization, memory, copy-vs-view, scale-out.Series/DataFrame, loc/iloc, groupby, merge, dtypes; затем векторизация, память, copy-vs-view, масштаб.
🟢 EssentialsОсновы 🔴 PerformanceПроизводительность
03

Distributed SystemsРаспределённые системы

The technical heart of senior DE. Three difficulty levels — start wherever you're comfortable and climb.Техническое ядро senior DE. Три уровня сложности — начни с комфортного и поднимайся.

🟢

BeginnerНовичок

Plain ideas and everyday analogies: what it is, why things fail, copies, splitting, idempotency, the CAP idea.Простые идеи и аналогии из жизни: что это, почему всё ломается, копии, разбиение, идемпотентность, идея CAP.
Open →Открыть →
🟡

IntermediateСредний

The real names and working knowledge: CAP/PACELC, consistency, quorums, consensus, exactly-once, watermarks.Настоящие термины и рабочее понимание: CAP/PACELC, согласованность, кворумы, консенсус, exactly-once, watermarks.
Open →Открыть →
🔴

AdvancedПродвинутый

Dense interview prep: failure-mode reasoning, PACELC, quorums, fencing, skew/shuffles, pipelines at scale.Плотная подготовка к интервью: рассуждения о сбоях, PACELC, кворумы, fencing, skew/shuffle, пайплайны на масштабе.
Open →Открыть →
04

Storage & Data ModelingХранение и моделирование данных

Table formats, warehousing, modeling, governance and lineage.Табличные форматы, warehousing, моделирование, governance и lineage.

🧊

Iceberg & WarehousingIceberg и warehousing

Table vs file format, hidden partitioning, ACID, time travel, schema evolution.Table vs file format, скрытое партиционирование, ACID, time travel, эволюция схемы.
🟢 BeginnerНовичок 🔴 AdvancedПродвинутый
📊

SQL & Data ModelingSQL и моделирование

Window functions, sessionization, dedup, funnels, SCD, grain, partitioning.Оконные функции, сессионизация, дедуп, воронки, SCD, грануляция, партиционирование.
Open →Открыть →
🗂️

Modeling, Governance & LineageМоделирование, governance, lineage

Dimensional modeling, metadata, data contracts, lineage, governance.Размерное моделирование, метаданные, data contracts, lineage, governance.
Open →Открыть →
05

Pipelines & PlatformПайплайны и платформа

Orchestration, pipeline design, DataOps/CI-CD and modernizing legacy systems.Оркестрация, дизайн пайплайнов, DataOps/CI-CD и модернизация legacy.

📅

Airflow & OrchestrationAirflow и оркестрация

DAG design, idempotency, retries, backfills, sensors, SLAs.Дизайн DAG, идемпотентность, ретраи, бэкфилы, сенсоры, SLA.
Open →Открыть →
🐳

Docker & ContainersDocker и контейнеры

Images vs containers, Dockerfile/layers, registries, volumes, Compose; containers vs VMs.Образы vs контейнеры, Dockerfile/слои, реестры, volumes, Compose; контейнеры vs ВМ.
Open →Открыть →
☸️

Kubernetes

Pods, Deployments, Services, control plane, reconciliation, self-healing, Jobs; vs Docker.Pods, Deployments, Services, control plane, reconciliation, самовосстановление, Jobs; vs Docker.
Open →Открыть →
🚀

Flyte

Kubernetes-native orchestrator: typed tasks/workflows, caching, versioning, dynamic fan-out; vs Airflow.Kubernetes-native оркестратор: типизированные task/workflow, кэширование, версионирование, динамический fan-out; vs Airflow.
Open →Открыть →
🛠️

Pipeline DesignДизайн пайплайнов

End-to-end design, idempotency, scheduling, dbt, vendor trade-offs.Сквозной дизайн, идемпотентность, расписания, dbt, выбор вендоров.
Open →Открыть →
☁️

Cloud, DataOps & CI/CD

Cloud data stack, IaC, testing in CI, deployment, observability.Облачный стек данных, IaC, тесты в CI, деплой, наблюдаемость.
Open →Открыть →
🏗️

Terraform & IaCTerraform и IaC

Infrastructure as Code: providers, resources, state, plan/apply, modules; declarative & multi-cloud.Infrastructure as Code: провайдеры, ресурсы, state, plan/apply, модули; декларативно и мультиоблачно.
Open →Открыть →
☁️

AWS vs Azure vs GCPAWS vs Azure vs GCP

The big-3 clouds, what makes Azure different, and the service-name map every data engineer needs.Большая тройка облаков, чем отличается Azure, и карта названий сервисов, нужная каждому DE.
Open →Открыть →
🏚️

Legacy ModernizationМодернизация legacy

Strangler/parallel-run, backfills, CDC, reconciliation, safe cutover.Strangler/parallel-run, бэкфилы, CDC, сверка, безопасный cutover.
Open →Открыть →
06

Quality, Testing & MLКачество, тестирование и ML

Making data trustworthy: testing, observability and ML-assisted quality.Как сделать данные надёжными: тестирование, наблюдаемость и ML для качества.

Software Testing for DEТестирование для DE

Test pyramid, pipeline testing, schema/freshness/null checks, CI gating.Пирамида тестов, тестирование пайплайнов, проверки схемы/свежести/null, гейтинг в CI.
Open →Открыть →
🔬

Data Quality & ObservabilityКачество данных и наблюдаемость

DQ dimensions, controls, monitors, anomaly detection, incident response.Измерения качества, контроли, мониторы, детекция аномалий, реакция на инциденты.
Open →Открыть →
🤖

ML/AI for Data Quality

ML-based anomaly detection, drift, validation and AI-assisted DQ.ML-детекция аномалий, дрейф, валидация и AI-помощь в контроле качества.
Open →Открыть →
07

System Design & DomainСистемный дизайн и домен

Designing a data platform end-to-end, plus a worked domain example.Сквозной дизайн дата-платформы плюс разобранный доменный пример.

🧩

System Design: Data PlatformСистемный дизайн: дата-платформа

Requirements, ingestion, storage, compute, serving, trade-offs at scale.Требования, ingestion, хранение, вычисления, отдача данных, компромиссы на масштабе.
Open →Открыть →
📈

Economics & Time-Series DomainДомен: экономика и временные ряды

Vintages, revisions, point-in-time, seasonality, frequency, bitemporal data.Vintages, ревизии, point-in-time, сезонность, частота, битемпоральные данные.
Open →Открыть →
08

Behavioral & CollaborationПоведенческое и взаимодействие

Values, mentorship, translating between stakeholders and data work, and the technique behind each question type.Ценности, менторство, перевод между стейкхолдерами и работой с данными, и техника под каждый тип вопроса.

🎯

Interview Question TypesТипы вопросов на интервью

The 3 shapes most questions take (experience · explain-simply · technical), the "why ladder", and how to prep each. Company-agnostic.3 формы, которые принимает большинство вопросов (опыт · объясни-просто · техника), «лестница почему» и как готовиться к каждой. Без привязки к компаниям.
Open →Открыть →
🏆

Behavioral & ValuesПоведенческое и ценности

Quality, ownership, ambiguity, cross-functional work. STAR-ready stories.Качество, ответственность, неопределённость, кросс-функциональность. Истории по STAR.
Open →Открыть →
🤝

Behavioral, Mentorship & ValuesПоведенческое, менторство, ценности

Mentoring, leadership, accountability and collaboration stories.Истории про менторство, лидерство, ответственность и сотрудничество.
Open →Открыть →
💬

Stakeholders & RequirementsСтейкхолдеры и требования

Translating vague asks into specs, managing stakeholders, scoping.Перевод размытых запросов в спеки, работа со стейкхолдерами, скоупинг.
Open →Открыть →
How to use: each page works offline and remembers your language and theme. Read concepts, study the "interviewer will probe" callouts, then flip the self-quiz cards and answer out loud before revealing. Как пользоваться: каждая страница работает офлайн и запоминает язык и тему. Читай концепции, разбирай блоки «о чём спросит интервьюер», затем переворачивай карточки самопроверки и отвечай вслух до того, как открыть ответ.