Back

Explore every episode of the podcast Data Engineering від А до Я

Dive into the complete episode list for Data Engineering від А до Я. Each episode is cataloged with detailed descriptions, making it easy to find and explore specific topics. Keep track of all episodes from your favorite podcast and never miss a moment of insightful content.

Rows per page:

1–27 of 27

TitlePub. DateDuration
Найдорожчі фейли дата-інженерів: Чому дані не пробачають DELETE03 Mar 202600:12:33

Що відрізняє джуніора від сеньйора? Сеньйор точно знає, скільки компанії коштував його останній факап. Починаємо другий сезон з найболючішого — реальних, дорогих і дуже життєвих помилок в Data Engineering.

У цьому випуску ми не шукаємо винних, ми шукаємо дірки в архітектурі. Розбираємо історії, від яких по спині тече холодний піт, і вчимося будувати системи, стійкі до людського фактора.

Data Engineering Testing: від unit-тестів до інтеграції з dbt30 Sep 202500:18:01

У цьому випуску ми говоримо про тестування в дата-інжинірингу. Які види тестів варто застосовувати — від unit- і інтеграційних до end-to-end і контрактних. Розбираємо, що саме тестують у світі даних: схеми баз, трансформації, пайплайни, бізнес-правила та якість результатів. Окремо зупиняємось на ролі dbt у тестуванні: вбудовані тести, кастомні перевірки й те, як dbt допомагає зробити контроль якості даних частиною щоденного робочого процесу. Це практичний огляд для інженерів даних, які хочуть будувати більш надійні пайплайни.

Avro та Protobuf у Data Engineering: схеми для якісних даних16 Sep 202500:20:20

Щоб дані залишались узгодженими і зрозумілими, інженери даних використовують спеціальні формати опису схем. У цьому випуску ми розглянемо два найпопулярніших варіанти — Apache Avro та Google Protobuf. Ми пояснимо, як вони працюють, чим відрізняються, які переваги та обмеження мають. Ви дізнаєтесь, чому Avro зручний для schema evolution, а Protobuf — для високошвидкісних систем, і як обрати правильний інструмент для своїх data pipelines.

Також не забувайте підписуватись на каналта писати коменти під відео :)

Якість даних для Data Engineering: що міряти і як тримати SLA01 Sep 202500:12:15

Пояснюємо, що таке Data Quality (якість даних) і як її вимірювати без «води». Розберемо «погані дані» та бізнес-виміри (Descriptive, User-driven), технічні метрики (Availability, Freshness, Uniqueness, Completeness, Schema validity + Consistency), і як оформити це у scorecard з чіткими SLA/SLI/SLO. Покажемо, як вшити тести якості у пайплайни/DAG (дедуп, non-NULL, обсяги, аномалії), налаштувати алерти й observability (метрики, логи, lineage) та використовувати data contracts для стабільних схем. Завершимо практикою: старт з 3 ключових датасетів і 3–5 базових тестів. Підписуйтесь — випуск максимально практичний.

Data Orchestration: від cron до DAG — глибше за Airflow22 Aug 202500:07:52

Ми вже говорили про Airflow як приклад оркестратора. У цьому епізоді йдемо ширше й глибше: пояснюємо, що таке data orchestration, навіщо вона потрібна та як виглядає зріла оркестрація поза межами одного інструмента. Розберемо історичні болі cron (залежності, продуктивність, «клейовий» код, data silos), три основні кроки collection → unification → activation, типи платформ (інженерні Airflow/Dagster, модельні dbt, low/no-code), роль DAG (upstream/downstream, без циклів, паралельність). Поговоримо про тригери (time/event/manual), SLA, алерти, retries, idempotency, чеки якості, а також observability (метрики, логи, lineage), вартість і RBAC. Наприкінці — як почати перехід від cron до керованих DAG і вибрати стек під вашу команду.

SQL: Query, DDL vs DML та життєвий цикл запиту (Query Life Cycle)11 Aug 202500:06:12

У цьому епізоді просто й по суті: пояснюємо, що таке query (запит) у СУБД, чітко розводимо DDL vs DML(структура проти даних) і проходимо Query Life Cycle від парсера та оптимізатора до виконання плану зі стадіями wait → read → compute → write. Розберемо ключові команди без коду:
— DDL: CREATE, ALTER, DROP, TRUNCATE, RENAME, INDEX;
— DML: SELECT, INSERT, UPDATE, DELETE, MERGE.
Пояснимо, як думати про партиціювання (PARTITION BY), кластеризацію (CLUSTER BY) і фільтри до JOIN, щоб запити працювали швидше й дешевше.

Підписуйтесь, буде практично й без «води».

Steps of Dimensional Modeling: 4 кроки на прикладі оренди e-самокатів06 Aug 202500:06:33

У 21-му випуску ми покроково проведемо вас крізь процес Dimensional Modeling за методологією Кімбалла. На прикладі компанії з оренди електросамокатів ви дізнаєтеся:

  1. Select the business process – чому grain = одна завершена поїздка.

  2. Declare the grain – як вибір атомарного рівня деталізації дає гнучкість у запитах.

  3. Identify the dimensions – створюємо таблиці Rider (SCD1), City (SCD2) і Vehicle + mini-dimension (SCD4).

  4. Identify the facts – які метрики (duration, distance, price, pauses, rating) варто зберігати в fact table.

Наприкінці епізоду словесно опишемо, як у BigQuery побудувати датасет, налаштувати партиціювання за датою та кластеризацію за ключами вимірювань для максимальної продуктивності ваших аналітичних запитів.

Підпишіться, щоб не пропустити детальні гайди з практичною реалізацією!

Dimensional Modeling: OLTP vs OLAP, освоюємо Kimball’s Star Schema (Зіркова схема Кімбела) та Slowly Changing Dimension (SCD, повільно змінювана розмірність)01 Aug 202500:10:32

У цьому випуску ми просто й зрозуміло розкажемо:

  • OLTP vs OLAP: навіщо потрібні окремі оперативні й аналітичні бази даних.

  • Star Schema by Kimball: як факти (fact table) у центрі та виміри (dimension tables) навколо допомагають робити запити швидко й зрозуміло.

  • Snowflake Schema: коли варто нормалізувати виміри, щоб зекономити місце.

  • Slowly Changing Dimension (SCD): п’ять способів (Type 0–4) зберегти історію змін атрибутів.

Після цього епізоду ви знатимете, як правильно спроєктувати модель даних для свого data warehouse. Підпишіться, щоб не пропустити інші корисні випуски!

Вступ до Data Modeling: Як перетворити бізнес-вимоги на таблиці26 Jul 202500:08:15

У цьому випуску — introduction to data modeling для data engineers. Розбираємо три рівні моделювання: conceptuallogical та physical. Пояснюємо, що таке granularitynormalizationprimary keysforeign keys та як усе це допомагає побудувати зрозумілу, масштабовану аналітичну систему.

📦 На прикладі продуктової мережі моделюємо процес продажів: від бізнес-процесу до BigQuery-таблиць.

Це — основи, без яких неможливо побудувати якісний data warehouse чи data product.

👉 У наступному випуску поговоримо про Kimball’s Dimensional Modeling

Підпишись, щоб не пропустити продовження!

Ingest with Python — pandas та PySpark у data pipelines23 Jul 202500:06:58

Цей випуск завершує серію про ingestion-методи. Говоримо про два популярних інструменти з Python-екосистеми — pandas та PySpark.
Коли варто використовувати кожен? Як зчитувати, обробляти і завантажувати дані з CSV, BigQuery або DataFrame-структури? Чим відрізняються RDD, DataFrame і Dataset у Spark?

Щоб не пропустити нові епізоди — підпишіться на подкаст ✨

Real-Time Ingestion без магії — CDC та Streaming Explained (Kafka)22 Jul 202500:06:31

Real-time ingestion — це вже не розкіш, а норма. У цьому випуску розбираємо, як працює CDC (Change Data Capture), чим він відрізняється від Kafka, і які існують варіанти стримінгових платформ для обробки подій у реальному часі.

SFTP vs API vs Object Storage: Битва ingestion-методів15 Jul 202500:07:29

У цьому випуску — глибоке занурення у три архітектурно різні способи інжесту: від старої школи (SFTP) до REST API та сучасних data lake-підходів через object storage. Пояснюю на прикладах, коли обрати який.

Push чи Pull: як обрати правильну стратегію для data ingestion15 Jul 202500:07:55

Push чи Pull? Розбираємось, як саме дані потрапляють у систему: хто ініціює передачу, як це впливає на швидкість, надійність і масштабування. Порівнюємо обидва підходи з реальними прикладами.

Stream Ingestion — нова ера Data Ingestion08 Jul 202500:06:59

Stream ingestion — новий підхід до data ingestion у реальному часі. У цьому епізоді: різниця з batch, delivery semantics, обробка помилок і практичний приклад з Pub/Sub → BigQuery. Мінімум теорії, максимум користі.

Data Ingestion по-старому: батч, snapshot і BigQuery08 Jul 202500:08:27

Batch ingestion — це класика data ingestion. Пояснюємо, як працює завантаження даних пачками: по часу чи обсягу, snapshot чи інкрементально. І показуємо практичний приклад з BigQuery та біткоїном.

Принципи хорошої Cloud Data Architecture11 Jun 202500:06:34

Побудувати щось у хмарі може кожен. Побудувати так, щоб воно було надійне, гнучке, дешеве і безпечне — вже інше питання. У цьому випуску говоримо про 5 ключових принципів Cloud Data Architecture, які справді працюють.

Весь ІТ у трьох літерах: розбираємо IaaS, PaaS, SaaS11 Jun 202500:06:28

IaaS, PaaS і SaaS — не просто модні слова. Це різні способи використовувати хмару. Розбираємось, що вони значать, які є приклади, і як зрозуміти, що підійде саме тобі.

Cloud Data Architecture простими словами08 Jun 202500:08:02

Після оркестраторів переходимо до великої картини: як виглядає сучасна хмарна архітектура для даних. Пояснюємо, що таке Lambda, Kappa та Medallion — простими словами, з прикладами з життя. Якщо хочеш зрозуміти, як великі компанії будують data-системи — це твоя відправна точка.

Prefect, Dagster, Mage: чим вони кращі (або простіші) за Airflow?08 Jun 202500:05:49

Airflow — це круто, але іноді занадто важко. У цьому випуску розбираємо, які ще інструменти керують пайплайнами: що обрати, якщо ти тільки починаєш, чим різняться стилі, і де Mage кращий за Airflow. Просто, по суті й з прикладами.

Airflow не магія. Це просто — якщо знаєш, що таке DAG06 Jun 202500:05:26

Airflow звучить як щось складне? Насправді все простіше, ніж здається. У цьому випуску пояснюємо, що таке DAG, чому саме на ньому тримається оркестрація, і як Airflow допомагає не втратити контроль, коли пайплайнів стає більше. Без термінів, але з прикладами.

Пайплайни не слухаються? Ось як навести порядок у світі даних04 Jun 202500:05:13

Усе летить, дашборди не оновлюються, пайплайни запускаються коли заманеться — знайомо? У цьому випуску розбираємося, що таке оркестрація даних і чому без неї навіть найкращий pipeline перетворюється на головний біль. 

Data pipeline — що це таке і чому без нього в хмарі не обійтись01 Jun 202500:07:17

Сьогодні говоримо про те, як дані рухаються. Що таке data pipeline, чим він відрізняється від скрипта на cron і чому без нього твої дані або загубляться, або ніколи не дійдуть до дашборду.

Хмара — це не магія. Але без неї ти далеко не зайдеш01 Jun 202500:07:34

Сьогодні розбираємося, що таке хмара і чому без неї не обійтись інженеру даних. Що зберігати в AWS, навіщо тобі S3, і чи правда, що хмара — це просто чужий комп’ютер.

База ≠ сховище. Ти точно знаєш, де живуть твої дані?31 May 202500:07:55

Сьогодні розбираємося, чим відрізняється база від data warehouse, що таке data lake і чому lakehouse — не просто нова модна назва. Якщо досі здається, що “все в таблицях” — цей випуск для тебе.

Звідки беруться дані? Правда, яку не розказують на курсах31 May 202500:05:34

Дані не беруться з повітря. І не живуть самі по собі. Розповідаємо, як вони народжуються, перетворюються і чому кожен етап — це ще один шанс усе зламати.

Data Engineer — а що далі? Ти здивуєшся, з ким доведеться працювати31 May 202500:07:58

Сьогодні розбираємося, куди потрапляє Data Engineer після оферу. Які бувають структури команд, хто є хто у світі даних і чому аналітик — не твій головний союзник (але й не ворог). Якщо думаєш, що будеш просто писати пайплайни в куточку — тримайся, бо все складніше (і цікавіше).

Data Engineer — нова золота жила в IT? Ось з чого почати!28 May 202500:06:57

Дізнайся, хто такий Data Engineer, чим він відрізняється від аналітика чи дата-сайентіста, навіщо бізнесу ця роль і з чого почати шлях у цій професії. Просто, без води і для новачків.

© My Podcast Data · Independent project · Data from Apple & Spotify