← Back to list

Fully Serverless CDC Lakehouse - AWS Summit Seoul 2026

행사 정보

강은호 in Monday9pm · 2026-06-02 02:15 · 2 claps · 6.2 min read
#aws #data #serverless
Open on Medium ↗
Wiki topics: ☁️ · DevOps & Cloud

Fully Serverless CDC Lakehouse - AWS Summit Seoul 2026

행사 정보

[embed]강연 목록 | AWS Summit Seoul 2026 메인 콘텐츠로 건너뛰기 2026년 5월 20일(수)-21일(목) | 코엑스 컨벤션 센터 AWS Summit Seoul 2026에서는 클라우드 마이그레이션부터 AI까지, 이틀 간 100여 개의 주제별 세부 강연이…aws.amazon.com

[embed]Seoul Summit Agenda - AWS Summit 서울 2026 AWS Summit 서울 2026의 전체 세션 일정을 한눈에 확인하세요. 세션 검색, 난이도 및 날짜별 필터, 테이블/캘린더 보기를 지원합니다.summit.awsclassroom.kr

발표 자료

[embed]Serverless CDC Lakehouse.pdf Edit descriptiondrive.google.com

입문자를 위한 용어 가이드

데이터 아키텍처 기초

  • OLTP vs OLAP: 운영 DB(OLTP)는 짧은 트랜잭션을, 분석 DB(OLAP)는 대용량 집계 쿼리를 처리하도록 설계가 완전히 다릅니다.
  • Data Lake: 정형/비정형 데이터를 가공 없이 원본 그대로 저장소(보통 S3)에 쌓아두는 방식입니다.
  • Data Warehouse: 분석 목적에 맞게 정제된 데이터를 전용 클러스터(예: Redshift)에 적재하는 방식입니다.
  • Data Lakehouse️️⭐️: S3 같은 값싼 오브젝트 스토리지 위에 트랜잭션·스키마 진화·시간 여행 같은 웨어하우스급 기능을 메타데이터 계층으로 얹어, 한 벌의 데이터 위에서 분석을 수행할 수 있게 만든 아키텍처입니다.
  • ETL: 데이터를 추출(Extract)·변환(Transform)·적재(Load)하는 데이터 파이프라인의 일반적인 처리 패턴입니다.
  • 데이터 신선도(Freshness): 분석 데이터가 운영 데이터로부터 얼마나 뒤처져 있는지를 나타내는 지표입니다.

CDC와 복제 방식

  • Batch 복제: 주기적으로 테이블을 SELECT로 통째로 읽어 옮기는 단순하지만 부하가 큰 방식입니다.
  • CDC(Change Data Capture)⭐️: DB의 INSERT/UPDATE/DELETE 변경 이벤트만 뽑아내 다른 시스템으로 흘려보내는 기법입니다.
  • WAL(Write-Ahead Log): DB가 데이터 파일을 갱신하기 전에 변경 사항을 먼저 디스크 로그에 기록해 장애 복구와 복제를 가능하게 하는 메커니즘이며, PostgreSQL의 CDC는 이 WAL을 구독해 동작합니다.
  • Full Load + CDC: 초기 1회 전체 스냅샷을 복제한 뒤 그 이후의 변경분만 이어 붙이는 표준 CDC 도입 패턴입니다.
  • MERGE⭐️: 기존 테이블에 UPDATE, INSERT, DELETE를 한 번에 처리하는 SQL 구문입니다.

저장 포맷과 Iceberg

  • Parquet⭐️: 데이터를 컬럼 단위로 묶고 컬럼별 통계까지 파일 안에 내장하는 오픈소스 컬럼형 포맷으로, 필요한 컬럼·청크만 골라 읽고 압축률이 높아 분석 워크로드에서 표준처럼 쓰이며, Iceberg 테이블의 실제 데이터 파일도 결국 Parquet입니다.
  • Open Table Format: S3 위 파일들을 데이터베이스 테이블처럼 다룰 수 있게 해주는 메타데이터 규약(Iceberg/Delta/Hudi)입니다.
  • Apache Iceberg: 스냅샷·스키마 진화·ACID를 지원하는 대표적 오픈 테이블 포맷이며 AWS Glue가 기본 지원합니다.
  • Iceberg 메타데이터 계층: Catalog → Metadata File → Manifest List → Manifest File → Parquet Data File 순으로 위에서 아래로 파일 위치를 추적하는 트리 구조입니다.
  • 파티션(Partition)⭐️: 테이블 데이터를 특정 컬럼 값(예: 날짜·지역·이벤트 타입)을 기준으로 물리적으로 잘라 서로 다른 폴더·파일로 분리 저장하는 방식이며, 쿼리 시 조건에 해당하는 파티션만 골라 읽도록 해서 스캔 양과 비용을 크게 줄여주는 데이터 레이크의 가장 기본적인 성능 최적화 기법입니다.
  • 파티션 프루닝(Partition Pruning): 쿼리 조건에 맞지 않는 파티션은 아예 읽지 않아 스캔 양을 줄이는 최적화입니다.
  • COW vs MOR⭐️: Copy-on-Write는 변경된 행이 포함된 데이터 파일을 통째로 재작성해 읽기는 빠르지만 쓰기 증폭이 크고, Merge-on-Read는 원본 데이터 파일은 그대로 두고 삭제·갱신을 표현하는 delete 파일을 추가로 써서 읽을 때 병합하므로 쓰기는 가볍지만 컴팩션 없이는 읽기 비용이 점점 커집니다.
  • Compaction: 작은 파일들을 큰 파일로 병합해 읽기 성능과 비용을 개선하는 유지 작업입니다.

AWS 서비스

  • AWS RDS: AWS가 관리해주는 관계형 데이터베이스(PostgreSQL 등) 서비스입니다.
  • Amazon S3: 사실상 무제한의 객체 스토리지로, Lakehouse의 저장소 역할을 합니다.
  • AWS DMS(Database Migration Service)⭐️: 서로 다른 종류의 DB 간 일회성 이전부터 동종 DB 간 실시간 복제까지를 모두 관리형으로 처리해주는 AWS의 데이터 이동 서비스로, Source Endpoint(원천)·Target Endpoint(대상)·Task(작업 정의) 세 가지만 설정하면 Full Load(초기 전체 복제)와 CDC(이후 변경분 추적)를 한 흐름으로 자동 실행해줍니다.
  • Glue Job⭐️: 빅데이터 처리의 표준 엔진인 Apache Spark를 서버리스로 감싼 AWS의 관리형 ETL 실행 환경으로, PySpark 또는 Scala로 코드만 작성하면 클러스터를 직접 띄우지 않고도 S3·RDB·Iceberg 사이의 대용량 데이터 변환·적재 작업을 실행할 수 있습니다.
  • Glue Data Catalog: 빅데이터 생태계의 표준 메타데이터 저장소인 Hive Metastore와 호환되는 AWS의 서버리스 카탈로그로, 어떤 테이블이 S3 어디에 어떤 스키마로 있는지를 중앙에서 관리합니다.
  • AWS Athena: S3 위 데이터에 SQL을 던지면 결과를 돌려주는 서버리스 쿼리 엔진(내부적으로 Trino 기반)이며, 클러스터 관리 없이 스캔한 데이터 양에 따라 과금됩니다.
  • S3 Lifecycle Policy: S3 객체를 일정 기간 후 자동으로 삭제하거나 저렴한 스토리지 클래스로 옮기는 규칙입니다.
  • Amazon Redshift / EMR / SageMaker: 각각 데이터 웨어하우스, 빅데이터 처리 클러스터, ML 플랫폼으로 같은 Iceberg 테이블을 공유해 쓸 수 있습니다.
  • AWS Lake Formation: 데이터 레이크에 대한 세밀한 권한 제어와 거버넌스를 담당하는 서비스입니다.

Spark/Glue Job

  • Apache Spark⭐️: 대용량 데이터를 분산 처리하는 클러스터 컴퓨팅 엔진으로, Glue Job의 내부 실행 엔진입니다.
  • PySpark: Spark를 파이썬으로 다루는 API입니다.
  • Glue Worker / G.1X·G.2X: Glue Job이 사용하는 워커 단위와 인스턴스 타입으로, 개수·타입·실행 시간이 비용을 결정합니다.

운영·인프라 방법론

  • Serverless: 사용자가 서버를 직접 띄우거나 관리하지 않고 사용량 기반으로 과금되는 실행 모델입니다.
  • Auto Scaling: 부하에 맞춰 컴퓨팅 자원을 자동으로 늘리고 줄이는 메커니즘입니다.
  • IaC(Infrastructure as Code): 인프라를 코드로 선언해 버전 관리·재현·자동 배포할 수 있게 하는 방식입니다.
  • Pulumi: 일반 프로그래밍 언어(TS/Python 등)로 클라우드 인프라를 정의하는 IaC 도구입니다.

메타데이터
post_id
01a1205dd40d
slug
fully-serverless-cdc-lakehouse-aws-summit-seoul-2026-01a1205dd40d
url
https://monday9pm.com/fully-serverless-cdc-lakehouse-aws-summit-seoul-2026-01a1205dd40d
canonical_url
https://monday9pm.com/fully-serverless-cdc-lakehouse-aws-summit-seoul-2026-01a1205dd40d
author_url
https://medium.com/@ghdmsrkd
status
ok
fetched_at
2026-06-11 10:13:20