본문으로 건너뛰기

샘플 데이터

GenD는 데모 환경에서 바로 사용할 수 있는 샘플 데이터셋을 제공합니다. 금융(카드사) 도메인을 기반으로 11개 테이블, 약 222만 행의 현실적인 데이터가 포함되어 있습니다.

데이터셋 개요

카탈로그스키마테이블행 수설명
sourcedbpubliccustomers100,000고객 마스터 (이름, 이메일, 전화, 주소, 생년월일)
sourcedbpublicaccounts150,000계좌 정보 (고객별 1~3개 계좌)
sourcedbpubliccredit_assessments200,000신용 평가 이력
sourcedbpublicmerchants10,000가맹점 정보
sourcedbpublicconsultations50,000고객 상담 이력
sourcedbpublicmarketing_consents100,000마케팅 동의 내역
sourcedbpubliccustomer_segments100,000고객 세그먼트
icebergcardtransactions1,000,000카드 거래 내역 (Iceberg 테이블)
icebergcardfraud_labels10,000이상거래 라벨 (ML 학습용)
icebergcardproducts18카드 상품 마스터
icebergcardapp_events500,000앱 이벤트 로그

sourcedb (PostgreSQL)

sourcedb 카탈로그에는 고객, 계좌, 가맹점 등 운영계 데이터가 저장됩니다.

  • customers: 고객의 기본 정보. PII(개인식별정보) 컬럼이 포함되어 있어 PII 탐지 및 마스킹 기능을 테스트할 수 있습니다.
  • accounts: 고객별 계좌 정보. customer_id로 customers 테이블과 조인됩니다.
  • credit_assessments: 신용 평가 기록. 시계열 분석 및 품질 점수 검증에 활용됩니다.
  • merchants: 가맹점 마스터. 거래 내역과 조인하여 가맹점별 분석이 가능합니다.

iceberg (Apache Iceberg)

iceberg 카탈로그에는 대용량 분석 데이터가 Iceberg 포맷으로 저장됩니다.

  • transactions: 100만 건의 카드 거래 내역. Time Travel 및 데이터 리니지 기능을 체험할 수 있습니다.
  • fraud_labels: 이상거래 탐지 모델 학습용 라벨 데이터.
  • products: 카드 상품 18종의 마스터 데이터.
  • app_events: 50만 건의 앱 이벤트 로그.

데이터 시딩

샘플 데이터는 make seed-demo 명령으로 시딩할 수 있습니다:

make seed-demo

이 명령은 다음 작업을 수행합니다:

  1. PostgreSQL(sourcedb)에 스키마 생성 및 데이터 적재
  2. Iceberg(card) 테이블 생성 및 데이터 적재
  3. 메타데이터(카탈로그 동기화, PII 태그 등) 초기화
노트

시딩에는 약 2~3분이 소요됩니다 (환경에 따라 다를 수 있음). 이미 데이터가 존재하는 경우 중복 적재 없이 건너뜁니다.

데이터 확인

시딩이 완료되면 SQL Editor에서 아래 쿼리로 확인할 수 있습니다:

-- 전체 테이블별 행 수 확인
SELECT 'sourcedb.public.customers' AS table_name, count(*) AS row_count FROM sourcedb.public.customers
UNION ALL
SELECT 'sourcedb.public.accounts', count(*) FROM sourcedb.public.accounts
UNION ALL
SELECT 'iceberg.card.transactions', count(*) FROM iceberg.card.transactions
UNION ALL
SELECT 'iceberg.card.fraud_labels', count(*) FROM iceberg.card.fraud_labels

Catalog 탐색


다음 단계: 첫 번째 AI 질문에서 자연어로 데이터를 질의하는 방법을 알아보세요.