본문으로 건너뛰기

데이터 품질

GenD의 4축 데이터 품질(DQ) 점수 측정 및 모니터링 방법을 안내합니다.

데이터 품질

사전 준비

  • 관리자 권한으로 로그인되어 있어야 합니다
  • 샘플 데이터가 적재되어 있어야 합니다 (의도적 DQ 결함 포함)

DQ 4축 개요

GenD는 4가지 축으로 데이터 품질을 측정합니다:

설명측정 예시
Completeness필수 필드의 NULL 비율customers.email NULL 2%
Uniqueness중복 레코드 비율PK 중복 여부
Freshness데이터의 최신성미래 날짜 레코드, 마지막 갱신 시점
Consistency형식/논리적 일관성전화번호 형식 오류, FK 불일치

4축 점수를 종합하여 composite score를 산출합니다.

1단계: 품질 대시보드 확인

사이드바 → 거버넌스 → 데이터 품질 메뉴(/governance/quality — 개요/규칙/이력 탭)에서 데이터 품질 대시보드를 확인합니다. 테이블별 4축 점수와 종합 점수가 표시됩니다.

2단계: 테이블별 품질 상세 조회

특정 테이블을 선택하면 축별 상세 결과를 확인할 수 있습니다.

customers 테이블 예상 결과:

  • Completeness: ~97.5% (email NULL 2%, gender NULL 0.5%)
  • Uniqueness: 100% (UUID PK)
  • Freshness: ~99.9% (미래 birth_date 0.1%)
  • Consistency: ~99% (전화번호 형식 오류 1%)

3단계: SQL로 직접 검증

SQL 에디터에서 품질 결함을 직접 쿼리합니다:

-- Completeness 검증: NULL 비율
SELECT
ROUND(CAST(SUM(CASE WHEN email IS NULL THEN 1 ELSE 0 END) AS DOUBLE) / COUNT(*) * 100, 2) AS null_email_pct,
ROUND(CAST(SUM(CASE WHEN gender IS NULL THEN 1 ELSE 0 END) AS DOUBLE) / COUNT(*) * 100, 2) AS null_gender_pct
FROM sourcedb.public.customers;
-- Consistency 검증: 고아 FK
SELECT COUNT(*) AS orphan_count
FROM iceberg.card.transactions t
LEFT JOIN sourcedb.public.customers c ON t.customer_id = c.customer_id
WHERE c.customer_id IS NULL;

4단계: 품질 규칙 설정

품질 규칙을 생성하여 자동 모니터링을 설정합니다:

  • 규칙명: "customers email completeness"
  • 테이블: sourcedb.public.customers
  • : completeness
  • 임계값: NULL 비율 5% 이하
  • 알림: 임계값 초과 시 알림 발송

5단계: 품질 추이 모니터링

시간에 따른 품질 점수 변화를 추적합니다. 품질 저하가 감지되면 알림이 발송됩니다.


AI Agent Chat으로 수행하기

위의 모든 단계를 AI Agent Chat에서 자연어로 수행할 수 있습니다. 각 페이지 상단의 AI에게 요청 버튼을 클릭하면 현재 화면을 유지하면서 우측에 AI 채팅 패널이 열립니다.

AI Agent Chat 사이드 패널에서 대화

대화 예시

사용자: "전체 데이터 품질 현황 알려줘"
AI: [get_quality_summary 호출] → 전체 테이블 평균 품질 점수는 94.2점입니다. Completeness 96.8%, Uniqueness 99.7%, Freshness 93.1%, Consistency 87.2%.

사용자: "orders 테이블 품질 점수 계산해줘"
AI: [get_table_quality 호출] → orders 테이블 종합 점수 91.5점입니다. Completeness 98%, Uniqueness 100%, Freshness 88%, Consistency 80%.

사용자: "품질 점수가 낮은 테이블 목록 보여줘"
AI: [get_quality_summary 호출] → 종합 점수 기준 하위 3개 테이블: transactions(85.3), fraud_labels(87.1), consultations(89.4). 주로 Freshness와 Consistency 축에서 감점되었습니다.

AI Agent Chat은 44개 플랫폼 도구를 활용하여 데이터 탐색, SQL 생성, 거버넌스 조회 등을 자동으로 수행합니다. 자세한 내용은 AI Agent Chat 가이드를 참조하세요.

다음 단계