데이터 인제스천
어떤 수집 기능을 쓸지 모르겠다면
데이터 수집, 어떤 기능으로? 결정 가이드를 먼저 보세요.
GenD에서 문서를 업로드하면 PostgreSQL(메타데이터) + Vector DB(임베딩) + Graph DB(관계)에 동시 적재됩니다.

사전 준비
- 관리자 권한으로 로그인
- 적재할 문서 준비 (PDF, DOCX, HWP, XLSX, TXT, MD 등)
1단계: 적재 정책 생성
Policies 탭에서 컬렉션별 적재 정책을 먼저 생성합니다.

[+ Create Policy] 버튼을 클릭하면 정책 생성 폼이 열립니다.

| 설정 | 설명 |
|---|---|
| Collection Name | 문서 그룹 이름 (예: marketing-reports) |
| Chunking Strategy | 문서 분할 방식 (fixed_size / sentence / recursive) |
| Vector Backend | 벡터 DB 선택 (Weaviate / Milvus) |
| Graph Store | ArangoDB 문서 그래프 활성화 |
| Auto Enrich | 적재 후 LLM 요약/키워드/분류 자동 실행 |
| Vector Sync Fields | 벡터 DB에 메타데이터 동기화할 필드 (tags, category, summary) |
2단계: 문서 업로드
Files 탭에서 [+ 파일 업로드] 버튼을 클릭합니다.

- 파일을 선택합니다
- 컬렉션명을 입력합니다 (정책과 매칭)
- 보안 등급을 선택합니다 (Public / Confidential / Top Secret)
- 적재 정책을 선택합니다
업로드 후 Dagster 파이프라인이 자동으로 실행됩니다:
- 파싱 → 메타데이터 추출 → PostgreSQL 저장
- 청킹 → 임베딩 → Vector DB 저장
- 문서 노드/관계 → Graph DB 저장
3단계: 적재 결과 확인
Files 탭에서 각 파일의 Stores 컬럼으로 스토어별 적재 상태를 확인합니다.
- 초록 뱃지: 적재 성공
- 빨간 뱃지: 적재 실패 (Retry 버튼으로 재시도)
4단계: 대시보드 모니터링
Dashboard 탭에서 전체 적재 현황을 확인합니다.

- PostgreSQL: 메타데이터 저장 현황
- Vector DB: 벡터 임베딩 저장 현황
- Graph DB: 문서 그래프 저장 현황
- Failed Files: 실패한 파일 목록 + 일괄 재시도
지원 파일 형식
| 형식 | 확장자 | 파서 |
|---|---|---|
| Docling | ||
| Word | .docx | Docling |
| 한글 | .hwp | GenD 자체 |
| Excel | .xlsx | Docling |
| 텍스트 | .txt, .md | 내장 |
| 이미지 | .png, .jpg | OCR |
| 오디오 | .wav, .mp3 | Whisper |
아키텍처
문서 적재 시 3개 스토어에 document_id(UUID)로 연결됩니다:
| 스토어 | 저장 내용 | 용도 |
|---|---|---|
| PostgreSQL | 메타데이터 (title, author, tags, category) | 구조화 검색, 거버넌스 |
| Vector DB | 텍스트 chunk + 임베딩 | 의미 검색, RAG |
| Graph DB | 문서→chunk, 문서→테이블, 문서→태그 관계 | 관계 탐색, 리니지 |
AI Agent Chat으로 수행하기
위의 모든 단계를 AI Agent Chat에서 자연어로 수행할 수 있습니다. 각 페이지 상단의 AI에게 요청 버튼을 클릭하면 현재 화면을 유지하면서 우측에 AI 채팅 패널이 열립니다.

대화 예시
사용자: "등록된 데이터 소스 목록 보여줘"
AI: [list_connectors 호출] → 현재 3개의 데이터 소스가 등록되어 있습니다: iceberg(S3), sourcedb(PostgreSQL), card_crm(PostgreSQL).
사용자: "S3에서 CSV 파일을 수집하는 방법 알려줘"
AI: S3 Collector를 사용합니다. Connectors 메뉴에서 S3 타입 연결을 생성하고, Ingestion 메뉴에서 버킷 경로와 대상 테이블을 지정하면 됩니다. 파이프라인 생성을 도와드릴까요?
사용자: "수집된 파일 목록 보여줘"
AI: [list_ingestion_jobs 호출] → 최근 수집 작업 5건의 상태와 처리 건수를 보여드립니다.
팁
AI Agent Chat은 44개 플랫폼 도구를 활용하여 데이터 탐색, SQL 생성, 거버넌스 조회 등을 자동으로 수행합니다. 자세한 내용은 AI Agent Chat 가이드를 참조하세요.
관련 기능
- 파일·문서 수집 시작하기 — 외부 소스에서 문서를 주기적으로 반입하는 수집 파이프라인
- 인제스천 파이프라인 가이드 — 소스 유형, 스케줄, 실행·재시도, 증분 수집 상세