데이터 수집
데이터 수집은 PDF, DOCX, HWP 등 다양한 비정형 문서를 GenD 플랫폼에 업로드하고, AI 검색 및 RAG(Retrieval-Augmented Generation)에 활용할 수 있도록 처리하는 기능입니다. 업로드된 문서는 텍스트 추출, 청킹(chunking), 임베딩 변환을 거쳐 PostgreSQL(메타데이터) + Vector DB(임베딩) + Graph DB(관계) 3개 스토어에 동시 적재됩니다.
통합 인제스천 워크스페이스
문서 적재는 단일 파일·문서 수집 메뉴(/ingestion — 파이프라인 / 실행 /
문서 3탭)로 통합되었습니다. 파이프라인 등록·배치 실행·진척 모니터링·실패
재시도 전 과정은 인제스천 파이프라인 가이드를 참고하세요.
마이그레이션: 구 자동 수집(Auto Collection) 화면(
/collections)은 제거되었고, 소스 등록과 실행 이력은 이 허브가 승계합니다./collection/*API 는 파이프라인의 소스 정의 저장·연결 테스트 용도로 계속 사용됩니다. 상세는 구 자동 수집 화면에서의 이관 절을 보세요.
인제스천 파이프라인

화면 구성
인제스천 화면은 3개 탭으로 구성됩니다.
Files 탭
파일 목록을 조회하고 새 문서를 업로드합니다. 각 파일 행에 Stores 컬럼이 표시되어 스토어별 적재 상태를 뱃지로 확인할 수 있습니다.
| 뱃지 | 의미 |
|---|---|
| PG (초록) | PostgreSQL 메타데이터 적재 성공 |
| Vec (초록) | Vector DB 임베딩 적재 성공 |
| Graph (초록) | Graph DB 관계 적재 성공 |
| 빨간 뱃지 | 해당 스토어 적재 실패 (Retry 가능) |
파일을 드래그 앤 드롭하거나 [+ 파일 업로드] 버튼을 클릭하여 문서를 업로드합니다.

업로드 시 다음 설정을 지정할 수 있습니다.
| 설정 | 설명 |
|---|---|
| 컬렉션 | 문서가 속하는 컬렉션 이름 (정책과 매칭) |
| 보안 등급 | 문서의 보안 분류 (Public, Confidential, Top Secret) |
| 청킹 정책 | 문서를 분할하는 방식 (고정 크기, 문장 단위, 재귀적) |
| 적재 정책 | 미리 생성한 멀티스토어 적재 정책 선택 |
Policies 탭
컬렉션별 적재 정책을 생성하고 관리합니다. 정책은 문서가 어떤 스토어에 어떻게 적재될지를 결정합니다.

[+ Create Policy] 버튼으로 새 정책을 생성합니다.

| 설정 | 설명 |
|---|---|
| Collection Name | 문서 그룹 이름 (예: marketing-reports) |
| Chunking Strategy | 문서 분할 방식 (fixed_size / sentence / recursive) |
| Vector Backend | 벡터 DB 선택 (Weaviate / Milvus) |
| Graph Store | ArangoDB 문서 그래프 활성화 여부 |
| Auto Enrich | 적재 후 LLM 요약/키워드/분류 자동 실행 |
| Vector Sync Fields | 벡터 DB에 동기화할 메타데이터 필드 (tags, category, summary) |
Dashboard 탭
전체 적재 현황을 3개 스토어 통계 카드로 모니터링합니다.

- PostgreSQL 카드: 메타데이터 저장 건수 및 상태
- Vector DB 카드: 벡터 임베딩 저장 건수 및 상태
- Graph DB 카드: 문서 그래프 노드/엣지 수
- Failed Files: 실패한 파일 목록 + 일괄 재시도 버튼
인제스천 상태
업로드된 문서의 처리 상태를 실시간으로 확인할 수 있습니다.
- Uploading — 파일 업로드 진행 중
- Processing — 텍스트 추출 및 청킹 처리 중
- Embedding — 벡터 임베딩 변환 중
- Completed — 인제스천 완료, AI 검색 가능
- Failed — 처리 실패 (에러 메시지 확인 가능)
지원 파일 형식
GenD는 다양한 비정형 데이터 형식을 지원합니다.
| 카테고리 | 형식 | 설명 |
|---|---|---|
| 문서 | PDF, DOCX, HWP | 보고서, 매뉴얼, 기술 문서 |
| 스프레드시트 | XLSX, CSV | 표 형태 데이터, 통계 자료 |
| 이미지 | PNG, JPEG, TIFF | OCR을 통한 텍스트 추출 |
| 오디오 | MP3, WAV | STT(Speech-to-Text)를 통한 텍스트 변환 |
청킹 정책
문서를 AI 검색에 최적화된 크기로 분할하는 전략입니다.
| 정책 | 청크 크기 | 오버랩 | 적합한 문서 |
|---|---|---|---|
| 고정 크기 | 512 토큰 | 50 토큰 | 일반 문서, 매뉴얼 |
| 문단 단위 | 가변 | 1 문장 | 보고서, 논문 |
| 의미 단위 | 가변 | 가변 | 기술 문서, 법률 문서 |
청킹된 각 조각은 임베딩 모델을 통해 벡터로 변환되어 Vector DB(Weaviate 또는 Milvus)에 저장됩니다.
멀티스토어 아키텍처
문서 적재 시 document_id(UUID)를 키로 3개 스토어에 동시 적재됩니다.
| 스토어 | 저장 내용 | 용도 |
|---|---|---|
| PostgreSQL | 메타데이터 (title, author, tags, category) | 구조화 검색, 거버넌스 |
| Vector DB | 텍스트 chunk + 임베딩 벡터 | 의미 검색, RAG |
| Graph DB | 문서→chunk, 문서→테이블, 문서→태그 관계 | 관계 탐색, 리니지 |
Dagster 파이프라인이 업로드 후 자동으로 3개 스토어 적재를 오케스트레이션합니다. 개별 스토어 적재가 실패하면 해당 스토어만 재시도할 수 있습니다.
보안 등급 설정
업로드 문서에 보안 등급을 지정하여 접근 제어를 적용합니다.
| 등급 | 설명 | 접근 범위 |
|---|---|---|
| Public | 공개 문서 | 모든 사용자 |
| Internal | 내부 문서 | 인증된 사용자 |
| Confidential | 기밀 문서 | 지정된 팀/역할 |
| Restricted | 제한 문서 | 명시적 승인 필요 |
주요 기능
- 멀티스토어 동시 적재 — PostgreSQL + Vector DB + Graph DB 3개 스토어에 자동 적재
- 적재 정책 관리 — 컬렉션별 벡터 백엔드, 그래프 활성화, Auto Enrich 설정
- 스토어별 상태 추적 — 파일별로 각 스토어의 적재 성공/실패를 뱃지로 확인
- 대시보드 모니터링 — 3개 스토어 통계 카드 + 실패 파일 일괄 재시도
- 멀티포맷 지원 — PDF, DOCX, HWP, 이미지, 오디오 등 다양한 형식 처리
- 자동 청킹 — 문서를 AI 검색에 최적화된 크기로 자동 분할
- 보안 등급 관리 — 문서별 접근 수준을 ABAC(속성 기반 접근 제어)와 연동
- Auto Enrich — LLM 기반 요약, 키워드 추출, 분류를 적재 후 자동 실행
관련 링크
- 인제스천 파이프라인 — 외부 소스에서 문서를 주기적으로 수집하는 파이프라인 등록·실행
- AI 인텔리전스 — 인제스천된 문서를 RAG 검색에 활용
- 거버넌스 — 데이터 품질 및 계보 추적
- 관리 메뉴 — PII 탐지 및 접근 정책 설정
- DB 연결 — 구조화 데이터 소스 연결