본문으로 건너뛰기

데이터 수집

데이터 수집은 PDF, DOCX, HWP 등 다양한 비정형 문서를 GenD 플랫폼에 업로드하고, AI 검색 및 RAG(Retrieval-Augmented Generation)에 활용할 수 있도록 처리하는 기능입니다. 업로드된 문서는 텍스트 추출, 청킹(chunking), 임베딩 변환을 거쳐 PostgreSQL(메타데이터) + Vector DB(임베딩) + Graph DB(관계) 3개 스토어에 동시 적재됩니다.

통합 인제스천 워크스페이스

문서 적재는 단일 파일·문서 수집 메뉴(/ingestion — 파이프라인 / 실행 / 문서 3탭)로 통합되었습니다. 파이프라인 등록·배치 실행·진척 모니터링·실패 재시도 전 과정은 인제스천 파이프라인 가이드를 참고하세요.

마이그레이션: 구 자동 수집(Auto Collection) 화면(/collections)은 제거되었고, 소스 등록과 실행 이력은 이 허브가 승계합니다. /collection/* API 는 파이프라인의 소스 정의 저장·연결 테스트 용도로 계속 사용됩니다. 상세는 구 자동 수집 화면에서의 이관 절을 보세요.

인제스천 파이프라인

데이터 인제스천

화면 구성

인제스천 화면은 3개 탭으로 구성됩니다.

Files 탭

파일 목록을 조회하고 새 문서를 업로드합니다. 각 파일 행에 Stores 컬럼이 표시되어 스토어별 적재 상태를 뱃지로 확인할 수 있습니다.

뱃지의미
PG (초록)PostgreSQL 메타데이터 적재 성공
Vec (초록)Vector DB 임베딩 적재 성공
Graph (초록)Graph DB 관계 적재 성공
빨간 뱃지해당 스토어 적재 실패 (Retry 가능)

파일을 드래그 앤 드롭하거나 [+ 파일 업로드] 버튼을 클릭하여 문서를 업로드합니다.

업로드 다이얼로그

업로드 시 다음 설정을 지정할 수 있습니다.

설정설명
컬렉션문서가 속하는 컬렉션 이름 (정책과 매칭)
보안 등급문서의 보안 분류 (Public, Confidential, Top Secret)
청킹 정책문서를 분할하는 방식 (고정 크기, 문장 단위, 재귀적)
적재 정책미리 생성한 멀티스토어 적재 정책 선택

Policies 탭

컬렉션별 적재 정책을 생성하고 관리합니다. 정책은 문서가 어떤 스토어에 어떻게 적재될지를 결정합니다.

Policies 탭

[+ Create Policy] 버튼으로 새 정책을 생성합니다.

정책 생성 폼

설정설명
Collection Name문서 그룹 이름 (예: marketing-reports)
Chunking Strategy문서 분할 방식 (fixed_size / sentence / recursive)
Vector Backend벡터 DB 선택 (Weaviate / Milvus)
Graph StoreArangoDB 문서 그래프 활성화 여부
Auto Enrich적재 후 LLM 요약/키워드/분류 자동 실행
Vector Sync Fields벡터 DB에 동기화할 메타데이터 필드 (tags, category, summary)

Dashboard 탭

전체 적재 현황을 3개 스토어 통계 카드로 모니터링합니다.

대시보드

  • PostgreSQL 카드: 메타데이터 저장 건수 및 상태
  • Vector DB 카드: 벡터 임베딩 저장 건수 및 상태
  • Graph DB 카드: 문서 그래프 노드/엣지 수
  • Failed Files: 실패한 파일 목록 + 일괄 재시도 버튼

인제스천 상태

업로드된 문서의 처리 상태를 실시간으로 확인할 수 있습니다.

  • Uploading — 파일 업로드 진행 중
  • Processing — 텍스트 추출 및 청킹 처리 중
  • Embedding — 벡터 임베딩 변환 중
  • Completed — 인제스천 완료, AI 검색 가능
  • Failed — 처리 실패 (에러 메시지 확인 가능)

지원 파일 형식

GenD는 다양한 비정형 데이터 형식을 지원합니다.

카테고리형식설명
문서PDF, DOCX, HWP보고서, 매뉴얼, 기술 문서
스프레드시트XLSX, CSV표 형태 데이터, 통계 자료
이미지PNG, JPEG, TIFFOCR을 통한 텍스트 추출
오디오MP3, WAVSTT(Speech-to-Text)를 통한 텍스트 변환

청킹 정책

문서를 AI 검색에 최적화된 크기로 분할하는 전략입니다.

정책청크 크기오버랩적합한 문서
고정 크기512 토큰50 토큰일반 문서, 매뉴얼
문단 단위가변1 문장보고서, 논문
의미 단위가변가변기술 문서, 법률 문서

청킹된 각 조각은 임베딩 모델을 통해 벡터로 변환되어 Vector DB(Weaviate 또는 Milvus)에 저장됩니다.

멀티스토어 아키텍처

문서 적재 시 document_id(UUID)를 키로 3개 스토어에 동시 적재됩니다.

스토어저장 내용용도
PostgreSQL메타데이터 (title, author, tags, category)구조화 검색, 거버넌스
Vector DB텍스트 chunk + 임베딩 벡터의미 검색, RAG
Graph DB문서→chunk, 문서→테이블, 문서→태그 관계관계 탐색, 리니지

Dagster 파이프라인이 업로드 후 자동으로 3개 스토어 적재를 오케스트레이션합니다. 개별 스토어 적재가 실패하면 해당 스토어만 재시도할 수 있습니다.

보안 등급 설정

업로드 문서에 보안 등급을 지정하여 접근 제어를 적용합니다.

등급설명접근 범위
Public공개 문서모든 사용자
Internal내부 문서인증된 사용자
Confidential기밀 문서지정된 팀/역할
Restricted제한 문서명시적 승인 필요

주요 기능

  • 멀티스토어 동시 적재 — PostgreSQL + Vector DB + Graph DB 3개 스토어에 자동 적재
  • 적재 정책 관리 — 컬렉션별 벡터 백엔드, 그래프 활성화, Auto Enrich 설정
  • 스토어별 상태 추적 — 파일별로 각 스토어의 적재 성공/실패를 뱃지로 확인
  • 대시보드 모니터링 — 3개 스토어 통계 카드 + 실패 파일 일괄 재시도
  • 멀티포맷 지원 — PDF, DOCX, HWP, 이미지, 오디오 등 다양한 형식 처리
  • 자동 청킹 — 문서를 AI 검색에 최적화된 크기로 자동 분할
  • 보안 등급 관리 — 문서별 접근 수준을 ABAC(속성 기반 접근 제어)와 연동
  • Auto Enrich — LLM 기반 요약, 키워드 추출, 분류를 적재 후 자동 실행

관련 링크