본문으로 건너뛰기

파일·문서 수집 시작하기

어떤 수집 기능을 쓸지 모르겠다면

데이터 수집, 어떤 기능으로? 결정 가이드를 먼저 보세요.

GenD에서 외부 데이터 소스(S3, SFTP, 공유폴더, 이메일 등)의 문서를 주기적으로 반입하는 수집 파이프라인을 등록하고 실행하는 방법을 안내합니다. 수집된 문서는 파싱 → 청킹 → 임베딩을 거쳐 검색 인덱스(Vector/Graph DB)까지 표준 자동 처리됩니다.

수집(Ingestion) 허브 — 파이프라인/실행/문서 3탭

사전 준비

  • 파이프라인 등록(새 파이프라인) 에는 관리자 권한이 필요합니다 (조회는 일반 사용자도 가능)
  • 대상 데이터 소스에 접근 가능해야 함 (계정, 네트워크)

진입 경로

  • 사이드바 데이터 엔지니어링 → 파일·문서 수집 (/ingestion)
  • 또는 사이드바 데이터 가져오기 (/get-data) → 파일·문서 수집 카드

화면은 파이프라인 / 실행 / 문서 3개 탭으로 구성됩니다.

내용
파이프라인수집 파이프라인 목록 + 새 파이프라인 등록
실행파이프라인 실행(Run) 이력, 진행률·단계별 상태, 실패 재시도
문서수집·업로드된 문서 목록 및 상태

1단계: 파이프라인 등록

파이프라인 탭에서 [+ 새 파이프라인] 버튼을 클릭하면 6단계 다이얼로그(소스 → 파서 → 청킹 → 적재 → 스케줄 → 확인)가 열립니다.

빌더 1단계 — 소스

1-1. 소스

소스 타입 9종 중 데이터 소스에 맞는 유형을 선택합니다:

유형대상용도
Amazon S3 / S3 호환AWS S3, SeaweedFS, MinIO클라우드 스토리지 파일
SFTPSSH 파일 서버서버에 쌓이는 보고서
SMB / Windows 공유폴더Windows 네트워크 공유 (CIFS/SMB)사내 파일 서버
NFSNFS 마운트 경로NAS 파일
SharePoint OnlineMicrosoft 365사내 문서함
REST API외부 HTTP API외부 시스템 데이터
이메일 (IMAP)이메일 서버이메일 첨부파일
웹 크롤링웹사이트웹페이지 수집
범용 파일시스템 (fsspec)fsspec 프로토콜 (s3/sftp/smb/local)그 외 파일시스템

컬렉션 이름(수집된 문서가 속할 그룹, 예: marketing_docs)을 입력하고, 유형별 접속 정보를 채운 뒤 [연결 테스트] 버튼으로 설정을 검증합니다. 연결 테스트가 실패하면 결과 영역에 원인이 표시됩니다 — 예를 들어 필수 입력값이 비어 있으면 필수 필드 누락: <field> 메시지로 어떤 항목이 비었는지 알려줍니다.

웹 크롤링 입력 예시

필드의미예시
시작 URL (필수)크롤링을 시작할 페이지https://gend-docs.genon.ai/
최대 깊이시작 URL에서 따라갈 링크 단계. 0 이면 시작 URL 한 페이지만. 기본 2.2
최대 페이지 수한 번의 수집에서 가져올 페이지 상한. 기본 100.50
허용 도메인쉼표로 구분한 도메인 화이트리스트. 비우면 시작 URL 도메인만 허용.docs.example.com, blog.example.com

사내 문서 사이트처럼 인증이 필요한 페이지는 익명 GET 으로는 본문을 받지 못합니다. 공개 페이지부터 시도해 보세요.

1-2. 파서

  • 자동 (확장자 라우팅) — 파일 확장자에 따라 파서를 자동 선택 (권장)
  • 수동 매핑.pdf, .docx, .hwp, .xlsx, .txt 확장자별 파서를 직접 지정

1-3. 청킹

  • 청킹 전략: fixed_size / sentence / recursive
  • 청크 크기 / 청크 중첩

1-4. 적재

  • 벡터 스토어: 활성화 시 Weaviate / Milvus 중 백엔드 선택
  • 그래프 스토어: 문서 그래프(ArangoDB) 적재 여부
  • 자동 보강: 적재 후 LLM 요약/키워드/분류 자동 실행 (minimal / standard / full)
  • 배치별 오버라이드: 저장&지금 실행 시 이번 실행에만 다른 청크 크기 적용 (파이프라인 기본값은 유지)

1-5. 스케줄

수집 주기를 선택합니다:

  • 수동 (Manual) — 직접 트리거할 때만 실행
  • 5분마다 / 15분마다 / 매시간 / 6시간마다 / 12시간마다 / 매일
  • Custom (cron 표현식 직접 입력)

재시도 횟수백오프(초) 로 실패 시 자동 재시도 정책을 지정합니다.

1-6. 확인 및 저장

소스→파서→청킹→적재→스케줄 선택이 요약되어 표시됩니다. 파이프라인 이름을 입력하고 [저장] 또는 [저장&지금 실행] 으로 마칩니다.

2단계: 수집 실행

파이프라인 탭 목록에서 파이프라인 행의 [실행] 버튼을 클릭하면 즉시 수집이 실행됩니다 (빌더의 저장&지금 실행 도 동일).

스케줄이 설정된 경우 Dagster 센서가 자동으로 주기 실행합니다. 활성/비활성 토글로 스케줄 실행을 잠시 멈출 수 있으며, 비활성 파이프라인은 수동 실행도 차단됩니다.

3단계: 실행 이력 확인

실행 탭에서 수집 실행(Run) 이력을 확인합니다. 상단 드롭다운으로 특정 파이프라인만 필터링할 수 있습니다.

컬럼설명
파이프라인실행된 파이프라인 이름
트리거수동 / 스케줄 / 재시도
진행진행률 (단계별 롤업: parse / chunk / embed / vector / graph)
상태대기 / 실행중 / 완료 / 완료(일부실패) / 실패 / 취소
실패실패한 항목 수

Run을 클릭하면 상세 패널이 열려 파일별 상태·실패 단계·에러 메시지를 확인하고, 실패 항목만 재시도할 수 있습니다.

실행(Runs) + Run 상세 — 진행률·단계 롤업·항목별 성공/실패

실행·모니터링·재시도의 자세한 흐름은 인제스천 파이프라인 가이드를 참고하세요.

수집 → 적재 연계

수집된 파일은 파이프라인에 정의한 대로 자동 처리됩니다:

  1. 파싱 + 청킹 + 임베딩
  2. 적재 설정에 따라 Vector DB + Graph DB + PostgreSQL에 저장
  3. 문서 탭과 AI 에이전트 채팅에서 검색 가능

수동 업로드와 적재 정책 설정은 데이터 인제스천 가이드를 참고하세요.