파일·문서 수집 시작하기
데이터 수집, 어떤 기능으로? 결정 가이드를 먼저 보세요.
GenD에서 외부 데이터 소스(S3, SFTP, 공유폴더, 이메일 등)의 문서를 주기적으로 반입하는 수집 파이프라인을 등록하고 실행하는 방법을 안내합니다. 수집된 문서는 파싱 → 청킹 → 임베딩을 거쳐 검색 인덱스(Vector/Graph DB)까지 표준 자동 처리됩니다.

사전 준비
- 파이프라인 등록(새 파이프라인) 에는 관리자 권한이 필요합니다 (조회는 일반 사용자도 가능)
- 대상 데이터 소스에 접근 가능해야 함 (계정, 네트워크)
진입 경로
- 사이드바 데이터 엔지니어링 → 파일·문서 수집 (
/ingestion) - 또는 사이드바 데이터 가져오기 (
/get-data) → 파일·문서 수집 카드
화면은 파이프라인 / 실행 / 문서 3개 탭으로 구성됩니다.
| 탭 | 내용 |
|---|---|
| 파이프라인 | 수집 파이프라인 목록 + 새 파이프라인 등록 |
| 실행 | 파이프라인 실행(Run) 이력, 진행률·단계별 상태, 실패 재시도 |
| 문서 | 수집·업로드된 문서 목록 및 상태 |
1단계: 파이프라인 등록
파이프라인 탭에서 [+ 새 파이프라인] 버튼을 클릭하면 6단계 다이얼로그(소스 → 파서 → 청킹 → 적재 → 스케줄 → 확인)가 열립니다.

1-1. 소스
소스 타입 9종 중 데이터 소스에 맞는 유형을 선택합니다:
| 유형 | 대상 | 용도 |
|---|---|---|
| Amazon S3 / S3 호환 | AWS S3, SeaweedFS, MinIO | 클라우드 스토리지 파일 |
| SFTP | SSH 파일 서버 | 서버에 쌓이는 보고서 |
| SMB / Windows 공유폴더 | Windows 네트워크 공유 (CIFS/SMB) | 사내 파일 서버 |
| NFS | NFS 마운트 경로 | NAS 파일 |
| SharePoint Online | Microsoft 365 | 사내 문서함 |
| REST API | 외부 HTTP API | 외부 시스템 데이터 |
| 이메일 (IMAP) | 이메일 서버 | 이메일 첨부파일 |
| 웹 크롤링 | 웹사이트 | 웹페이지 수집 |
| 범용 파일시스템 (fsspec) | fsspec 프로토콜 (s3/sftp/smb/local) | 그 외 파일시스템 |
컬렉션 이름(수집된 문서가 속할 그룹, 예: marketing_docs)을 입력하고, 유형별 접속 정보를 채운 뒤 [연결 테스트] 버튼으로 설정을 검증합니다. 연결 테스트가 실패하면 결과 영역에 원인이 표시됩니다 — 예를 들어 필수 입력값이 비어 있으면 필수 필드 누락: <field> 메시지로 어떤 항목이 비었는지 알려줍니다.
웹 크롤링 입력 예시
| 필드 | 의미 | 예시 |
|---|---|---|
| 시작 URL (필수) | 크롤링을 시작할 페이지 | https://gend-docs.genon.ai/ |
| 최대 깊이 | 시작 URL에서 따라갈 링크 단계. 0 이면 시작 URL 한 페이지만. 기본 2. | 2 |
| 최대 페이지 수 | 한 번의 수집에서 가져올 페이지 상한. 기본 100. | 50 |
| 허용 도메인 | 쉼표로 구분한 도메인 화이트리스트. 비우면 시작 URL 도메인만 허용. | docs.example.com, blog.example.com |
사내 문서 사이트처럼 인증이 필요한 페이지는 익명 GET 으로는 본문을 받지 못합니다. 공개 페이지부터 시도해 보세요.
1-2. 파서
- 자동 (확장자 라우팅) — 파일 확장자에 따라 파서를 자동 선택 (권장)
- 수동 매핑 —
.pdf,.docx,.hwp,.xlsx,.txt확장자별 파서를 직접 지정
1-3. 청킹
- 청킹 전략:
fixed_size/sentence/recursive - 청크 크기 / 청크 중첩
1-4. 적재
- 벡터 스토어: 활성화 시 Weaviate / Milvus 중 백엔드 선택
- 그래프 스토어: 문서 그래프(ArangoDB) 적재 여부
- 자동 보강: 적재 후 LLM 요약/키워드/분류 자동 실행 (
minimal/standard/full) - 배치별 오버라이드: 저장&지금 실행 시 이번 실행에만 다른 청크 크기 적용 (파이프라인 기본값은 유지)
1-5. 스케줄
수집 주기를 선택합니다:
- 수동 (Manual) — 직접 트리거할 때만 실행
- 5분마다 / 15분마다 / 매시간 / 6시간마다 / 12시간마다 / 매일
- Custom (cron 표현식 직접 입력)
재시도 횟수와 백오프(초) 로 실패 시 자동 재시도 정책을 지정합니다.
1-6. 확인 및 저장
소스→파서→청킹→적재→스케줄 선택이 요약되어 표시됩니다. 파이프라인 이름을 입력하고 [저장] 또는 [저장&지금 실행] 으로 마칩니다.
2단계: 수집 실행
파이프라인 탭 목록에서 파이프라인 행의 [실행] 버튼을 클릭하면 즉시 수집이 실행됩니다 (빌더의 저장&지금 실행 도 동일).
스케줄이 설정된 경우 Dagster 센서가 자동으로 주기 실행합니다. 활성/비활성 토글로 스케줄 실행을 잠시 멈출 수 있으며, 비활성 파이프라인은 수동 실행도 차단됩니다.
3단계: 실행 이력 확인
실행 탭에서 수집 실행(Run) 이력을 확인합니다. 상단 드롭다운으로 특정 파이프라인만 필터링할 수 있습니다.
| 컬럼 | 설명 |
|---|---|
| 파이프라인 | 실행된 파이프라인 이름 |
| 트리거 | 수동 / 스케줄 / 재시도 |
| 진행 | 진행률 (단계별 롤업: parse / chunk / embed / vector / graph) |
| 상태 | 대기 / 실행중 / 완료 / 완료(일부실패) / 실패 / 취소 |
| 실패 | 실패한 항목 수 |
Run을 클릭하면 상세 패널이 열려 파일별 상태·실패 단계·에러 메시지를 확인하고, 실패 항목만 재시도할 수 있습니다.

실행·모니터링·재시도의 자세한 흐름은 인제스천 파이프라인 가이드를 참고하세요.
수집 → 적재 연계
수집된 파일은 파이프라인에 정의한 대로 자동 처리됩니다:
- 파싱 + 청킹 + 임베딩
- 적재 설정에 따라 Vector DB + Graph DB + PostgreSQL에 저장
- 문서 탭과 AI 에이전트 채팅에서 검색 가능
수동 업로드와 적재 정책 설정은 데이터 인제스천 가이드를 참고하세요.