데이터 수집, 어떤 기능으로?
GenD 에는 데이터를 들여오는 기능이 4개 있습니다. 이 페이지는 어느 것을 쓸지 2개 질문으로 결정하는 가이드입니다. UI 의 데이터 가져오기(/get-data) 메뉴가 같은 기준으로 안내합니다.

결정 표
| 질문 1 — 데이터가 어디에? | 질문 2 — 어떻게 쓸 건가? | 사용할 기능 | 가이드 |
|---|---|---|---|
| 운영 DB (PostgreSQL/MySQL…) | SQL 로 조회 | DB 연결 (/connectors) | 커넥터 |
| 파일·문서 (S3/SFTP/공유폴더/웹) | 문서 검색(RAG) 이 목적 — 처리 과정은 표준에 맡김 | 파일·문서 수집 (/ingestion) | 파일·문서 수집 · 업로드 |
| 외부 API 또는 처리 방식을 직접 설계 | 커스텀 파싱·변환, Bronze 적재, 결과를 MCP 도구로 | 직접 조립 파이프라인 (/pipeline-studio) | REST 소스 · PS 빌더 |
| 전사 공용 표준 데이터 (공시·시세·거시·뉴스) | 모두가 인텔리전스 메뉴에서 조회 | 공용 수집기 (관리형) (/admin/intel-sources, admin) | 수집기 관리 |
헷갈리는 경계 3곳
파일·문서 수집 vs 직접 조립 파이프라인
둘 다 문서를 다룰 수 있어 가장 자주 헷갈립니다. 기준은 처리 과정을 누가 정하느냐입니다.
- 파일·문서 수집 = 고정 레일. 가져올 곳(9종 수집기)만 고르면 파싱→청킹→임베딩→검색 인덱스가 표준 자동 처리. 세탁기 코스 버튼.
- 직접 조립 파이프라인 = 손세탁. 소스·변환·적재를 노드로 직접 설계 — 외부 API JSON, 커스텀 파싱, 코드 노드, Bronze/마트 적재, MCP 도구화.
한 줄 규칙: 문서를 표준 검색에 넣는 게 목적이면 수집, 처리 방식을 내가 정해야 하면 파이프라인 스튜디오.
직접 조립(셀프서비스) vs 공용 수집기(관리형)
- 누구 데이터인가: 우리 팀만 쓰면 셀프서비스(워크스페이스 격리), 전사가 쓰면 관리형(공용 테이블+인텔리전스 화면).
- API 인증 방식 (금융 API 셀프서비스 가능 조건): 셀프서비스의 시크릿 치환(
{{secret.x}})은 헤더에서만 허용됩니다 — 키가 URL 에 실리면 로그에 남는 유출 위험을 차단하는 보안 설계입니다. 따라서:
| API 인증 | 예 | 셀프서비스 |
|---|---|---|
| 키 없음/공개 | 법제처, RSS, 공공데이터 | ✅ |
헤더 인증 (Authorization: Bearer) | Polygon 등 | ✅ (워크스페이스 시크릿) |
| 쿼리스트링/URL 키만 지원 | DART(crtfc_key=), FRED, ECOS | ❌ → 관리형 수집기 사용 (관리자에게 요청) |
- 승격 경로: 셀프서비스로 시작 → 전사 표준이 되면 관리형 collector 로 승격.
DB 연결 vs 나머지
DB 연결은 "수집"이 아니라 연결입니다 — 데이터를 복사하지 않고 Trino federation 으로 원본 DB 를 SQL 조회합니다. 주기적으로 스냅샷을 떠서 적재해야 하면 파이프라인 쪽입니다.
관련
- UI 진입점: 사이드바 데이터 가져오기 (
/get-data) - 공용 수집기 상세 (키 UI 관리·5단계 절차): Intel 수집기 관리