GenD의 모델 서빙 기능은 등록된 ML 모델을 REST 엔드포인트로 배포하여 실시간 추론 서비스를 제공합니다. 카나리 배포와 배포 메트릭 모니터링을 지원합니다.
주요 기능
- 배포(Deployment) 관리: 모델을 서빙 엔드포인트로 배포하고 관리합니다
- 카나리 배포: 트래픽의 일부만 새 버전으로 전환하여 안전하게 배포합니다
- 배포 메트릭: 각 배포의 요청 수, 지연 시간, 에러율 등을 모니터링합니다
- 다중 배포: 여러 모델을 동시에 서빙할 수 있습니다
배포 설정 항목
| 항목 | 설명 |
|---|
| endpoint_name | 서빙 엔드포인트 이름 |
| model_name | MLflow 등록 모델 이름 |
| model_version | 배포할 모델 버전 |
| replicas | 인스턴스 수 |
| canary_percent | 카나리 트래픽 비율 (0~100) |
사용 방법
- 모델 > 서빙 메뉴에서 새 배포 버튼을 클릭합니다
- 배포할 모델과 버전을 선택합니다
- 엔드포인트 이름과 리소스 설정을 입력합니다
- 필요 시 카나리 배포 비율을 설정합니다
- 배포 버튼을 클릭합니다
API 엔드포인트
| Method | Path | Description |
|---|
| POST | /api/v1/serving/deployments | 배포 생성 |
| GET | /api/v1/serving/deployments | 배포 목록 조회 |
| GET | /api/v1/serving/deployments/{name} | 배포 상세 조회 |
| DELETE | /api/v1/serving/deployments/{name} | 배포 삭제 |
| POST | /api/v1/serving/deployments/{name}/canary | 카나리 비율 변경 |
| GET | /api/v1/serving/deployments/{name}/metrics | 배포 메트릭 조회 |
관련 문서