본문으로 건너뛰기

모델 서빙

GenD의 모델 서빙 기능은 등록된 ML 모델을 REST 엔드포인트로 배포하여 실시간 추론 서비스를 제공합니다. 카나리 배포와 배포 메트릭 모니터링을 지원합니다.

주요 기능

  • 배포(Deployment) 관리: 모델을 서빙 엔드포인트로 배포하고 관리합니다
  • 카나리 배포: 트래픽의 일부만 새 버전으로 전환하여 안전하게 배포합니다
  • 배포 메트릭: 각 배포의 요청 수, 지연 시간, 에러율 등을 모니터링합니다
  • 다중 배포: 여러 모델을 동시에 서빙할 수 있습니다

배포 설정 항목

항목설명
endpoint_name서빙 엔드포인트 이름
model_nameMLflow 등록 모델 이름
model_version배포할 모델 버전
replicas인스턴스 수
canary_percent카나리 트래픽 비율 (0~100)

사용 방법

  1. 모델 > 서빙 메뉴에서 새 배포 버튼을 클릭합니다
  2. 배포할 모델과 버전을 선택합니다
  3. 엔드포인트 이름과 리소스 설정을 입력합니다
  4. 필요 시 카나리 배포 비율을 설정합니다
  5. 배포 버튼을 클릭합니다

API 엔드포인트

MethodPathDescription
POST/api/v1/serving/deployments배포 생성
GET/api/v1/serving/deployments배포 목록 조회
GET/api/v1/serving/deployments/{name}배포 상세 조회
DELETE/api/v1/serving/deployments/{name}배포 삭제
POST/api/v1/serving/deployments/{name}/canary카나리 비율 변경
GET/api/v1/serving/deployments/{name}/metrics배포 메트릭 조회

관련 문서