회사는 AWS Glue 워크플로우에 의해 조정되는 AWS Glue 데이터 처리 작업을 가지고 있습니다. AWS Glue 작업은 일정에 따라 실행되거나 수동으로 시작될 수 있습니다. 회사는 ML 모델 개발을 위해 Amazon SageMaker Pipelines에서 파이프라인을 개발하고 있습니다. 파이프라인은 데이터 처리 단계 중에 AWS Glue 작업의 출력을 사용합니다. ML 엔지니어는 AWS Glue 작업을 파이프라인과 통합하는 솔루션을 구현해야 합니다. 어떤 솔루션이 운영 부담이 가장 적으면서 이 요구사항을 충족할까요?
- A. 파이프라인과 AWS Glue 작업의 조정을 위해 AWS Step Functions를 사용합니다.
- B. SageMaker Pipelines의 처리 단계를 사용합니다. AWS Glue 작업의 Amazon Resource Name(ARNs)을 가리키는 입력을 구성합니다.
- C. SageMaker Pipelines의 Callback 단계를 사용하여 AWS Glue 워크플로우를 시작하고 AWS Glue 작업 완료까지 파이프라인을 중지합니다.✓ 정답
- D. 파이프라인과 AWS Glue 작업을 원하는 순서로 호출하기 위해 Amazon EventBridge를 사용합니다.
해설
【핵심 용어】 ▸ SageMaker Pipelines Callback Steps — 외부 비동기 작업(AWS Glue 워크플로우 등)을 시작하고, 완료될 때까지 파이프라인을 "일시 중지"했다가 재개하는 메커니즘 ▸ SageMaker Processing Steps — SageMaker 처리 작업을 실행하는 단계로 다른 서비스 작업을 "시작"할 수는 없음 ▸ AWS Step Functions — 복잡한 워크플로우 조정을 위한 일반 목적 서비스로 SageMaker Pipelines보다 많은 관리 코드 필요 ▸ Amazon EventBridge — 이벤트 기반 트리거 서비스로 순차적 대기(동기식 완료 대기) 메커니즘이 없음 【정답 포인트】 "AWS Glue 작업의 출력을 SageMaker Pipelines 데이터 처리 단계에서 사용" + "최소 운영 부담". SageMaker Pipelines의 Callback Step은 정확히 이런 시나리오를 위해 설계되었습니다: (1) Callback Step이 AWS Glue 워크플로우를 시작 (2) Glue 작업이 완료될 때까지 대기 (3) 완료 신호 수신 후 다음 단계 진행. 이렇게 하면 SageMaker Pipelines 내에서 모든 단계를 선언적으로 정의하고, 자동 조정 및 에러 처리를 위임할 수 있으므로 운영 부담이 최소입니다. 【오답 체크】 (A) Step Functions를 사용하면 SageMaker Pipelines 외부에 추가 워크플로우 정의가 필요하고, 두 서비스 간 통합도 복잡합니다. 관리할 조정 로직이 증가하여 운영 부담이 커집니다. (B) Processing Steps는 SageMaker Processing 작업(컨테이너 기반)을 실행하는 것이지, 외부 Glue 워크플로우를 "시작"할 수 없습니다. ARN을 지정해도 작업이 실행되지 않으며 Glue 워크플로우 결과를 파이프라인이 기다릴 수 없습니다. (D) EventBridge는 이벤트 기반 트리거이므로 "Glue 작업이 완료될 때까지 대기"하는 동기식 메커니즘이 없습니다. Glue 작업 시작과 Pipelines 다음 단계 진행 간에 순서 보장이 어렵습니다. 【시험 포인트】 "Glue 작업 완료 대기 + SageMaker Pipelines 통합 + 최소 운영 부담" → "Callback Step". Step Functions는 외부 조정 로직, Processing Steps는 Glue 작업 실행 불가, EventBridge는 동기식 대기 불가.