데이터 엔지니어는 AWS 서비스를 사용하여 데이터셋을 Amazon S3 데이터 레이크로 수집해야 합니다. 데이터 엔지니어가 데이터셋을 프로파일링하고 데이터셋에 개인식별정보(PII)가 포함되어 있음을 발견했습니다. 데이터 엔지니어는 데이터셋을 프로파일링하고 PII를 난독화하는 솔루션을 구현해야 합니다. 운영 노력이 가장 적게 드는 솔루션은 무엇입니까?
- A. Amazon Kinesis Data Firehose 전달 스트림을 사용하여 데이터셋을 처리합니다. AWS Lambda 변환 함수를 만들어 PII를 식별합니다. AWS SDK를 사용하여 PII를 난독화합니다. 전달 스트림의 대상으로 S3 데이터 레이크를 설정합니다.
- B. AWS Glue Studio의 Detect PII 변환을 사용하여 PII를 식별합니다. PII를 난독화합니다. AWS Step Functions 상태 머신을 사용하여 데이터 파이프라인을 오케스트레이션하여 데이터를 S3 데이터 레이크로 수집합니다.✓ 정답
- C. AWS Glue Studio의 Detect PII 변환을 사용하여 PII를 식별합니다. AWS Glue Data Quality의 규칙을 만들어 PII를 난독화합니다. AWS Step Functions 상태 머신을 사용하여 데이터 파이프라인을 오케스트레이션하여 데이터를 S3 데이터 레이크로 수집합니다.
- D. 데이터셋을 Amazon DynamoDB로 수집합니다. AWS Lambda 함수를 만들어 DynamoDB 테이블의 PII를 식별하고 난독화하며 데이터를 변환합니다. 동일한 Lambda 함수를 사용하여 데이터를 S3 데이터 레이크로 수집합니다.
해설
【핵심 용어】 ▸ Glue Studio Detect PII — PII 자동 감지/마스킹/제거 변환. 시각적 ETL. ▸ Step Functions — 멀티 단계 ETL 오케스트레이션. 【정답 포인트】 ▸ Glue Studio Detect PII로 식별 + 변환에서 직접 난독화 + Step Functions로 파이프라인 = 가장 적은 노력. 【오답 체크】 (A) Lambda 변환은 직접 코드 작성 + SDK 호출 → 노력 큼. (C) Data Quality는 데이터 품질 룰 검증이지 PII 난독화 변환 도구가 아님. (D) DynamoDB 적재 → Lambda 변환은 데이터 흐름과 어긋남.