데이터 엔지니어는 .csv 형식의 정형 데이터를 Amazon S3 데이터 레이크로 수집해야 합니다. .csv 파일에는 15개의 컬럼이 있습니다. 데이터 분석팀은 Amazon Athena를 사용하여 데이터셋의 1~2개 컬럼에만 쿼리를 실행해야 합니다. 분석팀은 거의 전체 파일을 쿼리하지 않습니다. 가장 비용 효율적인 솔루션은 무엇입니까?
- A. AWS Glue PySpark 작업을 사용하여 .csv 형식으로 데이터를 데이터 레이크로 수집합니다.
- B. AWS Glue ETL 작업을 만들어 .csv 정형 데이터 소스에서 데이터를 읽습니다. JSON 형식으로 데이터 레이크로 수집하도록 작업을 구성합니다.
- C. AWS Glue PySpark 작업을 사용하여 Apache Avro 형식으로 데이터를 데이터 레이크로 수집합니다.
- D. AWS Glue ETL 작업을 만들어 .csv 정형 데이터 소스에서 데이터를 읽습니다. Apache Parquet 형식으로 데이터 레이크에 쓰도록 작업을 구성합니다.✓ 정답
해설
【핵심 용어】 ▸ Apache Parquet — 컬럼 단위 저장. 특정 컬럼만 select할 때 I/O·비용 최소. ▸ Athena 과금 — 스캔한 데이터 양 기준. 컬럼형이 결정적. 【정답 포인트】 ▸ 15컬럼 중 1~2개 컬럼만 자주 쿼리 = Parquet 변환이 가장 비용 효율. Glue ETL로 CSV → Parquet으로 데이터 레이크 적재. 【오답 체크】 (A) CSV 그대로면 매번 전체 행 스캔. (B) JSON은 행 기반 + 파싱 비용 — Parquet 대비 비효율. (C) Avro도 행 기반(레코드 단위) — 컬럼 선택 쿼리에 부적합.