sangj***
2023-08-27

80여 가지 AWS AI & ML 서비스로 구현하는 데이터 과학 프로젝트 실전 가이드
이 책은 AWS 서비스를 사용하여 데이터 과학 프로젝트를 수행하는 방법을 알려주는 도서입니다.
Amazon SageMaker와 같은 머신 러닝에서부터 Lex, DeepLens, Macie와 같은 AI 서비스를 포함하였습니다.
AWS 서비스를 무려 80여 가지를 사용하였는데 용어 리스트를 별도로 제공하여 가뜩이나 축약어가 많은
AWS 제품명을 잊지 않게 해줍니다. 또한 #AutoML, #MLOps, #자연어처리 등, 자주 들었던 기술들이 어떤 비즈니스 요구사항에 대한 해결 방안이 될 수 있는지를 잘 알려줍니다.
이 도서에서 언급한 - AWS 클라우드를 활용하여 데이터 과학 프로젝트를 수행할 때 자주 사용되는 제품과 그 효과는 다음과 같습니다.
Amazon S3 (Simple Storage Service):
대용량의 데이터를 저장하고 관리하는 데 사용됩니다. 데이터 레이크를 구축하거나 원시 데이터를 저장하는데 유용합니다.
Amazon Redshift:
데이터 웨어하우스로 사용되며 대용량 데이터의 분석과 쿼리에 최적화되어 있습니다.
Amazon RDS (Relational Database Service):
관계형 데이터베이스를 호스팅하고 관리하는 데 사용됩니다. 프로젝트에서 구조화된 데이터를 저장하거나 필요한 경우 SQL 질의를 수행할 수 있습니다.
Amazon EMR (Elastic MapReduce):
대규모 데이터 처리 작업을 위해 Hadoop 및 기타 분산 컴퓨팅 프레임워크를 활용합니다.
Amazon SageMaker:
머신러닝 모델 훈련, 평가, 배포를 간소화하는 머신러닝 플랫폼입니다. AutoML, 모델 개발 및 훈련, 엔드 포인트 배포 등 다양한 단계에서 사용됩니다.
Amazon Kinesis:
스트리밍 데이터를 처리하고 분석하는 데 사용됩니다. 실시간 데이터 스트리밍 분석에 유용합니다.
Amazon QuickSight:
비즈니스 인텔리전스 및 데이터 시각화 툴로 사용되며, 데이터를 직관적인 대시보드로 시각화하여 분석할 수 있습니다.
Amazon Comprehend:
자연어 처리(NLP)를 통해 텍스트 데이터를 분석하고 감정 분석, 키워드 추출, 문서 분류 등을 수행할 수 있습니다.
Amazon Rekognition:
이미지 및 비디오 분석을 통해 객체, 얼굴, 텍스트 등을 감지하고 분류하는 데 사용됩니다.
이 외에도 AWS는 다양한 서비스를 제공하며, 데이터 저장, 처리, 분석, 머신러닝, 보안, 인프라 관리 등 다양한 단계에서 활용할 수 있는 기능을 제공합니다. 데이터 과학 프로젝트에서 이러한 AWS 서비스를 조합하여 필요한 작업을 효율적으로 수행하고 프로젝트의 성공을 이끌어내는데 활용할 수 있습니다.
자칫 어려운 개념의 내용들이지만 다이어그램과 삽화의 도움으로 이해를 쉽게 가져갈 수 있습니다.
이 책은 AWS 기반 데이터 과학에 관한 다양한 주제를 다루고 있습니다. 각 장의 주요 내용과 특징은 다음과 같습니다.
CHAPTER 1 AWS 기반 데이터 과학 소개: 이 장은 클라우드 컴퓨팅의 이점, 데이터 과학 파이프라인 및 워크플로, MLOps 모범 사례, 아마존 세이지메이커를 사용한 데이터 과학 및 AutoML, AWS에서 데이터 수집 및 처리, 모델 훈련 및 배포, 스트리밍 데이터 분석 등을 소개합니다.
CHAPTER 2 데이터 과학의 모범 사례: 다양한 산업에서의 데이터 과학 활용 사례와 예시를 다룹니다. 상품 추천 시스템, 이미지 감지, 수요 예측, 가짜 계정 식별, 정보 유출 탐지, 음성 어시스턴트, 텍스트 분석, 고객 지원 센터 개선, 예측 정비, 홈 자동화 등 다양한 영역에서의 데이터 과학 적용 사례를 다룹니다.
CHAPTER 3 AutoML: 세이지메이커의 AutoML 기능을 사용하여 자동화된 머신러닝 모델 훈련을 소개합니다. 오토파일럿을 사용한 AutoML, 데이터 셋 트래킹, 자체 텍스트 분류기 훈련 및 배포, 아마존 컴프리헨드를 활용한 AutoML 등이 포함됩니다.
CHAPTER 4 클라우드로 데이터 수집하기: 클라우드 환경에서 데이터 레이크를 구축하고 데이터를 수집하는 방법을 다룹니다. 데이터 레이크, 아마존 아테나와 아마존 S3 데이터 쿼리, 데이터 수집을 위한 AWS 글루 크롤러, 레이크 하우스 구축 등을 다룹니다.
CHAPTER 5 데이터 셋 탐색하기: 데이터 탐색과 시각화를 위한 AWS 도구와 기법에 대해 설명합니다. 세이지메이커 스튜디오를 활용한 데이터 레이크 시각화, 데이터 웨어하우스 쿼리, 대시보드 생성, 데이터 품질 문제 감지, 데이터 편향 감지 등을 다룹니다.
CHAPTER 6 모델 훈련을 위한 데이터 셋 준비: 모델 훈련에 필요한 데이터 셋을 준비하는 과정과 세이지메이커 기능을 활용한 피처 엔지니어링, 피처 공유, 데이터 변환 등을 다룹니다.
CHAPTER 7 나의 첫 모델 훈련시키기: 세이지메이커를 사용하여 모델을 훈련하는 방법을 설명합니다. BERT 모델을 활용한 자연어 처리 모델 훈련 예시와 모델 평가, 디버깅, 예측 해석 등을 다룹니다.
CHAPTER 8 대규모 모델 훈련과 최적화 전략: 대규모 모델 훈련과 하이퍼 파라미터 튜닝, 세이지메이커 분산 훈련 등을 다루며, 최적의 모델 성능을 위한 전략을 제시합니다.
CHAPTER 9 프로덕션에 모델 배포하기: 훈련된 모델을 실제 환경에 배포하는 방법과 모델 보안, 모니터링, 업데이트 전략 등을 다룹니다.
CHAPTER 10 파이프라인과 MLOps: 머신러닝 파이프라인과 MLOps(머신러닝 운영)의 개념을 소개하고 세이지메이커 파이프라인을 사용한 파이프라인 구축과 자동화 방법을 설명합니다.
CHAPTER 11 스트리밍 데이터 분석과 머신러닝: 스트리밍 데이터를 활용한 실시간 데이터 분석과 머신러닝 구현 방법을 소개합니다.
CHAPTER 12 AWS 보안: AWS 환경에서의 데이터 및 모델 보안, IAM(Identity and Access Management), 데이터 액세스 보호, 암호화, 보안 관리 등을 다룹니다.
이 책을 통해 AWS 기반 데이터 과학에 관한 종합적인 지식을 습득할 수 있으며, 클라우드 환경에서 데이터 처리, 모델 훈련, 배포, 모델 보안 및 모니터링 등 다양한 주제를 다룰 수 있습니다. 데이터 수집 및 처리, 머신러닝, 배포 등의 모든 과정을 상세히 다루는 것은 물론, AWS 서비스와 도구에 대한 명확한 설명과 실용적인 모범 사례까지 제공하기 때문에 AWS 기반의 데이터 분석 및 과학 프로젝트를 수행하는 개발자들에게 이 도서를 추천합니다.