tee***
2021-06-19

캐글 마스터들의 노하우를 한 권에 집대성한 책. 흔히 사용하거나 검색으로 쉽게 찾을 수 있는 방법론 외에 다양한 대안들을 여러 예제와 함께 배울 수 있다.
[서론]
캐글은 세계에서 가장 유명한 데이터 분석 대회 플랫폼이다. 데이터를 분석하는 업무와 관련이 있는 사람이라면, 누구나 쉽게 접하고 많이 참고하는 플랫폼이다. 대회는 참가자들을 객관적이고 명확한 결과로 줄세운다. 참가자들의 성적이 등수로 바로 나온다. 그래서 분석 점수를 조금이라도 높이기 위한 특이한 기법들이 총동원된다. 이런 다양한 기법들은 데이터 분석 실무에서도 모델 정확도를 높이는 데 매우 유용하다.
[CHAPTER 1 경진 대회]
캐글에서 개최되는 데이터 분석 경진 대회를 참가하기 위해서는 어떻게 해야하고 어떤 점이 중요한 지 기초적으로 알려주는 장이다. 유명한 대회를 소개하고 캐글 대회에 등록하는 방법부터 차근차근 설명한다. 상위권 진입을 하기 위한 기본 지식도 간단히 알아본다.
[CHAPTER 2 경진 대회의 평가지표]
각 대회의 종류, 데이터셋, 평가지표에 대해서 알아본다. 각 평가지표에 따른 목적함수와 최적화 기법, 그리고 간단한 최적화 사례에 대해서 이해하고 데이터 정보 누출의 개념을 이해한다. 캐글 경진대회에 참가해서 높은 점수를 얻기 위해서는 가장 기초가 되고 또한 가장 중요한 장으로 생각된다.
[CHAPTER 3 특징 생성]
이 장부터는 분격 데이터 분석 기법과 팁 모음이다. 어떤 데이터를 마주했을 때, 어떤 기법을 사용해서 처리를 해야지만 좋은 결과를 얻을 수 있는지를 알려준다. 특징 생성은 흔히 피처 엔지니어링(feature engineering)이라고 부르는 가장 중요한 부분 중에 하나다. 결측값 처리부터, 수치형/범주형 변수 변환, 날짜/시간 처리, 변수의 조합과 다른 데이터와의 결합, 시계열 데이터 처리 등 다양한 데이터 처리 방법을 소개하고 마지막에 캐글 대회의 특징 사례도 접한다.
[CHAPTER 4 모델 구축]
모델이란 입력 데이터의 특성을 활용해서 예측값을 만들어낸다. 데이터 분석 작업은 흔히 전처리가 반이라고 이야기 하는데, 이 전처리 작업은 어떤 분석 모델을 사용할 것인지에 따라서 그 양과 난이도가 천차만별로 나눠진다. 여기서는 캐글 대회에서 사용하는 다양한 모델의 종류과 구축 방법, GBDT, 신경망, 선형 모델, 기타 모델 등을 알아보고 적합한 모델을 선택하는 팁과 테크닉을 소개한다.
[CHAPTER 5 모델 평가]
모델은 결국 현재 확보된 데이터를 활용하여 미지의 결과를 예측하기 위해 구축한다. 이 예측 능력을 모델의 일반화 성능(generalization performance)라고 한다. 확보된 데이터를 학습 데이터와 검증 데이터로 나누고, 검증 데이터 예측성능을 평가지표에 기반한 점수로 나타내 평가한다. 이 과정에서 데이터를 적절히 나눠서 모델의 일반화 성능을 평가하는 작업이 모델의 평가 및 검증과정이다. 이 장에서는 홀드아웃 검증, 교차 검증, 층화 k-겹 검증, 그룹 k-겹 검증, LOO 검증 등의 주요 검증 방법에 대해서, 일반적인 데이터와 시계열 데이터를 각각 분리해서 설명한다. 그리고 적절한 검증을 수행하기 위한 검증 포인트와 기술을 소개한다.
[CHAPTER 6 모델 튜닝]
모델의 하이퍼파라미터 튜닝과 특징 선택을 통해 모델 성능을 높이는 기술을 소개하는 장이다. 분류 문제에서 클래스의 분포가 편중되었을 때의 대처 방법도 설명한다. 모델의 성능을 더 좋게 끌어올리기 위해서는 가장 많은 다양한 시도가 이뤄지는 중요한 내용이다.
[CHAPTER 7 앙상블 기법]
여러 모델을 조합하여 모델을 만들고 예측을 수행하는 것을 앙상블(ensemble)이라고 한다. 캐글 대회에서는 많은 사람들이 다양한 모델의 앙상블에 따른 예측값으로 최종 결과를 제출한다. 실무에서는 모델의 예측 성능 뿐만 아니라, 허용 자원과 수행 성능도 고려해야 하기 때문에 앙상블의 중요성이 다소 떨어지는 경우가 있지만, 이런 조합 기법을 통해 모델의 성능을 끌어올리는 방법을 제대로 알아두는 것은 매우 중요하다.
[결론]
이 책의 부제는 "상위 랭킹 진입을 위한 필살기"이다. 확실히 캐글 대회에서 좋은 결과를 얻기 위한 개념 설명과 팁이 가득한다. 게다가 3장부터 7장까지는 캐글과 큰 관련 없이 머신러닝을 이용한 데이터 분석에서 배워두어야만 하는 내용이 가득하다. 다른 캐글러들과 치열한 경쟁을 하고 있는 캐글 대회 참가자들이라면 랭킹을 올리는데 많은 도움을 받을만한 책이다. 파이썬 기초, 판다스 기초, 넘파이 기초 등으로 지면을 잡아먹지 않고, 데이터 분석과 캐글로만 내용이 꽉 차 있는 책이라 더 좋았다.
"한빛미디어 <나는 리뷰어다> 활동을 위해서 책을 제공받아 작성된 서평입니다."