hb***
2016-10-03

이 책은 독자에게 대량의 데이터셋을 가지고 스파크를 활용해 복잡한 분석을 실제로 해보는 생생한 느낌을 전달한다. 단순히 모델을 구축하고 평가하는 데 그치지 않고, 전체 파이프라인을 돌아보며 데이터 정제, 전처리, 데이터 조사, 실제 제품으로 만들기까지를 보여준다.
아파치 스파크를 활용해 데이터를 분석하는 방법을 다루는 책으로,
다양한 종류의 데이터로 어떻게 추천 시스템을 만들고 예측을 하는지 설명하고 있습니다.
책에 나오는 예제들은 데이터를 가공하고 처리하고 분석하는 과정을 자세히 설명하고 있어서
소장해 놓았다가 실제로 데이터 처리를 할 때 꺼내보면 도움이 많이 될 것 같습니다.
이 책은 다른 데이터마이닝 책에서 기본적으로 다루는 개념들을 쉬운 말로 풀어서 설명합니다.
랜덤 포레스트, K-평균 군집화, TF-IDF 같이 이론으로만 접했던 내용들을
실제로 스파크에서 코딩하며 실습해 볼 수 있어서 유용합니다.
다만 스칼라 문법을 모르는 초보자가 이 책에 있는 코드를 이해하기에는 조금 어려운 감이 있습니다.
스칼라 문법이나 스파크 사용법은 따로 찾아보면서 실습을 해보면 좋을 것 같습니다.