onedayi***
2019-12-15

데이터 분석의 품질에 큰 영향을 미치는 데이터 전처리는 매우 중요한 작업이다. 전처리 공정을 전체적으로 이해하려면 프로그래밍 언어에 관한 이해뿐만 아니라 통계학이나 머신러닝에 관한 기반 지식이 필요하지만 이를 포괄적으로 설명하는 책은 없었다.
[들어가며]
불과 몇 년 전만 해도 IT의 화두는 빅데이터였다. 하지만 몇 년 되지도 않아서 대세는 머신러닝, AI가 되어 버렸다.
많은 산업계에서 ML과 AI는 필수적인 기술이 되어버렸다. ML과 AI는 만능인듯 보이지만, 실제로는 많은 선작업이 필요하다.
그 중에 가장 많은 시간을 할애하는 것 중의 하나가 바로 전처리이다.
이 책은 그 전처리에 대해서 다룬다. Python, R, SQL을 모두 사용하여 이를 설명하고 있다. (일반적으로 많이 사용하는 RDBMS인 오라클이나 MySQL, MSSQL, PostgreSQL이 아닌 RedShift를 사용한 것이 좀 의아하다.)
[요약]
Part 1
전처리의 개념에 대해 설명한다. 전처리의 역할, 흐름, 사용언어 및 라이브러리, 데이터셋에 대해 설명한다.
Part 2
데이터 구조 전처리에 대한 파트이다. 데이터를 추출하는 방법, 샘플링, 집약, 결합, 분할, 생성, 전개 등 많은 형태로 추출하는 법을 설명한다.
Part 3
파트2에서 추출한 데이터의 내용을 전처리하는 것에 대해 설명한다. 수치형 데이터, 범주형 데이터, 일시형 데이터, 문자형 데이터, 위치 정보형 데이터를 전처리하는 방법에 대해 설명한다.
Part 4
실전 전처리를 위한 연습 문제이다. 집계 분석, 추천 전처리, 예측 모델링 전처리
[후기]
내용을 보면 Awesome과 Not Awesome이 있어, 어느 것을 선택해야 하는지 명확하게 설명해 주어 좋다.
실무적인 내용이 포함되어 있어, 현업에 종사하는 사람에게 큰 도움이 된다.
다만, 위에서도 언급했듯이 SQL용으로 RedShift를 사용한다. ㅡ.ㅡ;
[추천대상]
1. ML이나 AI 관련 업종에서 전처리 업무를 담당하는 사람에게 추천한다.
2. Python, R, SQL 등을 어느 정도 알고 있어야 한다.