파이썬 라이브러리를 활용한 데이터 분석(2판)
이 책은 NumPy, pandas, matplotlib, IPython, Jupyter 등 다양한 파이썬 라이브러리를 사용해서 효과적으로 데이터를 분석하는 방법을 알려준다. pandas의 새로운 기능뿐만 아니라 메모리 사용량을 줄이고 성능을 개선하는 고급 사용법까지 다룬다. 또한 모델링 도구인 statsmodels와 scikit-learn 라이브러리도 소개한다. 연대별 이름 통계 자료, 미 대선 데이터베이스 자료 등 실사례로 따라 하다 보면 어느덧 여러
- 저자 : 웨스 맥키니
- 번역 : 김영근
- 출간 : 2019-05-20
학교다닐때부터 문과였기는 했지만 통계와 데이터분석에 관심이 아주 많았다. 대학원을 가서도 사회과학을 했지만 내 손에는 통계와 데이터분석관련 책이 계속 놓여있었다. 회사에 들어가서도 영업부서부터 시작했지만 그당시 한창 뜨고 있었던 빅데이터, 기계학습이 유행하면서 지금은 기업의 영업활동에서 가장 중요한 것이 고객 데이터 분석이 되었다.
처음에는 SPSS, SAS, Minitab, Stata 같은 툴을 만지작 거리다가 대학원에 들어가서는 R을 접하면서 더욱 더 데이터 분석에 맛을 들였다. 회사에서는 잠시 영업일을 하다가 기획과 마케팅 파트로 넘어오면서 프로그래밍 언어에 관심을 기울이게 되었는데 대체로 전공자가 아닌 사람이 시작할 수 있는 언어가 파이썬이라고 해서 파이썬을 배웠다. 그런데 내가 꾸준히 관심을 가졌던 데이터분석을 파이썬으로 할 수 있지 않을까해서 선택하게 된 책이 이책이다. 파이썬은 오픈소스방식으로 라이브러리가 무한하다. 지금도 늘어나고 있다. 그래서 기존 통계나 수학 소프트웨어에사 사용할수있는 기능들이 파이썬 라이브러리로 개발되고 있다. 이책에서 나오는 NumPy, pandas, matplotlib, IPython, Jupiter 등도 데이터 분석을 용이하게 해주는 라이브러리이다. 책에서는 이러한 라이브러리의 소개와 기본 주요기능들을 소개하고 실행하게 도와준다. 그리고 예전에 통계학 수업을 들을때 중요하게 이야기들었던 EDA(탐색적 데이터 분석)을 정교하게 할 수 있는 데이터 정제, 변형, 조인, 병합을 통해 정말 Raw data에서 활용가능한 데이터 형식으로 가공할 수 있는 방법을 알려준다. 또한 데이터 집계와 그룹화된 연산을 통해 분석 툴이나 라이브러리를 사용할 수 있도록 데이터 디자인을 가이드해준다.
역시 이책의 정수는 말미에 있는 데이터 예제이다. 미국 국무부 데이터, 영화 평점 데이터, 신생아 이름, 미국 농무부 영양소 정보, 미국 선관위 데이터베이스 등 재미있고 다양한 분석의 예제를 통해 저자의 분석방향을 살펴볼 수 있다. Appendix는 고급 Numpy와 IPython 시스템에 대해서 나오는데 좀더 깊은 이해가 필요한 독자에게 좋을 것 같다. 파이썬은 초심자의 언어로 알려져있지만 내생각에는 최고의 확장성을 가지는 프로그래밍언어가 더 맞는 것 같다. 이책이 지향하는 것처럼 파이썬은 접착제처럼 쓰이는 연결자로서의 언어가 아닐까 생각해본다.