food***
2020-10-25

이 책은 NumPy, pandas, matplotlib, IPython, Jupyter 등 다양한 파이썬 라이브러리를 사용해서 효과적으로 데이터를 분석하는 방법을 알려준다. pandas의 새로운 기능뿐만 아니라 메모리 사용량을 줄이고 성능을 개선하는 고급 사용법까지 다룬다. 또한 모델링 도구인 statsmodels와 scikit-learn 라이브러리도 소개한다. 연대별 이름 통계 자료, 미 대선 데이터베이스 자료 등 실사례로 따라 하다 보면 어느덧 여러
제목은 파이썬 라이브러리를 활용한 데이터 분석이지만 데이터를 어떻게 정제하고 활용할지에 대한 내용이 조금 더 주를 이루고 있다.
파이썬을 시작한 지 얼마 안 된 입장에서 초반에 파이썬에 대한 설명이 있고, Numpy나 Pandas에 대한 설명도 꽤 자세해서 읽는데 큰 어려움은 없었다.
책에서는 Ipython을 이용해 예제를 다루고 있고 Jupyter Notebook을 이용해 시작화 데이터, 코드 등의 결과물을 보여주고 있다.
책은 크게 3 파트로 나눌 수 있다.
첫 파트는 파이썬에 대한 기본적인 것들. 분석 도구(Numpy, Pandas)에 대한 소개 및 설명
두 번째 파트는 분석 도구들을 활용해서 데이터를 정제하고 시각화하는 방법을 소개하고
마지막 마트는 데이터를 분석하는 심화 기법을 소개하고 데이터를 활용할 수 있는 방법을 알려준다.
뒤로 갈수록 파이썬뿐만 아니라 데이터를 분석하고 활용하는 내용 자체가 어려워져서 데이터 분석에 대한 기본 이해도 필요하다.