faithfu***
2023-02-27

내 주변의 데이터를 파이썬으로 분석해서 의미있는 결과를 이끌어 내는 도서입니다. 데이터 수집부터 시각화까지 데이터 분석의 전체 그림을 조망하는 것은 물론, 핵심 통계 지식을 바탕으로 가설을 검증할 수 있습니다. 또한 기초 머신러닝으로 미래를 예측하는 방법까지 알려 주어 데이터 분석의 처음부터 끝까지 제대로 배울 수 있습니다.
▶ 한빛 미디어의 혼자 공부하는 시리즈는 많은 사람들의 관심과 사랑을 받고 있습니다.
· 저 또한 혼자 공부하는 머신러닝 딥러닝으로 그룹 스터디를 진행하고, 선생님들과 머신러닝에 대한 이해의 폭을 함께 넓히는 시간을 가졌었습니다.
▶ 동일한 저자님께서 이번에는 파이썬을 활용한 데이터 분석 책을 출간하였다는 소식을 듣고는 한빛미디어 <나는 리뷰어다> 활동을 하는 겸, 이 책을 바로 선택하였습니다.
· 저자의 익숙한 기술 스타일, 파이썬이라는 익숙한 도구, 데이터 분석이라는 3가지의 조합이 만들어 낼 경험이 기대되었습니다.
▶ 이 책은 제목 그대로 파이썬을 활용하여 데이터 분석을 수행하는 데 있어 필요한 기초적인 지식을 제공합니다.
· 데이터 분석에 필요한 기본기들을 스텝 바이 스텝으로 거쳐가며 쌓을 수있게 해줍니다.
· 그 기본기가 되는 파이썬 라이브러리에는 넘파이, 판다스, 맷플롯립, 사이킷런 등이 있겠죠.
· 더불어 약간의 파이썬 경험이 있으면 완독이 수월할 것으로 예상되나, 이 조차도 상쇄할 수 있을만큼의 저자의 상세하고 친절한 설명이 돋보입니다.
· 아마 혼자 공부하는 머신러닝 딥러닝 편보다도 비전공자를 위한 세심한 배려를 했다고 저자도 밝히고 있으니 더욱 기대가 됩니다.
▶ 실습 환경은 코랩입니다. 최근 프로그래밍을 학습하기 위해서 클라우드 기반의 코랩이 대세인 듯 합니다.
· 로컬에서보다도 훨씬 성능 좋은 컴퓨팅 자원을 쓸 수 있을 뿐더러, 인터넷만 되는 환경이면 손쉽고 작업하고, 이를 포트폴리오화하여 공유할 수 있기 때문일 것입니다.
· 어쨌든 코랩을 실습 환경으로하여 작업하는 점도 매우 좋았습니다.
▶ 이 장의 구성은 다음과 같습니다.
· 먼저 데이터 분석, 데이터 과학의 개요를 살펴봅니다.
· 특히 데이터 과학을 데이터 분석과 분리하여 통계학, 데이터분석, 머신러닝, 데이터마이닝 등을 아우르는 큰 개념으로 제시하여 설명하는 부분이 좋았습니다.
· 구글 코랩 세팅 방법을 다룹니다. 아주 기본적인 환경 설정과 세세한 설명을 곁들이고 있습니다.
· 다음으로 데이터를 본격적으로 다루기 시작합니다.
- 코랩에서 판다스 데이터프레임으로 CSV파일을 읽고 쓰는 방법에 대해 다룹니다. 이와 곁들어 공개 데이터 세트 대표 사이트들과 유명 포럼, 커뮤니티 등을 소개해주고 있습니다.
· 웹 서비스 API에서 데이터를 가져오는 방법을 다룹니다.
- 이 때 사용되는 request() 패키지와 get() 함수, JSON() 메서드를 활용해 파이썬 객체로 변환하는 과정을 친절히 다루고 있습니다.
- 물론 beautifulsoup() 패키지를 활용해 웹 스크래핑을 하는 법을 잊지 않고 있고요.
· 데이터를 수집했으니 이제 데이터를 정제합니다.
- 이제 데이터 프레임과 친해질 시간입니다.
- 불필요한 데이터를 삭제하고, 잘못된 데이터를 수정하는 방법을 익힙니다.
· 전체 데이터를 요약하는 방법도 다룹니다.
- 몇 개의 수치로 요약하거나 그래프로 나타내는 방법을 많이 사용합니다.
- 넘파이의 기술 통계 함수를 다루고, 분포를 요약하기 위해 산점도, 히스토그램, 상자수염그림 등을 다뤄봅니다.
· 데이터는 시각화하는 것이 제 맛입니다. 그래야 보이지 않던 것들이 보이기 시작하죠.
- 파이썬의 대표 시각화 라이브러리인 맷플롯립의 사용법을 다룹니다.
- 기본적인 선 그래프와 막대 그래프 그리기로 시각화에 맛을 봅니다.
- 복잡한 데이터를 표현하기에는 사실 이것만으로는 불충분합니다. 맷플롯립의 객체지향 API를 활용해 그래프를 꾸미는 방법이 필요합니다.
- pyplot과는 다른 객체지향 API를 활용해 그래프를 세세하게 조정하며, 복잡한 그래프를 그리는 방법을 다룹니다.
- 맷플롯립의 고급 기능은 알아두면 쓸모 있을 것들이 많습니다. 하나씩 고급 기능들을 익혀나가며 멋진 그래프에 한 걸음식 다가갑니다.
· 데이터 분석의 마지막 단계는 바로 검증과 예측입니다.
- 데이터 수집, 탐색, 시각화까지 했다면 이제 데이터를 활용한 의사결정의 시간입니다.
- 통계적으로 추론하는 단계가 필요합니다. 모수검정, 표준점수, 중심극한정리, 신뢰구간, 가설검정, 순열검정 등을 다룹니다.
- 머신러닝을 활용해 예측을 하는 프로세스를 다룹니다.
▶ 사실 데이터 분석을 주제로 한 책을 여러 권 읽어보았지만, 다른 책들과는 구별되는 차이점은 다음과 같습니다.
· 먼저, 입문자를 위한 책이지만, 그렇다고 하여 쉬운 것만 다루지 않습니다.
- 웹 스크래핑이나 API를 활용해 데이터를 수집하고, 시각화를 다양하게 하는 방법을 다루고 넘어가는 점이 차별화됩니다.
· 이 책의 좋은 점은 저자의 동영상 강의와 깃허브를 통해 실습 코드를 얻을 수 있다는 점에 있습니다.
- 혼자 공부하는 시리즈가 그렇듯 그만큼 독자 친화적이며, 독자가 공부하면서 갖게 되는 경험 등에 대해 세세한 고민이 반영되어 있습니다.
- 이 책에서 배운 함수와 메서드는 부록으로도 잘 정리되어 있어서 활용하기에 용이합니다.
▶ 실생활 데이터로 데이터 분석의 기초를 탄탄하게 잡길 원하시는 분이라면 "혼자 공부하는 데이터 분석 with 파이썬(2023, 한빛미디어)"을 읽어보시길 추천드립니다.
※ "한빛미디어 <나는 리뷰어다> 활동을 위해서 책을 제공받아 작성된 서평입니다."