메뉴 바로가기 검색 및 카테고리 바로가기

한빛미디어

독자리뷰

데이터 과학을 위한 통계(Practical Statistics for Data Scienties)

bum***

|

2020-09-20

데이터 과학을 위한 통계

데이터 과학자가 고전 통계를 낱낱이 알아야 하는 것은 아니다. 이 책은 다양한 통계 기법을 데이터 과학에 적용해보며, 중요한 것과 중요하지 않은 것을 구분하는 실용적인 방법을 알려준다. EDA, 회귀분석, 분류 등 오늘날 데이터 분석과 머신러닝에서 사용하는 기법들의 근본이 되는 통계 개념을 확실하게 이해할 수 있다.

  • 저자 : 피터 브루스 , 앤드루 브루스
  • 번역 : 이준용
  • 출간 : 2018-10-02
데이터 과학을 위한 통계(Practical Statistics for Data Scienties)

요즘은 이미 빅데이터, 머신러닝, 딥러닝이 익숙해져버린 시대인거 같습니다. 딥러닝 관련 학습을 하거나 프로그래밍을 해야할 때 필수적으로 나오는게 통계에 관련된 내용들입니다. 부분 부분적으로 나오는 통계에 관한 내용을 볼 때 용어부터 시작해서 무슨무슨 이론등이 등장하는데, 통계에 대해 좀 더 자세히 알고 싶을때 어떻게 시작할 지 어디부터 어디까지 봐야할 지 판단이 쉽지 않습니다.

이 책은 통계학을 기본으로 통계 용어부터 핵심 개념정리, 데이타를 다루고 분석하는 방법, 머신러닝의 내용을 예제와 그래프를 통해 시각적으로도 설명해 줌으로써 통계학적 의미들을 잘 정리할 수 있게 도와주는 책입니다.

목차
탐색적 데이터 분석
데이터와 표본분포
통계적 실험과 유의성 검정
회귀와 예측
분류
통계적 머신러닝
비지도학습

탐색적 데이터 분석
과거의 통계는 방대한 자료를 모두 모아서 본석하는게 힘들어서 표본(샘플)로 부터 모집단의 형태를 최대한 유사하게 추정하는 식이었다면
최근에는 (빅)데이타는 주어진 상태에서 이 데이타들이 어떤 형태이고 어떤 특성들이 있는지 판단하고, 활용하는 형태로 활용되고 있습니다.

수집한 데이터가 들어왔을 때, 이를 다양한 각도에서 관찰하고 이해하는 과정입니다. 한마디로 데이터를 분석하기 전에 그래프나 통계적인 방법으로 자료를 직관적으로 바라보는 과정입니다

이를 위한 기법으로는 위치 추정, 변이 추정, 데이터 분포 탐색등의 방법을 사용합니다.
캐글등에서 문제를 풀때 초반에 pandas의 describe() 같은 함수를 실행시키면
평균이나 중간값, 표준편차, 100분위수 구하기등을 통해 대략의 데이타형태를 가늠할 수 있습니다.
이런 용어들의 정의와 함께 다른 학문에 쓰는 유의어 및 각 용어(혹은 개념)들이 왜 무엇을 보완하기 위해 나오는지등을 알려주고 있습니다.

무엇을 설명하기 전에 예를 들어 특정 상황을 설명하고 질문이나 화두를 던진 후에 간략한 설명과 함께 수식과 코드 그래프를 곁들이는데
수식은 거의 없거나 예제를 설명하는 선정도로 간단히 나옵니다.
코드는 R로 작성된 코드가 나옵니다. 어떤 항목이 어떤 함수나 라이브러리를 통해 구하거나 표시할 수 있는지를 알려주기 위한 용도의 스니펫으로 
R문법을 설명하거나 전체동작코드가 모두 책에 나와있지는 않습니다. 실행가능한 코드는 github자료실에 받아 실행하실 수 있습니다.
통계학 용어(혹은 개념)에 대해 몇 페이지마다 그래프가 표시되어 설명을 읽고 좀 더 직관적으로 이해하기에 도움이 많이 되었습니다.
파트가 길지 않으면서  도입부 주요 개념과 마무리글등이 있어서 큰 무리없이 읽을 수 있었던 거 같습니다.
데이터과학자 혹은 머신러닝쪽만 한다면 크게 관련이 없는 통계의 항목(개념)들은 설명하면서 알려주어서 이해를 못해도 부담없이 넘어가거나 할 수 있었습니다.

코딩을 위한 책이 아니므로 R을 몰라도 읽는데 무리는 없을 거 같습니다.
다만 설치 및 library 설치 소스내 경로 수정, 그리고 예제파일 실행을 위한 데이타파일 다운로드 등은 소스내 다운로드용 프로그램을 실행시켜서 직접 해야 하는 불편은 있습니다
닫기

해당 상품을 장바구니에 담았습니다.이미 장바구니에 추가된 상품입니다.
장바구니로 이동하시겠습니까?