june08***
2020-09-27

웹에 존재한다면 그것이 어떤 형태이든 데이터로 추출할 수 있다. 필요한 무기는 이 책과 파이썬뿐. BeautifulSoup, 셀레니움, 테서랙트 등 강력한 파이썬 라이브러리 사용법과 함께 API, 인증, 이미지 및 텍스트 인식, 로그인 처리 등 웹 크롤링의 기초부터 고급 기법까지 종합적으로 다루는 유일한 책. 실제 업무와 생활에 적용할 수 있는 예제가 가득하다. 2판은 예제를 추가 및 업데이트했고 모던 웹에서 거의 모든 종류의 데이터를 가져오는 방법을
### Review
데이터의 중요성이 날로 높아져 가는 지금 데이터 수집과 분석에 조금씩 관심을 가지게 되었다.
'데이터는 양만 많으면 되는거 아닌가' 라는 생각을 가지고 있었는데 이 책을 읽으면서 다양한 데이터 수집경로, 수집방법, 양질의 데이터를 수집하기위한 다양한 고려사항 등을 알게되었다.
웹을 하던 사람이 아니라 사이트 구조를 분석하고 파악하는 부분에서 조금 당황했지만 계속 보다보니 한결 수월하게 학습을 할 수 있었던 것 같다.
웹 크롤링을 처음 접하고 데이터에 관심있는 사람이라면 무조건 읽어봐야 할 책인것은 분명한 것 같다.
책은 파이썬으로 설명을 하고있음으로 파이썬을 알고있는 독자들이라면 좀 더 쉽게 이해할 것 같다.