본 글은 한빛미디어 출판사 측의 "나는 리뷰어다"를 통해
무상으로 제공받아 작성된 글입니다
이번에 읽은 책은 파이썬으로 웹 크롤러 만들기입니다.
구글 같은 기업은 어떻게 만들어지나요?
"첫째, 수십억 달러를 모아 세계에서 가장 훌륭한 데이터 센터를 만들고 세계 곳곳에 배치합니다".
둘째. 웹 크롤러를 만듭니다
옮긴이의 말
이번에 나는 리뷰어다 8월에 신청한 책인 파이썬으로 웹 크롤러 만들기를 신청하였습니다.
이 책을 신청한 이유는 평소에 관심 있는 분야의 데이터 셋을 주기적으로 정재 해서 나만의 데이터로 쌓고자 하기 위해 선행지식으로
공부하기 위해 좋을 것 같아서 좋은 기회라고 생각하고 신청하였습니다.
일단 이 책은 현재 2판으로 개정되어서 나온 책입니다. 1판은 못 봤지만 그래도 평소에 관심 있었던 책이었어요.
이 책의 구성
이 책은 일단 파이썬으로 예제가 구성되어 있습니다.
저자도 파이썬 초중급자 수준에 맞혀서 개념을 설명하고 코드 예제를 작성하였다고 책에 적혀있습니다.
1부에서는 웹 스크레이핑과 웹 크롤링에 대해 깊이 있게 설명하고 책에서 사용할 라이브러리에 중점을 주로 다룹니다.
그래도 1부에서는 BeautifulSoup 라이브러리를 이용해서 다양하게 웹에서 가공해서 데이터를 쓰는 법이 주로 다뤄지는데
실제로 직접 예제를 치면서 결괏값을 보고 또한 사이트에서 어떤 부분을 데이터로 가져와서 처리하는지 보면 더욱더 학습이 잘 되실 겁니다
예제에 해당되는 사이트에 들어가서 HTML 구조를 보면서 이해를 하시면 더 이해가 잘 돼요.
또한 정규 표현식을 다루는 예제도 있고 다양한 크롤링 관련 예제가 있으니 직접 실습해보시는 걸 추천드려요
2부에서는 독자가 웹 스크레이퍼를 만들 때 유용한 추가 주제를 다룹니다.
저는 아직 7장을 읽고 있지만 2부에서 다루는 내용은 주로 저자분께서 원형 그대로의 데이터를 분석해서 그 뒤에 숨은 이야기, 웹사이트에서 종종 자바스크립트 계층이나 로그인 폼, 기타 스크랩을 방해하는 것들을 알아본다고 책에 쓰여있습니다.
이 책의 장단점
장점
1. 다양한 예제 및 파이썬 독자들도 이해할 수 있게 초중급으로 작성되어 있는 코드라서 한 줄 읽으면서 이해하기에 좋을 겁니다.
2. 중간중간에 나오는 CAUTION 글은 읽다 보면 조금 더 이해가 더 잘됩니다.
3. 그리고 이건 사소하지만 실제로 예제 치면서 명령 포트가 나오니 더욱더 학습효과가 좋았던 것 같아요.
단점
1. 거의 잘 돌아가지만 제가 1부에서 몇 개 예제는 파이썬 모듈 import 했을 때 라이브러리가 조금 책이랑 틀려서 툴의 자동완성으로 해결했던 거 같아요.
그 외에는 평소에 관심 있던 분야라서 딱히 단점이라고는 없던 거 같아요.
마지막으로
데이터를 분석하려면 데이터가 있어야겠죠. 이 책을 읽고 나면
평소에 관심 있던 분야의 데이터를 모아서 정재도 하고 원하는 데이터 셋을 구축할 수 있을 것 같아요. 그래서
저처럼 데이터에 관심 있는 분들이면 추천드립니다. 직접 예제도 쳐보고 웹사이트 구조를 보고나서 웹 스크레이퍼 구축에 있어
많은 경험을 하실 수 있을 것 같아요.
이 책에 당첨되어 리뷰를 할 기회를 주신 책만 출판사 담당자분께 감사의 뜻을 드리고
추후에 완독했을 때 리뷰 또한 다시 한번 남길 예정입니다.