hb***
2017-01-15

이 책은 파이썬으로 웹 크롤링을 시작하기에 안성맞춤입니다.
이 책을 보기 전에 웹에서 데이터를 긁어모으는 '웹 크롤링'이라는 단어는 들어서 알고 있었고,
파이썬에서는 BeautifulSoup 같은 여러 라이브러리들을 이용하면 쉽게 웹 크롤링을 할 수 있다는 것도 들어서 알고 있었지만,
정작 웹 크롤링이라는 것을 시작하려고 보면 막막함만 가득했습니다.
인터넷 블로그 등의 튜토리얼을 따라 해보아도 결과가 제대로 나오지 않아서
웹 크롤링은 둘째치고라도 파이썬이라는 언어 자체에 대한 벽까지 느껴졌습니다.
그런데 이 책은 파이썬과 BeautifulSoup 같은 라이브러리를 설치하고 virtualenv로 가상 환경 구성하는 방법부터 시작해서
파이썬의 여러 웹 크롤링 라이브러리들을 사용해서 크롤링을 하는 방법 절차를 군더더기없이 설명하고 있어서 따라하기 쉬웠습니다.
그리고 웹 크롤링을 할 때 어떤 절차를 따라 해야 하는지, 성가신 문제들을 해결하는 노하우 같은 것들을 이 책에서 찾을 수 있었습니다.
웹 크롤링을 하는 과정에서 정규표현식을 사용하면 좋다고 설명한 부분이 있었는데,
그 부분의 설명을 통해서 정규표현식에 대해서도 간략히 살펴볼 수 있었고
실습을 통해 정규표현식 패턴을 파이썬에서 어떻게 활용하는지 파악할 수 있었습니다.
한마디로 책 안에 필요하고 도움이 되는 내용만 알차게 잘 구성되어 있습니다.
조금 아쉬웠던 점은 파이썬 개발 환경 구성에 대해서 부록 등에 넣었으면 좋았을 것이라는 점입니다.
파이썬2와 파이썬3이 다르고, BeautifulSoup도 이 책에서는 파이썬3을 기준으로 설명하고 있어서
똑같은 코드를 쳐도 안 되는 경우가 많았습니다.
pip나 virtualenv 같은 경우 실수로 파이썬2에 설치된 패키지로 실습을 따라하다가 오류가 날 가능성이 많이 있는 것 같습니다.
부록에 이런 내용을 설명하면 좋을 것 같은 생각이 듭니다.
이 책을 읽으면서 파이썬으로 웹에서 데이터를 어떤 식으로 모으는지 알 수 있었고
소장 가치가 큰 책이라고 생각합니다.
파이썬으로 웹 크롤러를 만들고 싶은 분들에게 꼭 추천드립니다.