blusk***
2020-10-25

웹에 존재한다면 그것이 어떤 형태이든 데이터로 추출할 수 있다. 필요한 무기는 이 책과 파이썬뿐. BeautifulSoup, 셀레니움, 테서랙트 등 강력한 파이썬 라이브러리 사용법과 함께 API, 인증, 이미지 및 텍스트 인식, 로그인 처리 등 웹 크롤링의 기초부터 고급 기법까지 종합적으로 다루는 유일한 책. 실제 업무와 생활에 적용할 수 있는 예제가 가득하다. 2판은 예제를 추가 및 업데이트했고 모던 웹에서 거의 모든 종류의 데이터를 가져오는 방법을
최근에 파이썬에 대한 관심이 증가 하면서 여러 분야에서 사용이 되고 있다.
다양한 분야중에 웹 크롤러도 주목을 받고 있다.
나도 관심을 갖고는 있었지만 그저 막연하게만 생각하고 있었다. 어떤 방법들이 있는지, 무엇을 먼저 해야 하는지 모르고 있었다.
그런 의미에서 이 책은 웹 크롤러에 대해서 기초부터 고급까지 차근차근 알아 볼수 있는 책이다.
읽으면서 몇가지 필요한 것들에 대해서 생각해 보았다.
1. 파이썬에 대한 기초적인 문법들은 알고 있어야 코드를 이해할 수 있다.
2. 웹 에 대해서도 기초적인 코드는 알고 있어야 한다. (html, javascript등)
3. 정규 표현식도 알고 있으면 도움이 된다.
4. 크롤러 라는건 생각보다 간단하지 않다. 인내력이 필요하다. 데이터 분석과 거의 동일한 작업이라는 생각이 든다.
그리고 책 마지막 부분에 있듯이 크롤러라는 것이 다른 웹 페이지에 있는 내용들을 수집하는 기술 이기 때문에 저작권 문제가 생길 수 있다. 정기적으로 크롤링 하는 것에 대해서는 반드시 원작자에 허락을 받아야 한다.
파이썬으로 웹 크롤러를 만들어 보려고 하는 분들이 많을 거라 생각이 든다. 이책은 그 분들에게 많은 도움이 될것이다.