minamil***
2020-09-26

웹에 존재한다면 그것이 어떤 형태이든 데이터로 추출할 수 있다. 필요한 무기는 이 책과 파이썬뿐. BeautifulSoup, 셀레니움, 테서랙트 등 강력한 파이썬 라이브러리 사용법과 함께 API, 인증, 이미지 및 텍스트 인식, 로그인 처리 등 웹 크롤링의 기초부터 고급 기법까지 종합적으로 다루는 유일한 책. 실제 업무와 생활에 적용할 수 있는 예제가 가득하다. 2판은 예제를 추가 및 업데이트했고 모던 웹에서 거의 모든 종류의 데이터를 가져오는 방법을
완독 한 상태가 아니기 때문에 후기라 명하기에는 부족한 감이 있습니다만..
이전에 읽어보았던 크롤링 관련 책들은 아무래도 접근하기 쉽도록 만들기 위해 쓰인 느낌이 많이 있었습니다. 이번에 접하게 된 한빛미디어의 파이썬으로 웹 크롤러 만들기는 분위기가 좀 다른 느낌이었습니다. 번역본이라 그럴지도 모르겠지만 일단 O'REILLY의 원서이기 때문에 책에서 재미를 느끼기엔 약간 어려움이 있었던 것 같습니다.
다른 책들이 현행의 서비스를 크롤링하는 방식으로 접근하기 쉽게 가이드를 해준다는 이점이 있었지만, 서비스가 업데이트될 경우 크롤링이 되지 않는 경우도 있습니다만 파이썬으로 웹 크롤러 만들기는 연식이 좀 되긴 했지만 책에서 따라하는데 문제가 없도록 기존 사이트를 유지하고 있는 것을 알 수 있었습니다.
어떤 과정은 가상머신을 설치해야 하는 등 번거로움도 있었고 따라 하지 못한 부분도 있었고 전체적으로 재미보다는 기본적으로 필요한 부분들에 대해 천천히 공부하는 방식으로 진행되고 있어 따분한 경향이 없잖아 있습니다. 하지만 다른 책들에서는 잘 다루지 않는 부분들(?), 예를 들면 폼과 로그인 뚫기 라던가 API를 통한 크롤링, 사이트 테스트 등 고급 사용법들도 다루고 있습니다.
무분별한 스크랩핑이 법적 문제점도 가지고 있는 만큼 책의 후반부에서는 합법성과 윤리에 대해서도 다루고 있습니다. 파이썬으로 웹 크롤러 만들기는 재미보다는 기초부터 차근차근 접근해 보고 싶으신 분이라면 도움이 되지 않을까 생각이 들었습니다. 그리고, 당연한 이야기일지 모르겠지만 입문 수준의 파이썬 문법만으로 용감하게 접근하기에는 조금 무리가 있다 여겨집니다.