daso***
2020-10-26

웹에 존재한다면 그것이 어떤 형태이든 데이터로 추출할 수 있다. 필요한 무기는 이 책과 파이썬뿐. BeautifulSoup, 셀레니움, 테서랙트 등 강력한 파이썬 라이브러리 사용법과 함께 API, 인증, 이미지 및 텍스트 인식, 로그인 처리 등 웹 크롤링의 기초부터 고급 기법까지 종합적으로 다루는 유일한 책. 실제 업무와 생활에 적용할 수 있는 예제가 가득하다. 2판은 예제를 추가 및 업데이트했고 모던 웹에서 거의 모든 종류의 데이터를 가져오는 방법을
웹 크로링은 웹에 있는 데이터를 수집하는 거로만 알고 있었다.
JAVA에서 셀레니움을 테스트 용도로 사용해 본 적은 있지만 본격적인 데이터 수집에는 크게 관심이 없었다.
하지만 요즘에는 파이썬으로 사용하는 영역이 넓어지고, 내가 사용하는 맥북에서도 파이썬이 잘 돌아가니
한번쯤은 해봐야겠다는 생각을 했었다.
많이 복잡하지 않고 간단하게 파이썬만으로 크롤링을 할 수 있다는 게 매력적이라 하겠다.
이제 이 책을 보고 좀 더 프로젝트에서 적용할 곳을 고민해 봐야겠다.
분석이 기본은 데이터를 쌓는 것이니 쌓은 데이터를 활용하는 방안도 고민해 봐야할 뜻 하다.