byc3***
2021-08-22

웹에 존재한다면 그것이 어떤 형태이든 데이터로 추출할 수 있다. 필요한 무기는 이 책과 파이썬뿐. BeautifulSoup, 셀레니움, 테서랙트 등 강력한 파이썬 라이브러리 사용법과 함께 API, 인증, 이미지 및 텍스트 인식, 로그인 처리 등 웹 크롤링의 기초부터 고급 기법까지 종합적으로 다루는 유일한 책. 실제 업무와 생활에 적용할 수 있는 예제가 가득하다. 2판은 예제를 추가 및 업데이트했고 모던 웹에서 거의 모든 종류의 데이터를 가져오는 방법을
[나의 한줄 추천사]
웹에서 실시간으로 정보 수집 / 변경되는 부분을 자동으로 찾고자 할때 필요한 기술이 바로 웹 스크래핑이다. 웹 스크래핑을 제대로 알고 싶으면 이 책을 보라.
[책 추천 이유]
웹 스크래핑 관련 내용들을 A-Z 까지 잘 정리된 책이다. 이 책 한권이면 궁금한 내용들을 다 해소할 수 있다.
[내가 찾고자 했던 질문과 대답들]
1.내가 찾고자 하는 부분을 모를 경우 전체 웹 사이트에 대한 "웹 크롤링" 가능한가?
- '케빈 베이컨의 여섯다리' 이론으로 연결된 링크를 통해서 무작위 검색을 통해서 해당 웹사이트의 내용들을 크롤링이 가능하다.
2.웹 크롤링은 법적으로 문제가 없는가?
- robots.txt 파일을 정의된 부분으로 데이터 수집시 문제가 없다. 크롤링은 구글에서 검색엔진 데이터베이스로 사용하는 기본 기술이기 때문에 문제가 있다면 검색 사이트 자체가 문제가 되는 것이다.
3.웹 크롤링하다가 막힌다면?
- 사람처럼 보이게끔 하는 "크롤링 체크리스트" 통해서 문제점을 확인 할 수 있다. 가령 사람처럼 액션을 취할때 딜레이가 있는데 딜레이 방법 방법으로 흉내내는 것이다.
4.샘플 코드로 코딩하고 싶다면?
- https://github.com/REMitchell/python-scraping