메뉴 바로가기 검색 및 카테고리 바로가기

한빛미디어

독자리뷰

웹 크롤러의 모든것!

byc3***

|

2021-08-22

파이썬으로 웹 크롤러 만들기(2판) : 초간단 나만의 웹 크롤러로 원하는 데이터를 가져오는 방법

웹에 존재한다면 그것이 어떤 형태이든 데이터로 추출할 수 있다. 필요한 무기는 이 책과 파이썬뿐. BeautifulSoup, 셀레니움, 테서랙트 등 강력한 파이썬 라이브러리 사용법과 함께 API, 인증, 이미지 및 텍스트 인식, 로그인 처리 등 웹 크롤링의 기초부터 고급 기법까지 종합적으로 다루는 유일한 책. 실제 업무와 생활에 적용할 수 있는 예제가 가득하다. 2판은 예제를 추가 및 업데이트했고 모던 웹에서 거의 모든 종류의 데이터를 가져오는 방법을

  • 저자 : 라이언 미첼
  • 번역 : 한선용
  • 출간 : 2019-03-29

[나의 한줄 추천사]

웹에서 실시간으로 정보 수집 / 변경되는 부분을 자동으로 찾고자 할때 필요한 기술이 바로 스크래핑이다. 스크래핑을 제대로 알고 싶으면 책을 보라.

[ 추천 이유]

스크래핑 관련 내용들을 A-Z 까지 정리된 책이다. 한권이면 궁금한 내용들을 해소할 있다.

 

[내가 찾고자 했던 질문과 대답들]

1.내가 찾고자 하는 부분을 모를 경우 전체 사이트에 대한 " 크롤링" 가능한가?

    - '케빈 베이컨의 여섯다리' 이론으로 연결된 링크를 통해서 무작위 검색을 통해서 해당 웹사이트의 내용들을 크롤링이 가능하다.

2. 크롤링은 법적으로 문제가 없는가?

    - robots.txt 파일을 정의된 부분으로 데이터 수집시 문제가 없다. 크롤링은 구글에서 검색엔진 데이터베이스로 사용하는 기본 기술이기 때문에 문제가 있다면 검색 사이트 자체가 문제가 되는 것이다.

 

3. 크롤링하다가 막힌다면?

    - 사람처럼 보이게끔 하는 "크롤링 체크리스트" 통해서 문제점을 확인 있다. 가령 사람처럼 액션을 취할때 딜레이가 있는데 딜레이 방법 방법으로 흉내내는 것이다.

 

4.샘플 코드로 코딩하고 싶다면?

    - https://github.com/REMitchell/python-scraping

닫기

해당 상품을 장바구니에 담았습니다.이미 장바구니에 추가된 상품입니다.
장바구니로 이동하시겠습니까?