메뉴 바로가기 검색 및 카테고리 바로가기

한빛미디어

독자리뷰

웹 크롤러 필독서

nata***

|

2020-10-22

파이썬으로 웹 크롤러 만들기(2판) : 초간단 나만의 웹 크롤러로 원하는 데이터를 가져오는 방법

웹에 존재한다면 그것이 어떤 형태이든 데이터로 추출할 수 있다. 필요한 무기는 이 책과 파이썬뿐. BeautifulSoup, 셀레니움, 테서랙트 등 강력한 파이썬 라이브러리 사용법과 함께 API, 인증, 이미지 및 텍스트 인식, 로그인 처리 등 웹 크롤링의 기초부터 고급 기법까지 종합적으로 다루는 유일한 책. 실제 업무와 생활에 적용할 수 있는 예제가 가득하다. 2판은 예제를 추가 및 업데이트했고 모던 웹에서 거의 모든 종류의 데이터를 가져오는 방법을

  • 저자 : 라이언 미첼
  • 번역 : 한선용
  • 출간 : 2019-03-29

KakaoTalk_20201022_005737391_11.jpg

 

대상독자 

 

파이썬을 이용해 웹 크롤러를 만들고 싶은 사람

 

​좋았던 점

 

1. 웹 크롤링/웹 스크래핑이 무엇인지 모르는 사람들에게도 이해하기 쉽게 구성된 챕터

2. 매끄러운 번역

3. 다양한 예제, 라이브러리를 통한 코드의 용이한 작성 및 완성

4. 데이터를 다루는 부분에 대한 상세한 챕터

5. 실용적인 예제로써 웹 스크래이핑의 윤리와 합법성에 대한 부록

 

요근래에 파이썬에 대해 많은 관심이 생겨서 혼자하는 파이썬 책과 온라인 강의를 통해  기초를 배우고 공부할 수 있었다. 

그 와중에 웹 크롤링이라는 아주 흥미롭고 재미있는 기법을 알게 되었는데,  처음에는 관심있는 배우의 사진을 한꺼번에 저장하는 방법을 예제를 통해 완성해 작동시켜보았다. 그 이후로 웹을 통해 파이썬을 활용할 수 있는 더 다양한 방법이 뭐가 있을까 검색해보던 중, 데이터 수집과 웹 크롤링(스크래핑) 기법이 밀접한 관계에 있다는 것을 알게 되었고 관련 서적을 읽어 볼 생각을 하게 되었다.  마침 좋은 기회가 있어 이렇게 온전히 웹 크롤링을 전반적으로 다루는 책을 읽을 수 있게 되었다.

아쉽게도 이 책은 초급자가 그대로 따라하면 따라할 수 있겠지만, 그래도 조금은 문법같은 것을 알고 접하는 편이 좋을 것 같다.

먼저 이 책의 모든 내용이나 마찬가지인 웹 스크래핑이란, 데이터를 수집하는 작업 전체를 뜻한다. 웹페이지를 가져와 페이지 내 데이터를 추출하는 것을 뜻한다.

읽어보면서 느낀 이 책의 가장 기초적이면서 핵심적인 내용은 다음 키워드들 인 것 같다.

 

​- API / beautifulSoup

- html 분석

- csv를 통한 문서 저장 및 읽기

- 스크레이퍼(scrapy)

 

​위의 4가지를 통해서 파이썬을 통해 웹상에서의 방대한 양의 데이터를 어떻게 수집하고 잘라내고 저장해서 우리가 원하는 자료로 만들어 내는지를 예제를 통해 학습하고 실행해 볼 수 있다.

 

​완독하고 나니 책을 통해 단순히 사진을 저장하기만했던 과거에서 데이터를 구성할 수 있는 단계로 레벨업할 수 있게 되어서 뿌듯하다.

두세번 더 읽으면 나만을 위한 웹 데이터사전을 만들 수 있을것 같다.

 

 

닫기

해당 상품을 장바구니에 담았습니다.이미 장바구니에 추가된 상품입니다.
장바구니로 이동하시겠습니까?