메뉴 바로가기 검색 및 카테고리 바로가기

한빛미디어

독자리뷰

웹 크롤러의 기본서!

ch930***

|

2020-10-24

파이썬으로 웹 크롤러 만들기(2판) : 초간단 나만의 웹 크롤러로 원하는 데이터를 가져오는 방법

웹에 존재한다면 그것이 어떤 형태이든 데이터로 추출할 수 있다. 필요한 무기는 이 책과 파이썬뿐. BeautifulSoup, 셀레니움, 테서랙트 등 강력한 파이썬 라이브러리 사용법과 함께 API, 인증, 이미지 및 텍스트 인식, 로그인 처리 등 웹 크롤링의 기초부터 고급 기법까지 종합적으로 다루는 유일한 책. 실제 업무와 생활에 적용할 수 있는 예제가 가득하다. 2판은 예제를 추가 및 업데이트했고 모던 웹에서 거의 모든 종류의 데이터를 가져오는 방법을

  • 저자 : 라이언 미첼
  • 번역 : 한선용
  • 출간 : 2019-03-29

KakaoTalk_20201024_234302374.jpg

 

 

데이터분석이 IT업계에서 중요도가 높아지면서, 데이터를 모으는 방법도 마찬가지로 중요도가 높아지고 있습니다.

 

데이터가 잘 정리되어있지 않거나, 공식적인데이터 파일이 존재하지 않는 경우에는 데이터를 수집하기위해

 

스크래핑이라는 작업을 해야하는데, 웹 상에서 스크래핑을 자동으로 해주는 도구가 바로 웹 크롤러입니다.

 

웹 크롤러는 예전부터 관심이 있어서 필요할 때마다 구글 검색을 하면서 더듬더듬 만들어본 경험이 있어서

 

책을 읽기 조금 수월했습니다.

 

책은 크게 1장에서 웹 크롤러의 원리와 기초적인 작성법을 알려주고 있고,

 

2장에서는 고급 기술 등을 설명하고 있습니다.

 

1장의 내용은 이미 해본적이 있어서 복습하듯이 읽었는데, 여러가지 데이터소스를 쉽고 간단하게 스크래핑 할 수 있도록

 

상세하게 설명이 되어 있습니다.

 

2장의 내용은 접해본적 없는 내용들이라 더 집중해서 읽게 되었습니다.

 

특히 챕터 14 스크래핑 함정 피하기 와 챕터 17 원격 스크레이핑 부분은

 

실제 크롤러를 만드는데 많은 도움이 되었습니다.

 

마지막 챕터인 18장에서는 스크래핑 자체에 대한 생각을 다시 해볼 수 있게해주는 챕터였습니다.

 

웹 크롤링에 대해 관심이 있거나 웹 크롤러 제작을 하고 있는분들께 꼭 추천 드리는 책입니다.!!!

닫기

해당 상품을 장바구니에 담았습니다.이미 장바구니에 추가된 상품입니다.
장바구니로 이동하시겠습니까?