메뉴 바로가기 검색 및 카테고리 바로가기

한빛미디어

독자리뷰

책 하나면 파이썬으로 웹 크롤러 만들기를 끝낼 수 있다!

nww***

|

2019-06-09

파이썬으로 웹 크롤러 만들기(2판) : 초간단 나만의 웹 크롤러로 원하는 데이터를 가져오는 방법

웹에 존재한다면 그것이 어떤 형태이든 데이터로 추출할 수 있다. 필요한 무기는 이 책과 파이썬뿐. BeautifulSoup, 셀레니움, 테서랙트 등 강력한 파이썬 라이브러리 사용법과 함께 API, 인증, 이미지 및 텍스트 인식, 로그인 처리 등 웹 크롤링의 기초부터 고급 기법까지 종합적으로 다루는 유일한 책. 실제 업무와 생활에 적용할 수 있는 예제가 가득하다. 2판은 예제를 추가 및 업데이트했고 모던 웹에서 거의 모든 종류의 데이터를 가져오는 방법을

  • 저자 : 라이언 미첼
  • 번역 : 한선용
  • 출간 : 2019-03-29

20190526_212820.jpg

 

 

 

 

 

 

 

 

이 책은 오라일리 미디어의 Web Scraping With Python 2nd Edition을 한빛미디어에서 한글 번역본인 '파이썬으로 웹 크롤러 만들기 2판'입니다.

 

 

 

웹 크롤링이란? 

크롤링(Crawling)이라고도 하고, 스크레이핑(Scraping)이라고도 부르며 웹페이지를 가져와 페이지 내의 데이터를 추출해내는 것을 일컫는 말로, 이런 작업을 수행하는 프로그램을 크롤러(Crawler)라고 합니다.

 

 

 

책을 읽기 위해 필요한 것

 

파이썬에 대한 기초 지식 

프로그래밍에 대한 기초 지식

 

 

책 이름대로 파이썬을 이용해서 크롤러를 만드는 것이 목적이기 때문에, 책에 있는 모든 소스가 파이썬으로 작성되어 있습니다. 다른 프로그래밍 언어는 알지만, 파이썬을 아예 모르거나, 아직 기초적인 내용밖에 모르는 사람이더라도 책을 읽기에는 무리가 없습니다. 파이썬을 써본 적이 없거나, 멀리하셨던 분들은 이 기회에 파이썬을 익히는 것도 나쁘지 않을 것 같습니다.

 

 

 

책의 구성

 책은 크게 파트 1과 파트 2로 나누어져 있습니다.

 

파트 1

 파트 1에서는 웹 스크레이퍼의 기초, 본질적인 내용들을 위주로 다루며 웹 크롤러 개발을 시작하기 위한 토대를 닦는 과정입니다. BeautifulSoup을 설치해서 사용해보고, HTML 태그에서 단서를 구하는 방법, 정규 표현식 같은 기초 내용을 학습하는 구간입니다.

 

 

파트 2

  파트 2의 내용은 파트 1의 내용을 충실히 학습한 학습자나, 이미 알고 있는 개발자에게 필요한 내용들로 웹상에서 만나는 다양한 데이터 형태와 예외들에 대해서 다루고 있습니다. 상호 작용 기능이나, 폼, 자바스크립트에 의해 크롤링이 방해받을 때, 이를 극복하는 방법에 대해서도 쓰여 있습니다. 사이트에 직접 테스트를 해보고, 자동화하고, 커진 규모에 좀 더 빠르게 작동할 수 있게 최적화를 하고 병렬화를 시도해보는 등 고급 스킬들에 대해서도 다룹니다.

 

 

 

이 책의 장점

 

1. 웹 크롤링에 대해 무지한 사람도 이해하기 쉽게 작성되어 있다.

 웹에서 정보를 가져오고 싶은 사람들이 적절한 파이썬 강의만 학습해도 이 책을 읽고 크롤러를 만드는데 무리가 없어 보입니다. 크롤러를 만드는 것에 초점을 뒀기 때문에 필요 이상의 깊이 있는 내용이 들어 있지 않는 것이 한몫하는 것 같습니다.

 

 

2. 어색함이 느껴지지 않은 준수한 번역

 과거에 비하면 번역에 문제가 있는 책들이 적은 편이긴 해도 여전히 대안이 없는 상태에서 질 낮은 기계 번역을 이용한 책들이 시중에 나와 있는 걸 감안하면, 이 책은 원래 한글로 작성된 수준이라고 볼 수 있습니다. 부자연스러운 문장을 찾아볼 수 없었던 깔끔한 번역판이라 기초 지식만 가지고 있거나, 그마저도 부족한 사람들이 부자연스러운 용어나 표현으로 인해 학습하기 어려운 부분은 없다고 볼 수 있습니다.

 

 

3. 다양한 경우를 만나고, 실용적인 도구를 만들 수 있다.

 웹 크롤링을 하면서 만날 수 있는 다양한 경우들에 대해 책에서 다루고 있습니다. 무작정 데이터를 긁어올 수 있으니 이런 식으로 작성하라고 이야기하는 것이 아니라, '이 방법이 통하지 않는 경우가 있는데 그 이유는 무엇이며, 이러한 방식으로 대처가 가능하다.'라는 설명이 있어 실생활에서 유용하게 쓸 크롤러를 만들 수 있습니다.

 

 

4. 흥미로운 내용

 이 책은 국내에서 저자가 북미에 거주 중인 상황이라, 북미 위주의 내용을 다루어 국내 실정법을 다루는 것은 아니지만, 상용 사이트를 사용하는 과정에서 허가되지 않은 접근이나 허가되었다고 하더라도 그 상용 사이트의 운영에 방해되는 정도의 크롤링 작업이 법적으로 문제의 소지가 있음을 충분히 설명하여 만드는 방법만 중요한 것이 아니라 사용하는 방법도 신경 써야 함을 강조하고 있습니다. 특히 책에서 제시한 페이스북 무단 크롤링 사건 같은 경우 '빅 데이터는 싸지만, 변호사는 비싸다.'라는 개발자의 이야기가 법률적인 문제가 결코 작지 않음을 확 와닿게 해주는 표현이었습니다.

 

 

 

 

 

총평

 

파이썬을 잘 모르더라도 프로그래밍 경험이 있는 사람은 읽는데 문제없는 책

웹 크롤러 입문자부터 웹 크롤러 유경험자가 참고하기 좋은 책

 

파이썬을 이용해 웹 크롤러를 만들어보려는 입문자에게도 좋은 책이지만, 이미 경험이 있는 개발자에게도 옆에 두고 문제를 마주칠 때마다 읽을만한 참고서로 손색이 없을 정도로 많은 사람들에게 이 책이 분명히 유용한 책이 될 것입니다.

 

닫기

해당 상품을 장바구니에 담았습니다.이미 장바구니에 추가된 상품입니다.
장바구니로 이동하시겠습니까?