메뉴 바로가기 검색 및 카테고리 바로가기

한빛미디어

독자리뷰

웹 스크레이핑 기술 알아야 한다, [파이썬으로 웹 크롤러 만들기]

qorskawls***

|

2025-03-26

파이썬으로 웹 크롤러 만들기(3판)

다양한 웹에서 효율적으로 데이터를 수집하는 방법 A to Z

  • 저자 : 라이언 미첼
  • 번역 : 최경현
  • 출간 : 2025-01-31

처음 이 책을 펼쳤을 때는 그냥 파이썬으로 데이터를 긁어오는 방법만 간단히 알려주는 줄 알았다. 그런데 막상 읽어보니 꽤 체계적으로 구성되어 있어서 놀랐다. 책은 크게 두 파트로 나뉘는데, 앞부분은 웹이 어떻게 작동하는지, HTML이 뭔지, 웹에서 데이터를 가져올 때 어떤 식으로 접근해야 하는지를 친절하게 설명해준다. 특히, 스크레이핑이 불법인가요? 같은 질문에 대한 윤리적인 이야기까지 담겨 있어서 흥미로웠다.

중간부터는 본격적으로 코드를 짜면서 웹 페이지에서 필요한 데이터를 추출하는 실습이 이어진다. 예를 들어, BeautifulSoup을 써서 뉴스 기사 제목을 가져오거나, 셀레니움을 활용해서 자바스크립트로 만들어진 페이지에서 데이터를 긁어오는 식이다. 뒤로 갈수록 API를 통한 데이터 수집, 이미지에서 글자 인식하기(OCR), 크롤링 방지 우회 같은 고급 주제까지 다뤄서 꽤 실전적이다.

 

나는 웹 크롤링을 처음 공부해보는 입장이었는데, 이 책은 기초부터 차근차근 쌓아가게 도와줘서 입문자에게 좋다고 느꼈다. 특히 ‘코드를 그냥 따라 치는 게 아니라, 왜 이렇게 쓰는지’를 설명해줘서 이해하는 데 도움이 됐다.

물론 파이썬 기초는 어느 정도 알고 있어야 따라가기 수월하고, 셀레니움이나 API 부분은 처음 보면 조금 헷갈릴 수도 있다. 하지만 예제가 워낙 잘 돼 있어서 몇 번 돌려보면 감이 온다.

개인적으로는 그냥 웹 페이지를 보기만 했던 내가, 그 안에서 데이터를 직접 가져오고 자동화까지 할 수 있게 된 게 신기했다. 실제 졸업작품이나 데이터 수집할 때도 쓸 수 있을 것 같아서 꽤 유용했다.

닫기

해당 상품을 장바구니에 담았습니다.이미 장바구니에 추가된 상품입니다.
장바구니로 이동하시겠습니까?