빅데이터에 대한 관심이 높다.
처음부터 원하는 데이터를 확보할 수 있으면 좋겠지만 그런 행운을 얻기란 쉽지 않다.
여러가지 데이터 유형 중 가장 쉽고(?) 간편하게 얻을 수 있는 데이터는 ‘텍스트'이다.
이 책 ‘파이썬 라이브러리를 활용한 텍스트 분석'은 텍스트 데이터와 관련있는 모든 프로세스를 설명하고 있다.
데이터 수집을 위한 웹사이트 스크래핑부터 시작해서 데이터 가공에 해당하는 전처리는 물론이고 그것을 활용한 분석 결과까지 보여주고 있다.
심지어 비지도 학습을 통해 모델링까지 만들 수 있다.
여기에 활용되는 라이브러리는 모두 파이썬으로 이루어져 있다.
데이터 분석을 위해 파이썬만 사용되는 것은 아니지만, 왜 파이썬을 데이터 분석에서 많이 사용하는지를 알 수 있었다.
아직 파이썬을 자유자재로 쓸 수 있는 것은 아니지만 이 책을 보면서 파이썬의 강력함과 다양성에 다시 감탄하고 있다.
‘영어'위주의 내용이라 ‘한글'을 적용하기에는 조금은 다른 방법을 찾아봐야 한다는 것이 아쉬웠다.
자연어 처리가 결코 그리 녹녹치 않음을 다시 한번 느낀다.
그럼에도 ‘텍스트 분석'에 대한 전반적인 과정을 모두 경험해 볼 수 있어서 좋다.
머신러닝도 그 과정 중 일부이기에 함께 공부할 수 있다.
이 책을 가이드 삼아 각 단계별로 심화 학습을 하면 좋을 것 같다.
[한빛미디어 <나는 리뷰어다> 활동을 위해서 책을 제공받아 작성된 서평입니다.]