cjdf***
2022-11-21

분석하려는 텍스트에 맞는 처리 기법을 소개하는 도서로 실제 모범 사례를 기반으로 상황에 맞게 설계한 텍스트 전처리 파이프라인 구축, N-그램 분석, 텍스트 벡터화 등 다양한 전략과 그때 필요한 파이썬 라이브러리를 소개한다.
사실 이 책의 내용을 읽기 전까진 이 책이 '파이썬을 이용한 텍스트 데이터 전처리'에 관한 내용을 다룬 줄 알았다. 그러나 책의 내용을 펼쳐보니 python을 이용하여 텍스트 분석을 어떻게 할 지에 대해 다양한 사례를 들며 소개하고 있었다. 물론 이 책에는 텍스트 데이터를 전처리하는 내용도 들어있고, 어떤 식으로 데이터를 추출하고 저장할지에 대한 내용도 상세하게 담겨 있다!
이 책은 python을 이용한다는 것을 전제로 하고 있기에, 기본적으로 언어에 대한 이해는 있어야 한다. 또한, 영어 데이터를 다루고 있기에 한국어 데이터 예시를 찾고자 하는 분들께는 그다지 적합하지는 않다. 이 책에서도 소개하는 추천 독자는,
샘플 결과를 빠르게 만들어 프로젝트의 성공 가능성을 검토하려는 독자
문제를 풀기 위한 베이스라인(머신러닝 모델이 넘어야 하는 최소한의 성능)을 빠르게 작성해야 하는 독자
로 나와 있다. 그렇기에 기초 내용을 다루고 있다기 보다는 응용과 관련한 내용을 읽고 싶은 분들께 추천한다.
이 책은 개념의 원리를 깊게 다루지는 않지만, 두루두루 넓게 어떤 식으로 활용할 수 있는지를 세세하게 알려주고 있기 때문에 특정 task를 어떤 식으로 접근하면 좋을지에 대한 조언을 얻어갈 수 있을 것이다.
* "한빛미디어 <나는 리뷰어다> 활동을 위해서 책을 제공받아 작성된 서평입니다."