ina9***
2023-03-22

분석하려는 텍스트에 맞는 처리 기법을 소개하는 도서로 실제 모범 사례를 기반으로 상황에 맞게 설계한 텍스트 전처리 파이프라인 구축, N-그램 분석, 텍스트 벡터화 등 다양한 전략과 그때 필요한 파이썬 라이브러리를 소개한다.
일단은 파이썬 초급자에게는 추천하지 않는다.
기본 파이썬 사용법을 익히고 나서 이 책을 심화과정으로 읽는것을 추천한다.
파이썬으로 헬로월드조차 찍어보지않았던 나에게는 정말 낯설었던 책이다.
일단 VSCode에서 파이썬을 여는것 부터가 우당탕탕 이었다.
파이썬을 하기위해 가상환경 설정도 알아야했고.. 등등등
이렇게 기본적으로 프로젝트 생성 및 인스톨에 대해서 이해하고 어느정도 코드를 짠 후에 이 책을 읽으면
많은 도움이 될 것같다.
파이썬을 처음 해보려고 이 책을 구매하게된다면... 파이썬과 더 멀어질 수도 있을 것같다.
왜냐면
import regex as re
def tokenize(text):
return re.findall(r'[\w-]*\p{L}[\w-]*', text)
text = "Let's defeat COVID together in 2023~!"
tokens = tokenize(text)
print("|".join(tokens))
이런 정규식 하나 쓰려는데도 일단은 파이썬 pip나 모듈 설정, 파이썬 터미널, 아나콘다에대해서 이해하고 사용해야 하기 때문!
근데 파이썬 사용법을 알고나면 점차적으로 사이드 프로젝트 할 때 유용하게 쓸 수 있을 책이다. 여러 라이브러리나 텍스트 추출시 사용할 수 있는 예제들을 많이 제공해주고 설명해주고 있는 책이기 때문이다.
"한빛미디어 <나는 리뷰어다> 활동을 위해서 책을 제공받아 작성된 서평입니다."