qorskawls***
2023-03-24

분석하려는 텍스트에 맞는 처리 기법을 소개하는 도서로 실제 모범 사례를 기반으로 상황에 맞게 설계한 텍스트 전처리 파이프라인 구축, N-그램 분석, 텍스트 벡터화 등 다양한 전략과 그때 필요한 파이썬 라이브러리를 소개한다.
"한빛미디어 <나는 리뷰어다> 활동을 위해서 책을 제공받아 작성된 서평입니다."
파이썬 라이브러리를 활용한 텍스트 분석
ChatGPT가 굉장히 많은 관심을 받고 있는데, 이러한 챗봇을 만들기 위해선 기본 텍스트 분석 역량이 필요하다. 나는 텍스트를 분석하는 것에 흥미를 매우 느끼고 있어서 이런 저런 분석들을 하고 있다. 복습도 하고 싶었고, 새로운 내용이 있다면 따로 기록하고 싶었다.
Pandas 라이브러리로 분석하는 기본 방법부터 시작한다. 열에 대한 요약 통계 계산, 시각화, 결측값 등을 말이다.
이후에는 정규 표현식을 이용해서 토큰화를 진행하고, 불용어처리도 진행한다. 여기서 활용되는 라이브러리는 spaCy와 nltk이다. spaCy를 활용한 경험이 없어도 이 교재를 통해서 쉽게 배울 수 있다.
또한, API로 데이터를 추출하는 방법을 알려준다. 본 교재는 트위터 API를 활용해서 데이터를 추출하는 방법을 알려준다. API뿐만 아니라, Selenium을 활용한 크롤링도 알려준다.
텍스트 분류, 감정 분석, 텍스트 요약 등에서 자주 사용되는 알고리즘과 잘 알려지지 않은 시각화 라이브러리를 알려준다. TF-IDF, LDA 등의 기본적인 알고리즘부터 LIME, ELI5 시각화 라이브러리도 알려준다. 책 후반에는 단어 임베딩으로 의미 관계를 탐색하는데 이는 seq2seq, transformer, bert를 이해하는 데 토대가 되기 때문에 굉장히 중요하다. 마지막 챕터는 지식 그래프 구축인데, 역시나 시각화 라이브러리를 알려준다.
총평
번역이 너무 잘되어 있다. 하지만, 책의 후반에는 오탈자가 가끔 보이긴 한다만, 이해하는데 어려운 부분은 없다.
교재의 코드가 Github와는 다르기 때문에 https://oreil.ly/btap-code 으로 필사하는 게 낫다.
기초로 다루기엔 충분한 교재이다. 수학적 수식이 많이 있지도 않아서 읽기 편했고 실습 위주로 되어 있어서 프로젝트에 바로 쓸 수 있다.
자연어처리에 필요한 라이브러리와 시각화를 위한 독특한 라이브러리를 알려준다.