메뉴 바로가기 검색 및 카테고리 바로가기

한빛미디어

독자리뷰

[나는리뷰어다][일잘러의 비밀 챗GPT와 GPTs로 나만의 AI 챗봇 만들기]

usna***

|

2025-03-27

일잘러의 비밀, 챗GPT와 GPTs로 나만의 AI 챗봇 만들기

생성형 AI의 시대, 이제 당신 차례입니다! 테디노트와 AI 전문가가 알려주는 챗GPT 업무 활용법!

  • 저자 : 테디노트(이경록) , 김정욱
  • 출간 : 2025-02-10

"한빛미디어 서평단 <나는리뷰어다> 활동을 위해서 책을 협찬 받아 작성된 서평입니다."

 

이 책의 저자 두분의 유튜브에 들어가 봤다.

테디노트(이경록)님과 김정욱님 컨텐츠가 있어 김정욱님 컨텐츠에 이 책에 대한 예제가 많이 포함되어 있었다.

https://www.youtube.com/@cudanote

 

책에 있는 다양한 예제와 사례 중 데이터 분석에 관심이 있어 책의 내용과 유튜브를 바탕으로 해서 내용을 따라 연습해 보았다.
먼저 유튜브를 통해 책의 내용 중 책만 따라하면 어렵거나 잘 이해가 되지 않는 부분을 영상으로 만들어 놓아 도움이 많이 되었다. 

 

Chat GPT로 고급 데이터 분석을 하는 내용에 특히 관심이 많아 살펴 보았다.

이 연습을 위해 필요한 자료는 아래에서 다운로드가 가능했다.

https://aitown.notion.site/5-1-GPT-4-18e636ef5519803db510c2000d387ccd

 

한글이 깨지는 문제를 해결하기 위해 "koreanize-matplotlib" 을 설치한다.

https://pypi.org/project/koreanize-matplotlib/#files

이 부분에서 한글깨짐을 방지하기 위해 해당 파일을 다운로드 받아 "데이터 분석을 할 때 해당 파일을 라이브러리를 설치해 달라고 요청하고 이후 데이터 분석을 할 때 이 라이브러리를 사용하라고" 프롬프트를 입력하는 부분이 단순하면서도 이렇게 이용할 수도 있구나 하는 부분에 대해서 알게 되었다.

그리고 엑셀 데이터 샘플은 아래와 같이 생겼다.

지역/연령별 소비 및 금융자산 데이터 분석

기준년월, 연령대, 시도코드, 시도명, 총쇼핑평균금액, 마트소비평균금액 등 그리고 마지막으로 총여신평균잔액이 있는 표이다.

데이터는 120행까지 있어서 그렇게 큰 데이터는 아니지만 총여신평균잔액이 비어 있는 행도 있다.

 

위 각 테이블의 열에 있는 항목에 대해 각 항목의 내용 세부 내용을 GPT가 알려준다.

이어서 전처리를 요청하면 된다.

"데이터 성격을 파악해서 필요한 데이터 전처리를 추천해줘"라고 프롬프트를 입력하면 최적의 데이터 전처리를 추천해 준다.

결측치 처리

범주형 데이터 처리

이상 데이터 처리

등 적합한 데이터 전처리 데이터 추천해 주고 처리를 해 준다.

 

데이터 분석에서 생성형 AI를 이용한 전처리 방법에는 여러 가지가 있습니다. 다음은 몇 가지 예시와 함께 전처리 방법을 설명하겠습니다.

1. 데이터 정제 (Data Cleaning)​

결측치 처리:

생성형 AI를 사용하여 결측값을 예측하거나 대체할 수 있습니다. 예를 들어, 사용자가 제공한 데이터를 기반으로 AI가 적절한 값을 생성하도록 할 수 있습니다.

이상치 탐지:

생성형 AI 모델을 통해 이상치를 감지하고, 해당 데이터 포인트를 제거하거나 수정할 수 있습니다.

2. 데이터 변환 (Data Transformation)

텍스트 정제:

자연어 처리(NLP) 모델을 이용해 텍스트 데이터를 클리닝하고, 불용어 제거, 표제어 추출 등을 수행할 수 있습니다.

변수 인코딩:

범주형 변수를 수치형으로 변환할 때, 생성형 AI가 특정 범주를 자동으로 인식하고 적절한 인코딩 방식(예: 원-핫 인코딩)을 추천할 수 있습니다.

3. 데이터 증강 (Data Augmentation)

데이터 샘플 증대:

생성형 AI를 사용하여 기존의 데이터 샘플을 기반으로 추가적인 데이터를 생성함으로써 데이터셋의 크기를 늘릴 수 있습니다. 예를 들어, 이미지 데이터에서 회전, 변형 등의 방법으로 새로운 이미지를 만들어낼 수 있습니다.

4. 데이터 스케일링 (Data Scaling)

정규화 및 표준화:

AI 모델을 통해 각 변수의 분포를 분석하고, 적합한 스케일 방법(정규화와 표준화)을 추천받아 데이터를 처리할 수 있습니다.

5. 피처 엔지니어링 (Feature Engineering)

새로운 변수 생성:

기존 데이터를 분석한 후, 생성형 AI가 통계적 방법이나 도메인 지식을 가지ทรู하여 새로운 유의미한 변수를 자동으로 생성할 수 있습니다. 예를 들어, 날짜 데이터에서 요일, 월, 분기 등을 추출하는 과정입니다.

이러한 전처리 방법들은 데이터 분석의 정확성과 신뢰성을 높이는 데 큰 도움을 줄 수 있습니다. 각각의 사례에 대해 더 자세한 설명이 필요하시거나 특정한 방법에 대해 문의하시고 싶으시면 알려주세요!

출처 : GPT

 

드디어 데이터 분석을 GPT에 요청해 보자.

데이터 분석 기법에는 통계분석, 탐색적 데이터 분석, 머신러닝 모델링 등이 있다고 한다.

통계분석과 , 머신러닝 모델링은 사전 지식이 있어야 해석이 가능하기 때문에 책에서는 탐색적 데이터 분석을 요청하는 방법에 대해 설명하고 있다.

탐색적 데이터 분석에 대해서도 가능한 분석에 대해 모두 추천을 해 달라고 요청할 수 있다.

일반적인 탐색적 데이터 분석은 평균,표준편차, 중앙값 등 (기초 통계분석)를 이용한 방법, 시각화 등 다양한 방법,시계열 분석, 다변량 분석 등에 대해 알려준다.

필요한 탐색적 데이터 분석을 하나 하나 실행 해 보면서 그 결과를 보고 추가적인 내용을 요청할 수 있다.

탐색적 데이터 분석에 대한 설명을 GPT에 요청해 보았다.

 

데이터 분석에서 생성형 AI를 이용한 탐색적 분석(Exploratory Data Analysis, EDA)의 다양한 방법에 대해 설명하겠습니다. EDA는 데이터의 주요 특징을 이해하고, 패턴이나 관계를 찾는 과정으로, 생성형 AI는 이 과정을 보다 효율적이고 직관적으로 만들어 줄 수 있습니다.

1. 데이터 시각화 (Data Visualization)

자동 시각화 생성:

생성형 AI를 활용하여 데이터셋의 다양한 통계량을 기반으로 적절한 시각화를 자동으로 생성할 수 있습니다. 예를 들어, 특정 변수의 분포를 나타내는 히스토그램, 상관 관계를 보여주는 산점도 등을 생성할 수 있습니다.

주요 패턴 탐색:

AI가 데이터에서 주요 패턴이나 경향성을 시각적으로 표현하여 데이터의 복잡한 정보를 사용자에게 전달할 수 있게 합니다.

2. 데이터 분포 분석 (Distribution Analysis)

분포 예측:

생성형 AI 모델을 통해 특정 변수의 분포를 추정하고, 이를 바탕으로 필요 시 모수적 또는 비모수적 검정을 수행할 수 있습니다. AI가 제공하는 분포 정보는 데이터의 이상치나 결측치 탐지에 유용합니다.

클러스터링:

데이터의 자연스러운 그룹을 찾기 위해 AI 알고리즘을 통해 클러스터 분석을 수행하고, 각 클러스터의 특징을 설명할 수 있습니다.

3. 상관 관계 분석 (Correlation Analysis)

상관 행렬 생성:

생성형 AI를 사용하여 전 변수 간의 상관 관계를 분석하고, 상관 행렬을 자동으로 생성하여 시각화할 수 있습니다. 이를 통해 중요한 변수 간의 관계를 쉽게 파악할 수 있습니다.

의미 있는 피처 식별:

AI를 활용하여 타겟 변수와의 상관 관계가 높은 피처를 자동으로 식별하고, 이러한 정보를 바탕으로 후속 분석을 위한 주요 변수를 선택할 수 있습니다.

4. 텍스트 데이터 분석 (Text Data Analysis)

주제 모델링:

자연어 처리(NLP) 기법을 활용하여 대량의 텍스트 데이터에서 주제를 추출하고, 각 주제에 대한 키워드와 관련된 정보를 시각화할 수 있습니다.

감정 분석:

AI 모델을 통해 텍스트 데이터의 감정을 분석하고, 감정 분포를 시각적으로 표현하여 긍정적/부정적 경향을 식별할 수 있습니다.

5. AI 기반 인사이트 도출 (Insight Generation)

자동 인사이트 생성:

데이터셋에서 패턴을 분석하고 생성형 AI가 중요한 인사이트를 자동으로 도출해 내, 데이터에 대한 이해도를 높일 수 있습니다.

예를 들어, "이 변수의 변화가 Y 변수에 미치는 영향이 상당히 크다"와 같은 피드백을 제공할 수 있습니다.

이러한 탐색적 분석 방법들은 데이터에 대한 직관적 이해를 증진하고, 데이터 분석의 다음 단계로 나아가는 데 도움을 줄 수 있습니다. 각 방법에 대해 더 궁금한 점이 있으시면 말씀해 주세요!

출처  :GPT

탐색적 데이터 분석을 할 때 시각화를 해 주는 부분이 가장 인상적이었다. 파이썬을 배워서 시각화를 하려면 상단히 많은 내용에 대한 파이썬 시각화 라이브러리와 방법을 알아야 하지만 생성형 AI, GPT를 이용하면 이 시각화를 프롬프트 하나로 해 주는 부분이 인상적이다. 물론 원하는 대로 내가 생각하는 방향을 그때 그때 시각화를 하려면 Python라이브러리를 이용해서 전처리를 하고 시각화를 해야 하지만 그럴 시간이 없고 빠르게 뭔가를 해보려고 할 때 GPT를 이용한 데이터 분석도 유용한 방법이라는 생각이 든다.

GPT를 이용해서 웹 크롤링을 하는 프로젝트도 따라해보면서 내가 원하는 크롤링을 해서 엑셀로 정리해보려고 시도를 했다. 이 과정에서 몇가지 잘 되지 않는 부분도 있어서 사실 GPT를 잘 사용하려면 기본적으로 크롤링을 하기 위한 기본적인 Html구분에 대한 정보가 있으면 도움이 될 듯 하다.

GPT나 생성형 AI모델을 를 이용하기 위해서는 그 전에 배경 지식이나 기본 원리등을 알고나서 이용하는 것이 도구의 도움을 극대화 할 수 있는 방법이라는 생각이 든다.

지금은 하나의 툴을 공부하는 것도 중요하지만 그 기본에 대한 원리도 함께 공부해야 한다는 생각이 들어서 툴 공부와 함께 그 기본 원리에 대한 공부도 함께 하고 있다.

닫기

해당 상품을 장바구니에 담았습니다.이미 장바구니에 추가된 상품입니다.
장바구니로 이동하시겠습니까?