메뉴 바로가기 검색 및 카테고리 바로가기

한빛미디어

독자리뷰

이미지, 텍스트, 음악 데이터를 이용해서 이미지, 텍스트, 음악 를 생성해주는 생성AI 에 대한 기본 개념을 이해하는 책이다

byc3***

|

2023-10-29

만들면서 배우는 생성 AI

진화와 혁신의 경계를 넘는 생성 AI 완벽 가이드

  • 저자 : 데이비드 포스터
  • 번역 : 박해선
  • 출간 : 2023-09-15

 

[나의 한줄 추천사]

- 이미지, 텍스트, 음악 데이터를 이용해서 이미지, 텍스트, 음악 를 생성해주는 생성AI 에 대한 기본 개념을 이해하는 책이다.

[책 추천 이유]

- 왜 똑같은 데이터를 넣고 똑같은 데이터를 만들어 내는게 무엇인 중요한가? 한때 오토인코더 모델을 보았을때 생각한 적이 있었다. 오토인코더 모델이 엄청나게 중요한게 인코더를 통해서 입력한 피처 데이터를 잠재공간으로 임베딩 시켜서 새로운 변환을 만들어낸 것이었으며, 디코더는 잠재공간에서 다시 원본 피처들을 복원하는 과정을 걸쳐서 새로운 형태의 데이터를 뽑아 낼 수 있다는 사실을 깨달았다. 단순하게 원본 데이터를 그대로 만들어 내는 것은 의미가 없지만, 원본 데이터의 특징을 뽑아낸 잠재공간의 임베딩 모델을 가지고 원본을 만들어 내는 일은 완전히 다른 의미였던 것이다. 이 부분에 대한 궁금증을 이책에서 이미지, 텍스트, 음악 데이터를 통한 생성 AI 로 천천히 이해하기 쉽게 풀어서 설명해 준다..

[내가 찾고자 했던 질문들]

  1. 이미지의 생성 모델은 어떻게 있는가?

    1. 변이형 오토인코더(VAE) : 고차원 입력 데이터를 저차원 임베딩 벡터로 압축하고 압축 해제 시켜서 이미지를 생성한다.

    2. GAN : 생성자와 판별자 두 적대자의 싸움형태로 이미지를 판별후 생성한다.

    3. 자기회귀모델 : 잠재 확률 변수가 아닌 시퀀스에 있는 이전값을 바탕으로 텍스트 (LSTM), 이미지 (PixelCNN)를 생성한다.

    4. 노멀라이징 플로 모델(RealNVP) : 다루기 쉽고 명시적인 데이터 생성분포 모델링할 수 있는데, 맵핑함수의 형태에 제약을 두는 점이 차이점이다.

    5. 에너지기반 모델(EBM) : 물리시스템 모델링의 실수값 0 ~ 1사이로 정규화 함수인 볼츠만 분포에 어떤 이벤트의 확률을 표현할수 할수 있다.

    6. 확산(Diffusion) 모델 : 확산(Diffusion) 열역학 확산의 영감을 받아 연속해서 매우 조금씩 이미지에서 잡음을 제거하여 모델을 훈련시켜서 이미지를 생성시킨다.

  2. 텍스트의 생성 모델은 어떻게 있는가?

    1. GPT : 트랜스포퍼의 디코더 부분을 이용하였으며, temperature 이용해서 0~1 사이 조정하여 0일때는 정확한 답을 생성하는 형태로하며, 좀더 다양한 창의적 답변을 만들때는 1에 가깝게 조정해준다.

  3. 음악(Music) 생성 모델은 어떻게 있는가?

    1. MuseGAN : 트랜스포터의 디코더 부분을 이용하였으며, midi 파일을 input 으로하여 시퀀스를 에측하는 형태의 음악을 생성한다.

4. 추가적인 소스자료를 구하고 싶다면?

-> https://github.com/rickiepark/Generative_Deep_Learning_2nd_Edition

"한빛미디어 <나는 리뷰어다> 활동을 위해서 책을 제공받아 작성된 서평입니다."

#생성AI

#만들면서배우는생성AI

#파이썬

#오레일리

닫기

해당 상품을 장바구니에 담았습니다.이미 장바구니에 추가된 상품입니다.
장바구니로 이동하시겠습니까?