dong2***
2023-10-28

현시대는 쳇GPT와 스테이블 디퓨전에서 시작된 생성 AI의 열풍이 정말 뜨겁습니다. 생성 AI는 우리 시대의 매우 혁신적인 기술로, 우리가 기계와 상호작용하는 방식을 변화시키고 있습니다. 우리가 생활하고 일하고 노는 방식을 혁신할 수 있는 이 기술의 잠재력은 수많은 대화와 토론, 그리고 많은 추측을 양산했습니다. 이 기술은 인간의 언어, 예술, 창의성을 비추는 거울이 되어 인간이 창조한 것뿐만 아니라 인간이 창조할 수 있는 것을 반영함으로써 새로운 지능의 시대가 시작되고 있음을 상기시킵니다. 생성 AI란 대화, 이야기, 이미지, 동영상, 음악 등 새로운 콘텐츠와 아이디어를 만들 수 있는 인공 지능의 일종입니다. 모든 인공 지능과 마찬가지로 생성 AI는 기계 학습 모델, 즉 방대한 양의 데이터로 사전 훈련되며 일반적으로 파운데이션 모델(FM)이라고 불리는 대규모 모델을 기반으로 구동되며 콘텐츠 제작 외에 디지털 이미지의 품질을 개선하고, 동영상을 편집하며, 제조용 프로토타입을 빠르게 제작하고, 가상 데이터 세트로 데이터를 보강하는 등의 작업에도 사용되는 기술입니다.
제가 이 책을 선택한 이유는 이 책이 생성 모델링용 딥러닝 도구를 소개하는 책으로써 능숙한 기본 개념과 최신 생성 AI의 중요한 기술을 모두 설명하며 생성 모델링을 알아보고 혁신적인 기술을 직접 활용하는 방법을 완벽하게 알려주기 때문입니다.
이 책의 특성은 모델 이면의 중요한 이론, 높은 가독성과 실용적인 예제 코드, 직관적인 시각 자료 및 설명과 연습 문제를 풍부하게 제공하며 영리한 비유가 담겨있어 복잡한 개념을 명확하고 간결하게 설명하면서도 기술적 세부 사항을 간과하지 않으면서 잠재적인 위험도 함께 설명한다는 점입니다. 이 책은 모든 핵심 개념을 직관적이고 따라 하기 쉬운 방식으로 처음부터 차근차근 설명하고 관련된 주요 논문의 모델을 모두 다뤄 각 기술을 뒷받침하는 이론을 코드로 어떻게 구현하는지 명확하게 설명하며 단계별로 하나씩 코드를 살펴볼 수 있습니다.
구성
PART 1: 생성 딥러닝 소개
Chapter 1: 생성 모델링
Chapter 2: 딥러닝
PART 2: 6가지 생성 모델링 방식
Chapter 3: 변이형 오토인코더
Chapter 4: 생성적 적대 신경망
Chapter 5: 자기회귀 모델
Chapter 6: 노멀라이징 플로 모델
Chapter 7: 에너지 기반 모델
Chapter 8: 확산 모델
PART 3: 생성 모델링의 응용 분야
Chapter 9: 트랜스포머
Chapter 10: 고급 GAN
Chapter 11: 음악 생성
Chapter 12: 월드 모델
Chapter 13: 멀티모달 모델
Chapter 14: 결론
파트별로 나누어 봤을때 책에서 나온 대로 1부에서는 생성 모델링과 딥러닝에 대한 일반적인 소개로 후반부에 나오는 모든 기법의 기반이 되는 핵심 개념을 살펴보는 것으로 1~2장은 생성 모델링을 정의하고 간단한 예제를 활용해 모든 생성 모델에서 중요한 몇가지 핵심 개념과 2부에서 살펴볼 생성 모델의 분류 체계와 케라스를 사용해 다층 퍼셉트론(MLP) 예제를 만들면서 딥러닝과 신경망 탐구를 시작해서 합성곱 층과 다른 개선사항을 적용하여 성능의 차이를 비교하는 방법에 대해, 2부는 생성 모델를 구축하는데 사용할 여섯가지 핵심 기법을 실제 예제와 함께 살펴보는 것으로 3~8장은 변이형 오토인코더(VAE)를 살펴보고 이를 사용하여 얼굴 이미지를 생성 후 모델의 잠재 공간에서 두 얼굴 사이를 전환하는 방법, 이미지 생성을 위한 생성적 적대 신경망(GAN)을 살펴보고 심층 합성곱GAN, 조건부 GAN, 그리고 훈련 과정을 더욱 안정적으로 만들어 주는 와서스테인GAN과 같은 개선사항, 텍스트 생성을 위한 LSTM과 같은 순환 신경망과 이미지 생성을 위한 PixelCNN 같은 자기회귀 모델, 노멀라이징 플로 기법의 이론과 이미지 생성을 위한 RealNVP모델, 에너지 기반 모델을 다루며 대조 발산을 사용해 훈련하는 방법과 랑주뱅 역학을 사용하여 샘플링하는 방법, E2 및 스테이블 디퓨전과 같은 많은 최신 이미지 생성 모델을 탄생시킨 확산 모델을 구축하는데 필요한 실용적인 가이드에 대해, 3부는 지금까지의 기술을 기반으로 이미지 생성, 글쓰기, 음악 작곡, 모델 기반 강화 학습을 위한 최신 모델의 작동 방식을 설명하는 것으로 9~14장은 트랜스포머 구조를 알아보고 텍스트 생성을 위한 GPT 모델을 만드는 실용적인 방법, VQ-GAN과 같은 이미지 생성을 위한 최신 GAN, 트랜스포머 및 MuseGAN과 같은 기법을 적용하는 음악 생성, 월드 모델과 트랜스포머 기반 방법을 적용하여 생성 모델을 강화 학습에 사용하는 방법, 텍스트 투 이미지 생성을 위한 E2, Imagen, 스테이블 디퓨전과 시각 전용 모델인 플라밍고 등 두 가지 이상의 데이터 유형을 통합하는 4가지 최신 멀티모달 모델의 내부 작동 방식, 향후 생성 AI가 우리의 일상을 어떻게 혁신할지에 대해 설명하고 있습니다.
개인적인 생각으로 학습은 머신러닝 엔지니어 및 연구자, AI 개발자, 애플리케이션 개발자, DevOps 엔지니어로 취업 및 이직을 희망하시는 분들께서는 우선 파이썬 프로그래밍과 선형 대수학, 일반 확률 이론, 텐서플로와 케라스, 핸즈온에 대해 학습하신 다음에 1장부터 시작하시면 좋을 것 같고 어느정도 경험이 있으신 분들(머신러닝 엔지니어 및 연구자 2년차~ 또는 개발자 2년차~)부터는 2장까지는 쭉 훓으시면서 생성 모델링과 텐서플로, 케라스를 생성 AI에 접목시키는 방법에 대해 파악한다는 방식으로 보시고 3장부터 학습하시는 것이 좋을것 같습니다.
개인적으로 약간의 단점이 어쩌면 욕심일수도 있는게 좀더 많은 실습 예제 및 비즈니스 케이스가 담겨있으면 더 좋았지 않았을까라는 아쉬움이 있습니다.
저의 리뷰를 읽어주셔서 감사합니다. 다음에는 좀더 유용하고 좋은 책으로 더 나은 리뷰를 통해 여러분께 책을 소개시켜드릴 수 있도록 더 노력하겠습니다.
감사합니다.
"한빛미디어 <나는 리뷰어다> 활동을 위해서 책을 제공받아 작성된 서평입니다."