메뉴 바로가기 검색 및 카테고리 바로가기

한빛미디어

독자리뷰

서비스 관점에서 보는 LLM 최적화 전략

dhan***

|

2025-05-30

LLM 서비스 설계와 최적화

생성형 AI의 경쟁력을 높이는 LLM 최적화 전략

  • 저자 : 슈레야스 수브라마니암
  • 번역 : 김현준 , 박은주
  • 출간 : 2025-04-10

"한빛미디어 서평단 <나는리뷰어다> 활동을 위해 책을 협찬 받아 작성된 서평입니다."


서비스 관점에서 보는 LLM 최적화 전략



생성형 AI, 특히 LLM이나 SLM을 활용한 애플리케이션 개발을 다루는 책이 넘쳐나는 요즘이다. OpenAI/Gemini API 활용, 프롬프트 엔지니어링, 랭체인, RAG, AI 에이전트를 다루는 책은 많지만, 우리의 최종 목표는 개발한 애플리케이션을 제품화하여 서비스하는 것이다. 그런데 대다수 도서들의 개발 환경은 코랩이다. 제한된 인프라 환경에서 애플리케이션을 개발하면서도 성능과 관련된 고민이 계속 머릿속을 맴돌고 있었다.

  • GPU의 메모리와 물리적 메모리는 얼마나 준비해야 할까?
  • CPU 환경에서도 구동이 가능할까?
  • 임베딩 속도가 너무 느린데, 대안은 뭐가 있을까?
  • 벡터 데이터베이스는 어떤 것을 선택해야 할까?
  • 프롬프트 엔지니어링은 어떻게 최적화할까?

이 책을 선택한 이유는 "비용을 낮추고 성능은 극대화하는 AI 서비스 구축과 운영 가이드"라는 부제에서 찾아볼 수 있었다. 이 책의 내용이 위 질문들의 해답을 어느 정도 제시해 줄 실마리가 보였기 때문이다.

 

[추천 독자]

- 생성형 AI 서비스를 준비하는 담당자

- 생성형 AI 기반 애플리케이션 입문자 및 개발자

- 생성형 AI 기반 솔루션 개발자

- LLMOps를 담당하는 SW 엔지니어

 

[키워드]

#LLM #SLM #RAG #생성형AI #벡터데이터베이스 #파인튜닝 #추론 #프롬프트엔지니어링 #벡터스토어 #캐싱 #제미나이 #KV캐싱 #LLMOps #TensorRT #GPU가속도구 #CPU가속도구 #TensorRT #모니터링 #옵저버빌리티 #Mistral #양자화 #PEFT #LoRA #Prometheus #Orca #Phi #Gemini

 

[특징]

- 비용관점에서 LLM의 주요 계층인 인프라, 모델, 애플리케이션, 벡터 데이터베이스등 전반적인 서비스의 최적화 방안을 소개한다.

- 다양한 논문의 소개와 함께 논문의 내용에 담긴 인사이트를 설명한다.

- 서비스 시나리오와 워크 플로우를 시퀀스다이어그램 형태로 이해하기 쉽게 설명한다.

- 비용과 성능의 두 가지 관점을 자세히 설명하고, 도메인이 맞게 독자들이 선택할 수 있도록 해결법을 제시한다.

- 생성형 AI 도입을 위한 팀 구성과 최신 트렌드(MOE, 멀티모달, 에이전트)를 소개한다.

 

[책의 구성]

이 책은 전체 6개 장으로 구성되어 있다.

CHAPTER 1 "LLM 기초"에서는 LLM의 역사, 생성형 AI와 LLM의 차이, 생성형 AI 애플리케이션의 3계층(인프라, 모델, 애플리케이션), LLM 기반 애플리케이션 시퀀스 다이어그램, 성능 측정시 고려해야 할 요소들을 설명한다.

<1장 LLM기초 - 언어 모델의 진화 나무, p26~p27>

 

CHAPTER 2 "비용 최적화를 위한 튜닝 기법"에서는 모델의 파인튜닝 방법 및 파인 튜닝 비용 과 성능의 상관 관계를 설명하고

<2장 비용 최적화를 위한 튜닝 기법 - Falcon 40B 모델의 전체 및 양자화 버전과 전체 훈련 및 LoRA 기반 훈련을 위한 여러 GPU간 비교,  p86~p87>

 

CHAPTER 3 "비용 최적화를 위한 추론 테크닉"에서는 프롬프트 엔지니어링, 벡터스토어, 캐싱전략, 배치 프롬프트, 모델 최적화 등 추론 관점에서 비용 최적화를 설명한다.

<3장 비용 최적화를 위한 추론 테크닉 - 긴 문서를 위한 병렬 처리 시퀀스 다이어그램, p124~p125>

 

CHAPTER 4 "모델 선택과 대안"에서는 LLM 서비스에서 효율적인 소형 모델 활용법과 성공적인 사례를 설명하고

<4장 모델 선택과 대안, 다양한 모델의 훈련하는 데 필요한 컴퓨팅 용량, p180~p181>

 

CHAPTER 5 "인프라 및 배포 튜닝 전략"에서는 LLM 서비스를 위한 최적화된 하드웨어 활용법을 설명한다.

<5장 인프라 및 배포 튜닝 전략 - LLMOps의 단계, p252~p253>
 

CHAPTER 6 "성공적인 생성형 AI 도입의 열쇠"에서는 비용 최적화를 위한 주의 사항과 생셩형 AI 개발을 위한 이상적인 팀 구조, MOE/멀티모달/에이전트와 같은 미래 트렌드를 살펴본다.

<6장 성공적인 생성형 AI 도입의 열쇠 - 생성형 AI 초기 팀 구성, p266~p277>
 

[소감] 

- 생성형 AI 애플리케이션 개발을 넘어 인프라와 파인튜닝을 포함한 모델, 애플리케이션의 최적화 방안 등 다양한 통찰력과 전략을 배울 수 있었다.

- 최적화를 위한 비용 측정 방법과 평가 방법, 인프라 리소스 측정 방법, 클라우드 비용 계산법을 알게 되었다.

- 미처 생각하지 못했던 벡터 데이터베이스 및 프롬프트 엔지니어링 최적화 방법을 알게 되었다.

- 시퀀스 다이어그램을 활용해 워크플로우를 효과적으로 설명하는 방법을 터득할 수 있었다.

- 비용과 성능의 균형을 고려한 해결책을 도출하는 방법을 배웠고, 이는 앞으로의 프로젝트에도 큰 도움이 될 것 같다.

 

[추천]

생성형 AI 애플리케이션을 개발 중이거나 AI 서비스 도입을 고려 중이라면, 이 책을 통해 놓치기 쉬운 다양한 관점과 전략을 발견할 수 있을 것입니다.

닫기

해당 상품을 장바구니에 담았습니다.이미 장바구니에 추가된 상품입니다.
장바구니로 이동하시겠습니까?