데이터 엔지니어라면 꼭 가지고 있으면 좋은 책입니다!
엄청 자세한 내용을 담고 있습니다
하둡의 개념 설명 ( 역사, 맵리듀스, HDFS )부터 확장해서 YARN, 플룸, 스파크 등의 내용까지 담고 있습니다
이 책의 장점은
- 자세한 설명
- 실제 사례 포함 ( 유전 데이터를 활용한 사례 )
- 추가로 볼 자료 제공(스파크의 경우 참고 도서가 적혀있습니다)
입니다-!
단점은 책이 너무 두꺼운 점..?
가격이 생각보다 높다는 점 정도를 들 수 있겟네요
저는 특히 아래의 부분들이 마음에 들었습니다
CHAPTER 19 스파크
19.1 스파크 설치
19.2 예제
19.3 탄력적인 분산 데이터셋 RDD
19.4 공유변수
19.5 스파크 잡 수행 분석
19.6 익스큐터와 클러스터 매니저
19.7 참고 도서
★★★ Part 5 사례 연구 ★★★
CHAPTER 22 서너의 구조적 데이터
22.1 CPU에서 시맨틱 통합까지
22.2 아파치 크런치의 도입
22.3 완전한 설계도의 제작
22.4 헬스케어 데이터 통합
22.5 프레임워크를 뛰어넘는 결합성
22.6 발전 방향
CHAPTER 23 생물학의 데이터 과학: 소프트웨어로 생명 구하기
23.1 DNA 구조
23.2 유전 암호: DNA 글자의 단백질 전환
23.3 DNA를 소스 코드처럼 생각하기
23.4 인간 게놈 프로젝트와 표준 게놈
23.5 DNA 시퀀싱과 얼라이닝
23.6 대규모 게놈 분석 플랫폼 ADAM
23.7 개인맞춤광고에서 개인맞춤의학까지
23.8 참여하기