알라딘

대량의 데이터셋을 가지고 스파크 2를 활용해 복잡한 분석과 머신러닝 학습을 실제로 해보는 생생한 느낌을 전달한다. 단순히 모델을 구축하고 평가하는 데 그치지 않고, 데이터 정제부터 전처리, 데이터 조사, 실제 제품을 만들기까지의 전체 파이프라인을 보여준다. 이러한 과정을 다양한 분야에서 가져온 현실 예제에 맞게 교차 최소 제곱 추천 알고리즘, 의사 결정 나무, K-평균 군집화, 숨은 의미 분석, 세션화, 몬테카를로 시뮬레이션 등의 기법을 동원해 풀어본다.

1판이 출간된 이후 스파크의 메이저 버전이 올라가면서 완전히 새로운 핵심 API가 도입되고 MLlib이나 Spark SQL과 같은 하위 컴포넌트들도 크게 바뀌었다. 이러한 변화들이 반영되다 보니, 이 책 초판의 많은 부분이 의미가 없게 되었다. 이번 2판은 새로운 스파크 API를 사용하기 위해서 모든 장을 수정하였다.

1장. 빅데이터 분석하기
1.1 데이터 과학의 어려움
1.2 아파치 스파크란
1.3 이 책에 관하여
1.4 2판에 관하여

2장. 스칼라와 스파크를 활용한 데이터 분석
2.1 데이터 과학자를 위한 스칼라
2.2 스파크 프로그래밍 모델
2.3 레코드 링크
2.4 스파크 셸과 SparkContext 시작하기
2.5 클러스터에서 클라이언트로 데이터 가져오기
2.6 클라이언트에서 클러스터로 코드 보내기
2.7 RDD에서 Data Frame으로
2.8 DataFrame API로 데이터 분석하기
2.9 데이터프레임에 대한 빠른 요약 통계
2.10 데이터프레임의 축 회전과 형태변환
2.11 데이터프레임을 결합하고 특징 선택하기
2.12 실제 환경을 위한 모델 준비하기
2.13 모델 평가

더보기

마테이 자하리아 (스파크 창시자, 『러닝 스파크』 저자)

: 버클리에서 스파크 프로젝트를 시작한 이래로, 나는 단순히 빠른 병렬 시스템을 구축한다는 사실보다는 점점 더 많은 사람이 대규모 컴퓨팅을 사용할 수 있게 돕는다는 점에 흥분해왔다. 데이터 과학 전문가 네 명이 스파크 기반의 고급 분석에 대해서 쓴 이 책을 읽는 것이 즐거운 이유가 바로 여기에 있다. 샌디, 유리, 션 그리고 조시는 오랫동안 스파크로 작업해왔으며, 그만큼 충실한 설명과 예제를 이 책에 담아냈다.

이 책에서 가장 마음에 드는 부분은 실제 응용 사례와 현실 세계의 데이터셋을 가져와 예제 중심으로 설명한 점이다. 독자의 PC에서 직접 실행해볼 수 있는 아홉 가지 개별 빅데이터 예제를 제공한 책은 흔치 않은데, 저자들은 이런 예제들을 모아서 스파크로 실습할 수 있도록 모든 것을 세팅해두었다. 게다가 핵심 알고리즘만 다룬 것이 아니라, 정말로 좋은 결과를 얻는 데 필요한 데이터 준비와 모듈 튜닝의 복잡한 사항까지 다루고 있다. 독자는 이 예제들에서 터득한 개념을 자신의 문제를 푸는 데 곧바로 적용할 수 있을 것이다.

오늘날 빅데이터 처리는 의심할 여지 없이 컴퓨터로 할 수 있는 가장 흥미로운 분야이며, 빠르게 진화하고 새로운 아이디어들이 도입되는 분야이기도 하다. 나는 독자들이 이 흥미로운 새로운 분야로 들어서는 데 이 책이 도움이 될 거라 기대한다.

이상훈 (한국 스파크 사용자 모임 운영자, 『실시간 분석의 모든 것』 역자)

: 아파치 스파크는 빅데이터 영역에서 가장 핫한 기술로, 범용적이면서 빠른 대용량 분산 처리를 지원한다. 또한 기초 데이터 분석부터 머신러닝 등의 기능까지 지원하게 되면서 개발자만의 오픈 소스에서 분석가를 위한 오픈 소스로 주목받고 있다. 이 책은 가장 실용적인 데이터를 가져와 스파크로 빅데이터를 분석하는 다양한 방법을 설명한다. 빅데이터에 관심 있거나 관련 분야에 종사하는 개발자와 분석가 모두에게 추천한다.

최홍용 (현대오토에버)

다른 추천도서 보기

: 교통, 금융 분야 등의 실제 데이터로 데이터 획득, 전처리, 가중치 결정, 실행, 평가 그리고 시각화까지 해볼 수 있는 스파크 활용서다. 스파크 입문을 넘어 실무에 적용하려 할 때 좋은 참고서다. 자신의 관심 도메인에 맞는 부분만 찾아서 읽어도 좋을 것 같다.

지은이 : 샌디 라이자 (Sandy Ryza)

최근작 :	<9가지 사례로 익히는 고급 스파크 분석> … 총 7종 (모두보기)
소개 :	클라우데라의 선임 데이터 과학자이자 아파치 스파크 프로젝트의 활동적인 컨트리뷰터다. 최근에 클라우데라에서 스파크 개발을 이끌었으며 지금은 고객들이 스파크를 사용해 다양한 형태의 분석을 구현하는 데 도움을 주고 있다. 또한 하둡 프로젝트의 관리 위원회 멤버이기도 하다.

지은이 : 유리 레이저슨 (Uri Laserson)

최근작 :

<9가지 사례로 익히는 고급 스파크 분석> … 총 8종 (모두보기)

소개 :

클라우데라의 선임 데이터 과학자이며, 하둡 생태계에서의 파이썬 활용에 주력하고 있다. 또한 고객들이 다양한 문제에 하둡을 사용할 수 있도록 지원하고 있는데, 특히 생명 과학과 헬스 케어에 집중하고 있다. 이전에는 MIT에서 생의공학(biomedical engineering) 박사 과정 중에 Good Start Genetics라는 차세대 검진 회사를 공동 창업했다.

지은이 : 조시 윌스 (Josh Wills)

최근작 :

<9가지 사례로 익히는 고급 스파크 분석> … 총 6종 (모두보기)

소개 :

슬랙(Slack) 데이터 엔지니어링팀의 디렉터다. 전에는 클라우데라의 데이터 과학팀의 선임 디렉터로써 고객들과 함께 다양한 업계의 하둡 기반 솔루션을 개발했다. 자바로 최적화된 맵리듀스와 스파크 파이프라인을 만드는 아파치 크런치(Apache Crunch) 프로젝트의 창설자이며 커미터를 맡고 있다. 클라우데라에 합류하기 전에는 구글에서 광고 경매 시스템을 개발했고, Google+에서 사용하는 분석 인프라의 개발을 이끌었다.

지은이 : 션 오언 (Sean Owen)

최근작 :

<9가지 사례로 익히는 고급 스파크 분석> … 총 3종 (모두보기)

소개 :

클라우데라의 유럽/중동/아프리카 대상 데이터 과학팀의 디렉터다. 아파치 머하웃 기계 학습 프로젝트의 커미터이자 중요한 컨트리뷰터로, 머하웃의 Taste 추천 프레임워크를 개발했다. 션은 아파치 스파크의 커미터이기도 하다. 스파크, 스파크 스트리밍, 그리고 카프카로 개발한 하둡에서 동작하는 실시간 대규모 학습을 위한 Oryx 프로젝트(예전에는 Myrrix라고 불렸던)를 만들었다.

옮긴이 : 박상은

최근작 :

… 총 7종 (모두보기)

소개 :

컴퓨터에 붙은 그림을 보고 애플이라는 단어의 뜻을 알게 된 이 땅의 흔한 개발자 중 한 사람. 대학원에서 인공지능을 공부했지만 졸업 이후 메일, 브라우저, CMS, 도서 관리 시스템, 빅데이터 플랫폼 등 인공지능과 큰 관련이 없는 다양한 프로젝트에 참여해오다 뒤늦게 다시 인공지능과 머신러닝에서 비전을 찾아 어슬렁거리고 있다. 최근에는 딥러닝의 재미있는 주제들을 연구하고, 이를 사업화하는 데 관심을 가지고 있다. 공역한 책으로 『9가지 사례로 익히는 고급 스파크 분석(개정판)』(한빛미디어, 2018)이 있다.

옮긴이 : 권한철

최근작 :

… 총 3종 (모두보기)

소개 :

에스코어의 빅데이터 플랫폼인 BigPod™ 개발자로 빅데이터 분석에 스파크를 활용하는 데 주력하고 있다. 특히 실시간 스트리밍 데이터 분석과 통계 및 기계 학습 알고리즘을 활용한 데이터 분석에 관심이 많으며, 인간 생활을 이롭게 하는 기술과 제품을 만드는 것을 개발자로서의 삶의 목표로 하고 있다.

옮긴이 : 서양주

최근작 :

… 총 3종 (모두보기)

소개 :

한국과학기술원 학부에서 수학을, 서울대학교에서 석사과정으로 통계학을 전공하였으며, 티맥스소프트를 시작으로 개발자로서 일하게 되었다. 그 후 에스코어에서 2013년 하둡과 스파크를 접한 이후로 빅데이터 분석 업무를 주 업무로 수행하게 되었다. 현재는 카카오 RUBICS TF에서 실시간 콘텐츠 추천 업무를 하고 있다.

한빛미디어 도서 모두보기 신간알리미 신청
최근작 :	<네이버 스마트스토어 시작하기>,<더 나은 프로그래머 되는 법>,<한 권으로 배우는 도커 & 쿠버네티스>등 총 586종
대표분야 :	그래픽/멀티미디어 1위 (브랜드 지수 323,250점), 프로그래밍 언어 1위 (브랜드 지수 681,907점), 오피스(엑셀/파워포인트) 2위 (브랜드 지수 242,910점)

중고매장

서울

경기

광역시 등

(주)알라딘커뮤니케이션 잠실새내역점

고객센터 1544-2514 (발신자 부담)