• 소득공제
  • 무료배송

데이터는 언제나 옳다-대규모 데이터 처리와 분석 실무 유스케이스별 빅데이터 및 NoSQL 기술 가이드(IT LEADERS 20)

  • 마이클마누체흐리
  • 정부환,류상호,염화음,이화경
  • 위키북스
  • 2014년 05월 28일
사용자 평점
0리뷰 0개
10%22,50025,000원
적립금
1,250원 (5% 적립)
추가 적립 안내
  • 5만원 이상 결제 시 (*배송비 제외)

    정가제FREE(상품/사은품) 금액이
    2,000원 이상이면 2,000원 추가적립

  • 10만원 이상 결제 시 (*배송비 제외)

    정가제FREE(상품/사은품) 금액이
    2,000원 이상이면 2,000원 추가적립

    정가제FREE(상품/사은품) 금액이
    5,000원 이상이면 5,000원 추가적립

회원가입 시 적립금 즉시 지급!

배송비
무료 (해외배송의 경우 지역에 따라 상이)

배송안내

배송비 안내
  • 1만원 이상 주문 시 무료배송 입니다.
  • 주문하신 상품을 해외로 배송 하시는 경우에는 별도의 항공료 가 부과됩니다
서울특별시 강남구 강남대로 542(논현동, 영풍빌딩)
주문 수량 변경시 안내

[주문/배송] 주문 수량 변경 시 안내

주문 수량 변경 시,배송일정이 변경될 수 있으니 반드시 확인해 주시기 바랍니다.
(고객센터 1544-9020)

지금 주문하면 9/23(수) 출고 가능
택배보다 빠른, 나우드림
상품 규격 정보
상품상세정보
ISBNISBN-13 : 9788998139551
쪽수256쪽
크기기타 규격
제품구성단행본
이 책이 속한 분야
  • 컴퓨터/IT > 시스템공학
관련 이벤트

AI추천 이유

책 소개
빅데이터의 효과적인 활용: 실제 활용 사례, 예제, 실용적인 코드, 그리고 상세 해법들 대용량 데이터 분석은 이제 거의 모든 비즈니스에서 매우 중요하다. 모바일과 소셜 기술은 대용량 데이터를 만들어내고 있다. 분산 클라우드 컴퓨팅은 그와 같은 대용량 데이터를 저장하고 분석할 수 있는 자원을 제공하고 있다. 전문가들은 NoSQL 데이터베이스를 비롯해 완전히 새로운 기술들로 무장하고 있다. 하지만 지금까지 제목에 ‘빅데이터’라는 단어가 포함된 대부분의 책에서는 비즈니스 논쟁이나 제품 카탈로그 이상의 내용을 다루지 않았다. 『데이터는 언제나 옳다! 대규모 데이터 처리와 분석 실무』는 다르다. 이 책은 모든 빅데이터 의사결정자, 개발자, 그리고 전략가들을 위한 완전히 실용적이고 필수적인 가이드를 제시한다. 이 책에서 다루는 내용 * 빅데이터 성공으로 이끄는 네 가지 원칙과 피해야 할 공통적인 함정 * 협업을 증진하는 법과 데이터 사일로와 관련해서 피해야 할 문제 * 테라바이트 규모의 데이터를 효율적이고 경제적으로 제공하고 공유하는 법 * 급속한 데이터 증가에 대처하기 위해 무한대로 확장 가능한 솔루션 구축하기 * 대중이 만들어내는 데이터를 수집하기 위한, 레디스를 이용한 NoSQL 웹 애플리케이션 구축 * 하둡, 하이브, 샤크를 통해 대용량 데이터를 대상으로 분산 질의 실행 * 구글 빅쿼리를 이용한 데이터 대시보드 구축 * 고급 시각화 기법을 이용한 대용량 데이터 탐색 * 대용량 데이터를 변환하기 위한 효율적인 파이프라인 구축 * 아파치 피그와 캐스케이딩 자바 라이브러리를 이용한 복잡한 데이터 처리 자동화 * 정보를 분류하고 추천하고 예측하기 위한 머신 러닝 적용 * 대용량 데이터를 대상으로 통계분석을 수행하기 위한 R 활용 * 파이썬과 판다스를 활용한 효율적인 분석 워크플로우 구축 * 솔루션의 직접 구축, 구입, 아웃소싱 시점을 결정하는 구매 전략 수립 * 확장 가능한 데이터 기술의 트렌드와 수렴, 진화하는 데이터 과학자의 역할 조망
목차
[1부] 빅데이터 시대의 방향 ▣ 1장: 데이터를 성공적으로 다루는 네 가지 법칙 언제부터 데이터가 중요해졌는가? 데이터와 단일 서버 빅데이터 트레이드오프 - 무한대로 확장 가능한 루션을 구축하라 - 인터넷을 통해 데이터를 공유할 수 있는 시스템을 구축하라 - 인프라가 아닌 솔루션을 구축하라 - 데이터에서 가치를 찾는 것에 집중하라 빅데이터 파이프라인의 해부 궁극의 데이터베이스 정리 [2부] 대용량 데이터의 수집 및 공유 ▣ 2장: 대용량의 미가공 데이터를 호스팅하고 공유하기 파일 더미에서 괴로워하다 - 다량의 파일을 공유할 때 직면하는 문제 스토리지: 인프라 서비스 - 네트워크는 느리다 적합한 데이터 포맷 선택하기 - XML: 데이터, 스스로 표현하다 - JSON: 프로그래머의 선택 문자 인코딩 - 파일 변환 데이터 이동: 데이터 직렬화 포맷 - 아파치 쓰리프트와 프로토콜 버퍼 - 아파치 아브로 정리 ▣ 3장: 대중이 생성한 데이터를 수집하기 위한 NoSQL 기반의 웹 애플리케이션 구축하기 관계형 데이터베이스: 명령과 제어 - 관계형 데이터베이스 ACID 테스트 관계형 데이터베이스와 인터넷 비교 - CAP 이론과 BASE 비관계형 데이터베이스 모델 - 키-값 데이터베이스 - 문서 저장소 쓰기 속도 최적화: 레디스 여러 레디스 인스턴스에 걸쳐 샤딩하기 - 트윔프록시를 이용한 자동 파티셔닝 - 레디스의 대안 NewSQL: 코드의 귀환 정리 ▣ 4장: 데이터 사일로를 다루는 전략 전문용어 투성이인 웨어하우스 - 현실에서의 문제 - 데이터 규약과 안전을 위한 계획하기 - 데이터 웨어하우스 입문하기 - 데이터 웨어하우스의 마법 주문: 추출하고 변환하고 읽는다(ETL ) 하둡: 웨어하우스의 코끼리 데이터 사일로에 좋은 면도 있다 - 기술이 아닌 데이터 도전과제에 집중한다 - 직원들이 직접 질문할 수 있는 권한 주기 - 데이터 사일로를 연결하는 기술에 투자하기 융합: 데이터 사일로의 끝 룬의 비즈니스 인텔리전스 시스템은 실현될 것인가? 정리 [3부] 데이터에 관해 질문하기 ▣ 5장: 하둡, 하이브, 샤크를 이용해 대용량 데이터 집합에 대해 질문하기 데이터 웨어하우스란 무엇인가? 아파치 하이브: 하둡을 위한 대화식 질의하기 - 하이브 활용 사례 - 하이브 사용하기 - 하이브로 추가 데이터 소스 사용하기 샤크: RAM 속도로 질의하기 클라우드에서의 데이터 웨어하우스 정리 ▣ 6장: 구글 빅쿼리를 이용한 데이터 대시보드 구축하기 분석형 데이터베이스 드리멜: 구글의 혁신 전파하기 - 드리멜과 맵리듀스는 어떻게 다른가? 빅쿼리: 서비스로서의 데이터 분석 - 빅쿼리의 질의 언어 맞춤형 데이터 대시보드 구축하기 - 빅쿼리 API 접근 인증하기 - 질의를 실행하고 결과 받기 - 질의 결과 캐싱하기 - 시각화 추가하기 분석형 질의 엔진의 미래 정리 ▣ 7장: 대용량 데이터 탐색을 위한 데이터 시각화 전략 주의를 요하는 이야기: 데이터를 이야기로 바꾸기 인간 규모 대 컴퓨터 규모 - 상호작용성 대화식 데이터 애플리케이션 구축하기 R과 ggplot2를 이용한 대화식 시각화 - matplotlib: 파이썬을 이용한 2D 차트 - D3.js: 웹을 위한 대화식 시각화 정리 [4부] 데이터 파이프라인 구축하기 ▣ 8장: 하나로 합치기: 맵리듀스 데이터 파이프라인 데이터 파이프라인이란 무엇인가? - 작업에 적합한 도구 하둡 스트리밍을 이용한 데이터 파이프라인 - 맵리듀스와 데이터 변환 - 가장 간단한 파이프라인: stdin에서 stdout으로 단일 맵리듀스 변환 - 미가공 NVSS 데이터에서 관련 정보 추출하기: 맵 단계 - 월별 출생 수 세기: 리듀서 단계 - 로컬에서 맵리듀스 파이프라인 테스트하기 - 하둡 클러스터에서 맵리듀스 잡 실행하기 복잡성 관리: 하둡용 파이썬 맵리듀스 프레임워크 - mrjob을 이용해 하둡 스트리밍 예제 재작성하기 - 여러 단계 파이프라인 구축하기 - 엘라스틱 맵리듀스에서 mrjob 스크립트 실행하기 - 파이썬 기반의 대안 맵리듀스 프레임워크 정리 ▣ 9장: 피그와 캐스케이딩을 이용한 데이터 변환 워크플로우 구축하기 실전에서의 대규모 데이터 워크플로우 복잡하다: 다단계 맵리듀스 변환 - 아파치 피그: 복잡함을 제거하다 - 대화식 그룬트 셸을 이용해 피그 실행하기 - 데이터 워크플로우를 필터링하고 최적화하기 - 배치 모드로 피그 스크립트 실행하기 캐스케이딩: 견고한 데이터 워크플로우 애플리케이션 만들기 - 소스과 싱크 개념으로 생각하기 - 캐스케이딩 애플리케이션 만들기 - 캐스케이드 만들기: 간단한 JOIN 예제 - 하둡 클러스터에 캐스케이딩 애플리케이션 배포하기 피그와 캐스케이딩 중에서 선택해야 할 때 정리 [5부] 대용량 데이터를 위한 기계 학습 ▣ 10장: 머하웃을 이용한 대용량 분류기 구축하기 컴퓨터는 미래를 예측할 수 있는가? 기계 학습의 도전과제 - 베이지안 분류 - 클러스터링 - 추천 엔진 아파치 머하웃: 확장 가능한 기계 학습 - 텍스트 분류에서 머하웃 사용하기 MLBase: 분산 기계 학습 프레임워크 정리 [6부] 대용량 데이터에 대한 통계 분석 ▣ 11장: 대용량 데이터에 R 활용하기 통계는 왜 섹시한가? - 대용량 데이터에서 R이 지닌 한계 - R 데이터 프레임과 행렬 대용량 데이터를 다루는 전략 - 큰 행렬 연산: bigmemory와 biganalytics - ff: 메모리보다 큰 데이터 프레임 다루기 - biglm: 대용량 데이터를 위한 선형 회귀 분석 - RHadoop: R에서 아파치 하둡에 접근하기 정리 ▣ 12장: 파이썬과 Pandas를 이용한 분석 워크플로우 구축하기 데이터 동물원에서 뱀(Python )이 풀려나다 - 통계 계산을 위한 언어 선택 - 기존 코드 확장하기 - 도구와 테스팅 데이터 처리를 위한 파이썬 라이브러리 - NumPy - SciPy: 파이썬을 위한 과학 컴퓨팅 - 이미지 데이터를 위한 SciPy 사용하기 - 판다스 데이터 분석 라이브러리 좀 더 복잡한 워크플로우 구축하기 - 잘못됐거나 누락된 레코드 처리하기 아이파이썬: 과학 컴퓨팅 도구의 완성 - 클러스터를 이용한 아이파이썬 병렬화하기 정리 [7부] 향후 전망 ▣ 13장: 언제 구축하고, 언제 구매하고, 언제 아웃소싱할 것인가? 중복된 솔루션 데이터 문제 이해하기 구축 대 구매 문제를 위한 각본 - 이미 투자한 바는 무엇인가? - 작게 시작하기 - 확장 계획하기 나만의 사설 데이터 센터 오픈소스 사용에 따른 비용 이해하기 정리 ▣ 14장: 데이터 기술의 미래 트렌드 하둡: 파괴자와 피파괴자 모든 것은 클라우드 속에 있다 데이터 과학자의 흥망 융합: 궁극의 데이터베이스 문화의 융합 정리
저자 소개
저자 : 마이클마누체흐리
    마이클 마누체흐리 (Michael Manoochehri)
    전직 구글 엔지니어이자 데이터 해커로서, 제한된 자원과 시간 내에 실용적인 솔루션을 구축해야 하는 전문가들을 위해 글을 쓰고 있다. 그는 자신의 폭넓은 경험을 통해 시스템 인프라가 아니라 가장 큰 가치를 얻을 수 있는 애플리케이션을 구축하는 데 집중하게끔 돕는다. 마누체흐리는 하이브리드 솔루션에서 여러 기술을 통합함으로써 오늘날의 중요 데이터 활용 사례를 저비용으로 처리하는 방법을 보여준다. 대용량 데이터를 관리하고, 데이터를 시각화하고, 데이터 파이프라인과 대시보드를 구축하고, 통계분석을 위한 도구를 선택하는 등에서 전문가의 접근법을 확인할 수 있다. 아울러 오늘날 데이터 분석에 자주 사용되는 선도적인 기술들(예: 하둡, 하이브, 샤크, R, 아파치 피그, 머하웃, 구글 빅쿼리)을 활용하는 방법을 보여준다.
    도서리뷰

    이 책을 읽고 어떤 느낌을 받으셨나요?
    리뷰를 남기고 다른 독자들과 함께 공유해보세요.

    안내 열기구매(배송/수령완료) 후 리뷰를 작성하시면 적립금 300원을 드려요!

    등록된 리뷰가 없습니다

    첫번째 리뷰어가 되어주세요

    교환/반품/환불
    반품/교환방법
    • 마이페이지 > 주문관리 > 주문/배송조회 > 주문조회 후  [1:1상담신청]  또는 고객센터 (1544-9020)
    • ※ 오픈마켓, 해외배송 주문상품 문의 시 [1:1상담신청] 또는 고객센터 (1544-9020)
    반품/교환 가능기간
    • 변심반품의 경우 수령 후 7일 이내
    • 상품의 결함 및 계약내용과 다를 경우 문제점 발견 후 30일 이내
    반품/교환비용
    • 단순변심 혹은 구매착오로 인한 반품/교환은 반송료 고객 부담
    • 해외직배송 도서 구매 후 단순변심에 의한 취소 및 반품 시 도서판매가의 20% 수수료 부과
    반품/교환 불가 사유
    • 소비자의 책임 있는 사유로 상품 등이 손실 또는 훼손된 경우
    • 소비자의 사용, 포장 개봉에 의해 상품 등의 가치가 현저히 감소한 경우
      예) 만화, 잡지, 수험서 및 문제집류
    • 복제가 가능한 상품 등의 포장을 훼손한 경우
      예) 음반/DVD/비디오, 소프트웨어, 만화책, 잡지, 영상 화보집
    • 소비자의 요청에 따라 개별적으로 주문 제작되는 상품의 경우
    • 디지털 컨텐츠인 eBook, 오디오북 등을 1회 이상 다운로드를 받았을 경우
    • 시간의 경과에 의해 재판매가 곤란한 정도로 가치가 현저히 감소한 경우
    • 전자상거래 등에서의 소비자보호에 관한 법률이 정하는 소비자 청약철회 제한 내용에 해당되는 경우
    상품 품절
    • 공급사(출판사) 재고 사정에 의해 품절/지연될 수 있으며, 품절 시 관련 사항에 대해서는 이메일과 문자로 안내드리겠습니다.
    소비자 피해보상
    환불지연에 따른 배상
    • 상품의 불량에 의한 교환, A/S, 환불, 품질보증 및 피해보상 등에 관한 사항은 소비자분쟁 해결 기준 (공정거래위원회 고시)에 준하여 처리됨
    • 대금 환불 및 환불지연에 따른 배상금 지급 조건, 절차 등은 전자상거래 등에서의 소비자 보호에 관한 법률에 따라 처리함

    매장에서 사용할 수 있는 바코드가 있어요!