• 베스트
  • 소득공제
  • 무료배송

수학으로 풀어보는 강화학습 원리와 알고리즘(개정판)(위키북스 데이터 사이언스 시리즈73)

  • 박성수
  • 위키북스
  • 2021년 09월 17일
사용자 평점
0리뷰 0개
10%27,000원30,000원
적립금
1,500원 (5% 적립)
추가 적립 안내
  • 5만원 이상 결제 시 (*배송비 제외)

    정가제FREE(상품/사은품) 금액이
    2,000원 이상이면 2,000원 추가적립

  • 10만원 이상 결제 시 (*배송비 제외)

    정가제FREE(상품/사은품) 금액이
    2,000원 이상이면 2,000원 추가적립

    정가제FREE(상품/사은품) 금액이
    5,000원 이상이면 5,000원 추가적립

회원가입 시 적립금 즉시 지급!

배송비
무료 (해외배송의 경우 지역에 따라 상이)

배송안내

배송비 안내
  • 1만원 이상 주문 시 무료배송 입니다.
  • 주문하신 상품을 해외로 배송 하시는 경우에는 별도의 항공료 가 부과됩니다
서울특별시 강남구 강남대로 542(논현동, 영풍빌딩)
주문 수량 변경시 안내

[주문/배송] 주문 수량 변경 시 안내

주문 수량 변경 시,배송일정이 변경될 수 있으니 반드시 확인해 주시기 바랍니다.
(고객센터 1544-9020)

지금 주문하면 10/1(목) 출고 가능
택배보다 빠른, 나우드림
상품 규격 정보
상품상세정보
ISBNISBN-13 : 9791158392734
쪽수436쪽
크기기타 규격
제품구성단행본
이 책이 속한 분야
  • 컴퓨터/IT > 시스템공학
관련 이벤트

AI추천 이유

책 소개
코딩하면서 알고리즘이 유도된 과정이 궁금하다면 이 책을 선택하기 바랍니다! 이 책은 딥러닝이나 강화학습 예제를 코딩하면서 그 배경 알고리즘의 유도 과정을 궁금해하는 사람을 위한 책이다. 술술 읽히는 책은 아니지만, 그렇다고 심하게 어려운 책도 아니다. 수학의 선수 지식으로 대학 2학년 때 배우는 공업수학을 이수한 정도면 충분하고, 딥러닝의 선수 지식으로는 텐서플로 또는 파이토치를 사용하여 MNIST와 같은 간단한 딥러닝 예제를 따라해 본 정도면 충분하다.
목차
▣ 01장: 강화학습 수학 1.1 확률과 랜덤 변수 ___1.1.1 확률 ___1.1.2 랜덤 변수 ___1.1.3 누적분포함수와 확률밀도함수 ___1.1.4 결합 확률함수 ___1.1.5 조건부 확률함수 ___1.1.6 독립 랜덤 변수 ___1.1.7 랜덤 변수의 함수 ___1.1.8 베이즈 정리 ___1.1.9 샘플링 1.2 기댓값과 분산 ___1.2.1 기댓값 ___1.2.2 분산 ___1.2.3 조건부 기댓값과 분산 1.3 랜덤벡터 ___1.3.1 정의 ___1.3.2 기댓값과 공분산 행렬 ___1.3.3 샘플 평균 1.4 가우시안 분포 1.5 랜덤 시퀀스 ___1.5.1 정의 ___1.5.2 평균함수와 자기 상관함수 ___1.5.3 마르코프 시퀀스 1.6 선형 확률 차분방정식 1.7 표기법 1.8 중요 샘플링 1.9 엔트로피 1.10 KL 발산 1.11 추정기 ___1.11.1 최대사후 추정기 ___1.11.2 최대빈도 추정기 1.12 벡터와 행렬의 미분 ___1.12.1 벡터로 미분 ___1.12.2 행렬로 미분 1.13 촐레스키 분해 1.14 경사하강법 ___1.14.1 배치 경사하강법 ___1.14.2 확률적 경사하강법 1.15 경사하강법의 개선 ___1.15.1 모멘텀 ___1.15.2 RMSprop ___1.15.3 아담 1.16 손실함수의 확률론적 해석 ___1.16.1 가우시안 오차 분포 ___1.16.2 베르누이 오차 분포 ▣ 02장: 강화학습 개념 2.1 강화학습 개요 2.2 강화학습 프로세스와 표기법 2.3 마르코프 결정 프로세스 ___2.3.1 정의 ___2.3.2 가치함수 ___2.3.3 벨만 방정식 ___2.3.4 벨만 최적 방정식 2.4 강화학습 방법 ▣ 03장: 정책 그래디언트 3.1 배경 3.2 목적함수 3.3 정책 그래디언트 3.4 REINFORCE 알고리즘 ▣ 04장: A2C 4.1 배경 4.2 그래디언트의 재구성 4.3 분산을 감소시키기 위한 방법 4.4 A2C 알고리즘 4.5 A2C 알고리즘 구현 ___4.5.1 테스트 환경 ___4.5.2 코드 개요 ___4.5.3 액터 클래스 ___4.5.4 크리틱 클래스 ___4.5.5 에이전트 클래스 ___4.5.6 학습 결과 ___4.5.7 전체 코드 ▣ 05장: A3C 5.1 배경 5.2 그래디언트 계산의 문제 ___5.2.1 샘플의 상관관계 ___5.2.2 n-스텝 가치 추정 5.3 비동기 액터-크리틱(A3C) 알고리즘 5.4 그래디언트 병렬화 방식의 A3C 알고리즘 구현 ___5.4.1 테스트 환경 ___5.4.2 코드 개요 ___5.4.3 액터 클래스 ___5.4.4 크리틱 클래스 ___5.4.5 에이전트 클래스 ___5.4.6 학습 결과 ___5.4.7 전체 코드 5.5 데이터 병렬화 방식의 A3C 알고리즘 구현 ___5.5.1 코드 개요 ___5.5.2 전체 코드 ▣ 06장: PPO 6.1 배경 6.2 그래디언트의 재구성 6.3 정책 업데이트와 성능 6.4 PPO 알고리즘 6.5 어드밴티지 추정의 일반화 (GAE) 6.6 PPO 알고리즘 구현 ___6.6.1 테스트 환경 ___6.6.2 코드 개요 ___6.6.3 액터 클래스 ___6.6.4 크리틱 클래스 ___6.6.5 에이전트 클래스 ___6.6.6 학습 결과 ___6.6.7 전체 코드 ▣ 07장: DDPG 7.1 배경 240 7.2 그래디언트의 재구성 7.3 DDPG 알고리즘 7.4 DDPG 알고리즘 구현 ___7.4.1 테스트 환경 ___7.4.2 코드 개요 ___7.4.3 액터 클래스 ___7.4.4 크리틱 클래스 ___7.4.5 액터-크리틱 에이전트 클래스 ___7.4.6 학습 결과 ___7.4.7 전체 코드 ▣ 08장: SAC 8.1 배경 8.2 소프트 벨만 방정식 8.3 소프트 정책 개선 8.4 SAC 알고리즘 8.5 SAC 알고리즘 구현 ___8.5.1 테스트 환경 ___8.5.2 코드 개요 ___8.5.3 액터 클래스 ___8.5.4 크리틱 클래스 ___8.5.5 에이전트 클래스 ___8.5.6 학습 결과 ___8.5.7 전체 코드 ▣ 09장: 모델 기반 강화학습 기초 9.1 배경 9.2 최적제어 ___9.2.1 LQR ___9.2.2 확률적 LQR ___9.2.3 가우시안 LQR ___9.2.4 반복적 LQR 9.3 모델 학습 방법 ▣ 10장: 로컬 모델 기반 강화학습 10.1 배경 10.2 로컬 모델 피팅 기반 LQR 10.3 로컬 모델 피팅 ___10.3.1 조건부 가우시안 방법 ___10.3.2 GMM 사전분포를 이용한 로컬 모델 업데이트 10.4 로컬 제어 법칙 업데이트 ___10.4.1 대체 비용함수 계산 ___10.4.2 KL 발산 계산 ___10.4.3 h 조정 ___10.4.4 e 조정 10.5 가우시안 LQR을 이용한 강화학습 알고리즘 10.6 가우시안 LQR을 이용한 강화학습 알고리즘 구현 ___10.6.1 테스트 환경 ___10.6.2 코드 개요 ___10.6.3 궤적 생성 ___10.6.4 로컬 모델 피팅 ___10.6.5 가우시안 LQR ___10.6.6 가우시안 혼합 모델 ___10.6.7 LQR-FLM 에이전트 클래스 ___10.6.8 학습 결과 ___10.6.9 전체 코드 10.7 GPS로의 발전 ▣ 참고문헌
저자 소개
저자 : 박성수
    박성수
    서울대학교 항공우주공학과에서 학사, 동 대학교 대학원에서 석사, 그리고 국비유학으로 미국 UC Berkeley에서 박사학위를 받았다. 유학가기 전에 국방과학연구소에서 연구원으로 일했으며, 박사후에는 UC Berkeley ITS 연구소에서 포스트닥 연구원으로 일했다. 현재 세종대학교 항공우주공학과 교수이며, 유도항법제어 및 AI for Dynamics and Control 분야를 연구하고 있다.

    ◎ 개인 블로그: https://pasus.tistory.com/

    도서리뷰

    이 책을 읽고 어떤 느낌을 받으셨나요?
    리뷰를 남기고 다른 독자들과 함께 공유해보세요.

    안내 열기구매(배송/수령완료) 후 리뷰를 작성하시면 적립금 300원을 드려요!

    등록된 리뷰가 없습니다

    첫번째 리뷰어가 되어주세요

    교환/반품/환불
    반품/교환방법
    • 마이페이지 > 주문관리 > 주문/배송조회 > 주문조회 후  [1:1상담신청]  또는 고객센터 (1544-9020)
    • ※ 오픈마켓, 해외배송 주문상품 문의 시 [1:1상담신청] 또는 고객센터 (1544-9020)
    반품/교환 가능기간
    • 변심반품의 경우 수령 후 7일 이내
    • 상품의 결함 및 계약내용과 다를 경우 문제점 발견 후 30일 이내
    반품/교환비용
    • 단순변심 혹은 구매착오로 인한 반품/교환은 반송료 고객 부담
    • 해외직배송 도서 구매 후 단순변심에 의한 취소 및 반품 시 도서판매가의 20% 수수료 부과
    반품/교환 불가 사유
    • 소비자의 책임 있는 사유로 상품 등이 손실 또는 훼손된 경우
    • 소비자의 사용, 포장 개봉에 의해 상품 등의 가치가 현저히 감소한 경우
      예) 만화, 잡지, 수험서 및 문제집류
    • 복제가 가능한 상품 등의 포장을 훼손한 경우
      예) 음반/DVD/비디오, 소프트웨어, 만화책, 잡지, 영상 화보집
    • 소비자의 요청에 따라 개별적으로 주문 제작되는 상품의 경우
    • 디지털 컨텐츠인 eBook, 오디오북 등을 1회 이상 다운로드를 받았을 경우
    • 시간의 경과에 의해 재판매가 곤란한 정도로 가치가 현저히 감소한 경우
    • 전자상거래 등에서의 소비자보호에 관한 법률이 정하는 소비자 청약철회 제한 내용에 해당되는 경우
    상품 품절
    • 공급사(출판사) 재고 사정에 의해 품절/지연될 수 있으며, 품절 시 관련 사항에 대해서는 이메일과 문자로 안내드리겠습니다.
    소비자 피해보상
    환불지연에 따른 배상
    • 상품의 불량에 의한 교환, A/S, 환불, 품질보증 및 피해보상 등에 관한 사항은 소비자분쟁 해결 기준 (공정거래위원회 고시)에 준하여 처리됨
    • 대금 환불 및 환불지연에 따른 배상금 지급 조건, 절차 등은 전자상거래 등에서의 소비자 보호에 관한 법률에 따라 처리함

    매장에서 사용할 수 있는 바코드가 있어요!