• 소득공제
  • 무료배송

강화학습 기본과 PyTorch-제2판(강화학습 시리즈 1)

  • 추상목
  • 자유아카데미
  • 2026년 08월 31일
사용자 평점
0리뷰 0개
1%29,70030,000원
적립금
900원 (3% 적립)
추가 적립 안내
  • 5만원 이상 결제 시 (*배송비 제외)

    정가제FREE(상품/사은품) 금액이
    2,000원 이상이면 2,000원 추가적립

  • 10만원 이상 결제 시 (*배송비 제외)

    정가제FREE(상품/사은품) 금액이
    2,000원 이상이면 2,000원 추가적립

    정가제FREE(상품/사은품) 금액이
    5,000원 이상이면 5,000원 추가적립

회원가입 시 적립금 즉시 지급!

배송비
무료 (해외배송의 경우 지역에 따라 상이)

배송안내

배송비 안내
  • 1만원 이상 주문 시 무료배송 입니다.
  • 주문하신 상품을 해외로 배송 하시는 경우에는 별도의 항공료 가 부과됩니다
서울특별시 강남구 강남대로 542(논현동, 영풍빌딩)
주문 수량 변경시 안내

[주문/배송] 주문 수량 변경 시 안내

주문 수량 변경 시,배송일정이 변경될 수 있으니 반드시 확인해 주시기 바랍니다.
(고객센터 1544-9020)

지금 주문하면 9/9(수) 출고 가능
택배보다 빠른, 나우드림
상품 규격 정보
상품상세정보
ISBNISBN-13 : 9791158088798
쪽수332쪽
크기B5(188mm X 257mm, 사륙배판)
제품구성단행본
이 책이 속한 분야
  • 컴퓨터/IT > 시스템공학
관련 이벤트

AI추천 이유

책 소개

신경망을 공부하다 보면 기계학습이 비지도 학습, 지도 학습, 그리고 강화학습으로 나뉜다는 설명을 자주 접하게 된다. 알파고나 자율 주행차에서 강화학습이 쓰인다는 이야기도 듣고, 아이가 세상과 부딪히며 배우는 과정을 본뜬 방법이라는 설명도 접하게 된다. 그러다 보면 자연스럽게 이런 생각이 든다.

‘강화학습을 공부해 볼까?’

그러나 막상 강화학습을 공부하려고 하면 생각보다 쉽지 않다. 첫째, 강화학습은 일반적인 신경망 학습 방식과 많이 다르다. 둘째, 방법이 매우 다양해서 무엇부터 어떤 순서로 공부해야 할지 막막하다. 셋째, 개념부터 코드까지 차근차근 안내해 주는 책을 찾기도 쉽지 않다.

이 책은 이러한 어려움을 조금이나마 덜어 주고자 썼다. 강화학습을 이해하려면 먼저 환경과 에이전트의 개념을 이해해야 한다. 이 두 개념은 비지도 학습과 지도 학습에는 직접적으로 나타나지 않는다. 그래서 강화학습 공부는 환경과 에이전트를 이해하는 데서 출발해야 한다. 여러 예제를 보면서 먼저 그림으로 환경과 에이전트를 이해하고, 그 내용을 다시 수식으로 표현해 보아야 한다. 그래야 에이전트가 왜 특정 행동을 선택하는지, 또 그 행동을 통해 현재와 미래의 보상을 어떻게 크게 만들어 가는지 차근차근 이해할 수 있다.

이 책도 이러한 흐름에 맞추어 차례를 잡았다. 1장부터 4장까지는 환경을 알고 있을 때의 방법을 다루고, 5장부터 9장까지는 환경을 모를 때의 방법을 다룬다. 또 다른 기준은 신경망 사용 여부이다. 1장부터 6장까지는 신경망을 사용하지 않고, 7장부터 9장까지는 신경망을 사용한다.

1장부터 4장까지는 강화학습 공부의 기초에 해당하므로, 이 부분을 충분히 익혀 두어야 이후 내용을 무리 없이 따라갈 수 있다. 특히 제2장의 벨만 방정식 계산 문제는 생략하지 말고, 충분히 연습하기를 권한다. 5장과 6장에서는 환경을 모르지만, 신경망을 사용하지 않는 강화학습을 다룬다. 7장부터는 신경망을 사용하는 강화학습을 다룬다. 이때 제2장에서 공부한 벨만 방정식은 신경망 학습에서 손실을 정할 때 중요한 바탕이 된다.

이 책에서는 그림으로 개념을 잡고, 수식으로 구조를 확인한 뒤, 코드로 마무리하는 흐름을 중요하게 생각하였다. 특히 코드를 구현하기 전에 전체 구조와 데이터의 흐름을 그림으로 먼저 살펴볼 수 있도록 다양한 그림을 제시하였다. 독자가 그림으로 먼저 감을 잡고, 수식으로 구조를 확인한 뒤, 코드로 내용을 마무리할 수 있도록 하였다.

그림으로 개념 이해수식으로 구조 확인코드로 내용 마무리

이 책의 예제 코드는 2026 7 3 Google Colab 환경에서 실행하여 확인하였다. 그러나 Google Colab은 시간이 지나면서 Python과 주요 라이브러리 버전이 변경될 수 있다. 따라서 나중에 코드를 실행하면 이 책에서 사용한 환경과 달라질 수 있고, 일부 코드의 실행 결과나 동작도 달라질 수 있다. 예제 코드 확인에 사용한 주요 실행 환경은 다음과 같다: Python 3.12.13, gym 0.25.2, numpy 2.0.2, matplotlib 3.10.0, torch 2.11.0+cpu, IPython 7.34.0

본 저서는 강화학습의 기본 이론에서 출발하여 깊은 Q-네트워크(Deep Q-Network, DQN)의 일부 내용까지 다룬다. 그리고 이 책에서 미처 다루지 못한 내용은 출간된 강화학습 시리즈 2 『강화학습 기본 다지기와 PyTorch』와 강화학습 시리즈 3 『강화학습 기본 완성과 PyTorch』에서 이어서 살펴본다. 세 권은 각각 독립적으로 읽을 수 있지만, 함께 공부하면 강화학습의 기초부터 심화까지 차례대로 익히는 데 도움이 될 것이다.

좋은 책이 되도록 힘썼지만, 미처 발견하지 못한 오류가 있을 수 있다. 이에 대해 독자여러분의 너른 양해를 구한다. 출간 후 확인되는 수정 사항이나 참고 자료는 자유아카데미 홈페이지 자료실(www.freeaca.com)에 올릴 예정이다.

2024년에 출간된 시리즈 1은 독자 여러분의 관심과 성원에 힘입어 2024 세종도서 학술 부문 도서로 선정되었고, 그 덕분에 2026년에 제2판을 펴내게 되었다. 2판에서는 제1판의 오탈자를 바로잡고, 부족했던 그림과 개념 설명, 코드 설명을 전체적으로 보완하였다. 2판을 준비하면서, 강화학습 시리즈의 첫 번째 책인 이 책이 어떤 역할을 해야 하는지 다시 생각했다. 그 답은 분명했다. 강화학습의 출발점을 차분히 안내하는 것이다. 이 책을 통해 독자들이 환경과 에이전트, 상태, 행동, 보상, 벨만 방정식을 이해하고, PyTorch 구현의 기초를 하나씩 익혀 가기를 바란다. 이 책을 바탕으로 시리즈 2와 시리즈 3을 함께 공부하면 강화학습의 기본 개념을 더 단단히 다지고, 심화 주제까지 차례대로 이해할 수 있을 것이다.

목차

[목 차]

1장 그림으로 이해하는 강화학습

PART I 강화학습 구성 요소

PART II 환경(env) 예제

PART III 에이전트(agent) 예제

 

2장 벨만 방정식(Bellman equation)

PART I 보상과 평균 보상

PART II 할인율

PART III 정책 π

PART IV 정책 π로 행동할 때, 상태 s에서 평균 보상

PART V 정책 π로 행동할 때, 상태 가치

PART VI 정책 π로 행동을 선택할 때, 상태-행동 가치

PART VII 벨만 기대 방정식

PART VIII 벨만 최적 방정식

 

3장 강화학습에 사용하는 기본 코드

PART I 환경 코드

PART II 정책 코드

PART III 환경-정책 상호작용 코드

 

4장 동적 계획법

PART I 벨만 기대 방정식의 해를 코딩으로 구하기

PART II 최적의 정책을 코딩으로 구하기: 정책 반복

PART III 최적의 정책을 코딩으로 구하기: 가치 반복

 

5장 몬테카를로

PART I 에피소드

PART II 처음 방문 MC와 모든 방문 MC

PART III 중요도 표본추출 MC

부록

 

6 SARSA Q-learning

PART I SARSA 개요

PART II Q-learning 개요

PART III SARSA 업데이트 그림부터 코딩까지의 과정

PART IV Q-learning 업데이트 그림부터 코딩까지의 과정

 

7장 깊은 Q-네트워크

PART I 환경 CartPole-v0 소개

PART II 학습데이터, 신경망 구조와 손실함수 소개

PART III 그림으로 이해하는 DQN(Deep Q-Network, DQN)

PART IV DQN 의사 코드

PART V DQN 코드 설명

PART VI DQN 전체 코드

 

8 Double DQN

 

9 Dueling DQN

부록 Advantage A(s,a)의 평균을 빼는 이유

 

저자 소개
저자 : 추상목
도서리뷰 (0)
이 책을 읽고 어떤 느낌을 받으셨나요? 리뷰를 남기고 다른 독자들과 함께 공유해보세요.

등록된 리뷰가 없습니다

첫번째 리뷰어가 되어주세요

교환/반품/환불
반품/교환방법
  • 마이페이지 > 주문관리 > 주문/배송조회 > 주문조회 후  [1:1상담신청]  또는 고객센터 (1544-9020)
  • ※ 오픈마켓, 해외배송 주문상품 문의 시 [1:1상담신청] 또는 고객센터 (1544-9020)
반품/교환 가능기간
  • 변심반품의 경우 수령 후 7일 이내
  • 상품의 결함 및 계약내용과 다를 경우 문제점 발견 후 30일 이내
반품/교환비용
  • 단순변심 혹은 구매착오로 인한 반품/교환은 반송료 고객 부담
  • 해외직배송 도서 구매 후 단순변심에 의한 취소 및 반품 시 도서판매가의 20% 수수료 부과
반품/교환 불가 사유
  • 소비자의 책임 있는 사유로 상품 등이 손실 또는 훼손된 경우
  • 소비자의 사용, 포장 개봉에 의해 상품 등의 가치가 현저히 감소한 경우
    예) 만화, 잡지, 수험서 및 문제집류
  • 복제가 가능한 상품 등의 포장을 훼손한 경우
    예) 음반/DVD/비디오, 소프트웨어, 만화책, 잡지, 영상 화보집
  • 소비자의 요청에 따라 개별적으로 주문 제작되는 상품의 경우
  • 디지털 컨텐츠인 eBook, 오디오북 등을 1회 이상 다운로드를 받았을 경우
  • 시간의 경과에 의해 재판매가 곤란한 정도로 가치가 현저히 감소한 경우
  • 전자상거래 등에서의 소비자보호에 관한 법률이 정하는 소비자 청약철회 제한 내용에 해당되는 경우
상품 품절
  • 공급사(출판사) 재고 사정에 의해 품절/지연될 수 있으며, 품절 시 관련 사항에 대해서는 이메일과 문자로 안내드리겠습니다.
소비자 피해보상
환불지연에 따른 배상
  • 상품의 불량에 의한 교환, A/S, 환불, 품질보증 및 피해보상 등에 관한 사항은 소비자분쟁 해결 기준 (공정거래위원회 고시)에 준하여 처리됨
  • 대금 환불 및 환불지연에 따른 배상금 지급 조건, 절차 등은 전자상거래 등에서의 소비자 보호에 관한 법률에 따라 처리함

매장에서 사용할 수 있는 바코드가 있어요!