• 베스트
  • 소득공제
  • 무료배송

파이토치와 유니티 ML-Agents로 배우는 강화학습 응용편(위키북스 데이터 사이언스 시리즈 99)

  • 민규식, 이현호, 박유민
  • 위키북스
  • 2025년 01월 10일
사용자 평점
0리뷰 0개
10%34,20038,000원
적립금
1,900원 (5% 적립)
추가 적립 안내
  • 5만원 이상 결제 시 (*배송비 제외)

    정가제FREE(상품/사은품) 금액이
    2,000원 이상이면 2,000원 추가적립

  • 10만원 이상 결제 시 (*배송비 제외)

    정가제FREE(상품/사은품) 금액이
    2,000원 이상이면 2,000원 추가적립

    정가제FREE(상품/사은품) 금액이
    5,000원 이상이면 5,000원 추가적립

회원가입 시 적립금 즉시 지급!

배송비
무료 (해외배송의 경우 지역에 따라 상이)

배송안내

배송비 안내
  • 1만원 이상 주문 시 무료배송 입니다.
  • 주문하신 상품을 해외로 배송 하시는 경우에는 별도의 항공료 가 부과됩니다
서울특별시 강남구 강남대로 542(논현동, 영풍빌딩)
주문 수량 변경시 안내

[주문/배송] 주문 수량 변경 시 안내

주문 수량 변경 시,배송일정이 변경될 수 있으니 반드시 확인해 주시기 바랍니다.
(고객센터 1544-9020)

지금 주문하면 9/16(수) 출고 가능
택배보다 빠른, 나우드림
상품 규격 정보
상품상세정보
ISBNISBN-13 : 9791158395490
쪽수556쪽
크기기타 규격
제품구성단행본
이 책이 속한 분야
  • 컴퓨터/IT > 시스템공학
관련 이벤트

AI추천 이유

책 소개

유니티를 이용하여 직접 게임을 제작하고 ML-Agents로 강화학습 환경을 구성해 보자! 

 

유니티 ML-Agents는 게임 엔진인 유니티를 통해 제작한 시뮬레이션 환경을 강화학습을 위한 환경으로 만들어주는 고마운 도구이다. ML-Agents를 통해 많은 개발자, 연구자들이 원하는 강화학습 환경을 직접 만들 수 있게 되면서 ML-Agents는 학술적, 산업적으로 강화학습의 사용에 있어 중요한 도구가 되었다. 하지만 아직까지도 ML-Agents, 그중에서도 특히 ML-Agents 2.0 이후의 버전을 다루는 참고 자료가 많지 않기 때문에 ML-Agents를 사용하는 데 어려움이 많았다.

 

이 책은 2022년에 출간된 《파이토치와 유니티 ML-Agents로 배우는 강화학습》의 후속편으로 더욱 깊이 있는 강화학습에 대한 이론과 코드, 이를 위한 환경 제작 방법 등을 다루고 있다.

★ 이 책에서 다루는 내용 ★

 

◎ 응용 강화학습 환경 제작: 닷지, 퐁, 방탈출, 메이즈, 투 미션

◎ 응용 강화학습 알고리즘과 이를 응용하기 위한 기법들의 이론 및 학습 코드 구현: PPO, Attention,RND, MA-POCA, HyperNetworks

◎ 분산 학습, 커리큘럼 학습, 가변 입력 환경, 자가 학습, 멀티에이전트, 어려운 탐험 환경, 다중 골 환경 등 ML-Agents를 이용한 다양한 학습 방법 제공

◎ Python API와 mlagents-learn을 통한 응용 강화학습 알고리즘 설정 및 학습 방법

목차

[목 차]

▣ 00장: 유니티와 ML-Agents 설치하기 

유니티와 ML-Agents 설치하기 

__유니티 허브 다운로드 및 설치 

__유니티 라이선스 활성화 

__유니티 에디터 설치 

ML-Agents 설치 

__ML-Agents 파일 내려받기 

__유니티에 ML-Agents 설치하기 

__ML-Agents 파이썬 패키지 설치하기 

 

▣ 01장: 유니티와 ML-Agents 설치하기 

1.1 프로젝트 시작하기 

1.2 닷지 환경 구성하기 

1.3 스크립트 작성하기 

__1.3.1 스크립트 파일 생성 및 설정 

__1.3.2 DodgeScene 스크립트 

__1.3.3 BallScript 스크립트 

__1.3.4 Area 스크립트 

__1.3.5 DodgeAgent 스크립트 

1.4 닷지 환경 설정 및 환경 빌드 

 

▣ 02장: Proximal Policy Optimization (PPO) 

2.1 PPO 알고리즘의 개요 

2.2 PPO 알고리즘의 이론 

__2.2.1 PPO 알고리즘의 목적함수 

__2.2.2 PPO의 분산학습 

__2.2.3 PPO의 네트워크 구조 

__2.2.4 PPO 알고리즘의 학습 

__2.2.5 PPO 알고리즘의 성능 

2.3 PPO 코드 

__2.3.1 라이브러리 불러오기 

__2.3.2 파라미터 값 설정 

__2.3.3 Model 클래스 

__2.3.4 Agent 클래스 

__2.3.5 Main 함수 

__2.3.6 학습 결과 

2.4 mlagents-learn (파라미터 랜덤화) 

2.5 커리큘럼 학습 

__2.5.1 mlagents-learn을 이용한 커리큘럼 학습 

__2.5.2 Python-API를 이용한 커리큘럼 학습 

 

▣ 03장: 가변적인 입력 환경과 어텐션 

3.1 가변적인 입력 환경의 개요 

3.2 닷지 환경 수정(가변적인 입력 환경) 

3.3 어텐션 기법의 이론 

__3.3.1 멀티 헤드 어텐션 

__3.3.2 강화학습에서 어텐션의 적용 

3.4 어텐션 PPO 코드 

__3.4.1 라이브러리 불러오기 

__3.4.2 파라미터 값 설정 

__3.4.3 Model 클래스 

__3.4.4 Agent 클래스 

__3.4.5 Main 함수 

__3.4.6 학습 결과 

 

▣ 04장: 퐁 환경 만들기 

4.1 프로젝트 시작하기 

4.2 퐁 환경 구성하기 

4.3 스크립트 작성하기 

__4.3.1 스크립트 파일 생성 

__4.3.2 PongAgent 스크립트 

__4.3.3 EnvController 스크립트 

4.4 퐁 환경 설정 및 환경 빌드 

 

▣ 05장: 적대적 강화학습 

5.1 적대적 강화학습 개요 

5.2 적대적 PPO 코드 

__5.2.1 라이브러리 불러오기 

__5.2.2 파라미터 값 설정 

__5.2.3 Model 클래스 

__5.2.4 Agent 클래스 

__5.2.5 Main 함수 

__5.2.6 학습 결과 

5.3 mlagents-learn(적대적 강화학습) 

 

▣ 06장: 방탈출 환경 만들기 

6.1 프로젝트 시작하기 

6.2 방탈출 환경 구성하기 

6.3 스크립트 작성하기 

__6.3.1 스크립트 파일 생성 

__6.3.2 EnvController 스크립트 

__6.3.3 BlockAgent 스크립트 

6.4 방탈출 환경 설정 및 환경 빌드 

 

▣ 07장: MA-POCA 

7.1 COMA 알고리즘의 이론 

__7.1.1 COMA 알고리즘 개요 

__7.1.2 중앙화 크리틱, 탈중앙화 액터 

__7.1.3 반사실적 베이스라인 

__7.1.4 COMA 논문의 결과 

7.2 MA-POCA 알고리즘의 이론 

__7.2.1 MA-POCA 알고리즘 개요 

__7.2.2 MA-POCA의 가치함수 

__7.2.3 MA-POCA의 반사실적 베이스라인 

__7.2.4 MA-POCA 논문의 결과 

7.3 MA-POCA 코드 

__7.4.1 라이브러리 불러오기 

__7.4.2 파라미터 값 설정 

__7.4.3 Model 클래스 

__7.4.4 Agent 클래스 

__7.4.5 Main 함수 

__7.4.6 학습 결과 

7.4 mlagents-learn(MA-POCA) 

 

▣ 08장: 메이즈 환경 만들기 

8.1 프로젝트 시작하기 

8.2 메이즈 환경 구성하기 

8.3 스크립트 작성하기 

__8.3.1. 스크립트 파일 생성 

__8.3.2. HardExplorationAgent 스크립트 

8.4 메이즈 환경 설정 및 빌드하기 

 

▣ 09장: Random Network Distillation 

9.1 RND 알고리즘의 개요 

9.2 RND 알고리즘의 기법 

9.3 RND 알고리즘 구현 

9.4 RND 코드 

__9.4.1 라이브러리 불러오기 및 파라미터 값 설정하기 

__9.4.2 Model 클래스 

__9.4.3 RMS 클래스 

__9.4.4 Agent 클래스 

__9.4.5 Main 함수 

__9.4.6 학습 결과 

9.5 mlagents-learn(RND) 

 

▣ 10장: 투 미션 환경 만들기 

10.1 프로젝트 시작하기 

10.2 투 미션 환경 구성하기 

10.3 스크립트 작성하기 

__10.3.1 스크립트 파일 생성 

__10.3.2 TwoMissionAgent 스크립트 

__10.3.3 TwoMissionEnvController 스크립트 

__10.3.4 TwoMissionGoalDetect 스크립트 

10.4 투 미션 환경 설정 및 빌드하기 

 

▣ 11장: Hypernetworks 

11.1 Hypernetworks 알고리즘의 개요 

11.2 Hypernetworks 알고리즘의 기법 

11.3 Hypernetworks 코드 

__11.3.1 라이브러리 불러오기 및 파라미터 값 설정 

__11.3.2 Model 클래스 

__11.3.3 Agent 클래스 

__11.3.4 Main 함수 

__11.3.5 학습 결과 

11.4 mlagents-learn(HyperNetworks) 

 

▣ 12장: 마무리 

12.1 응용편 내용 정리 

12.2 책에서 다루지 않은 내용 

__12.2.1 순환 신경망 

__12.2.2 Soft Actor Critic 

12.3 유니티 머신러닝 에이전트 적용 사례 

__12.3.1 자율주행 연구 환경 구축 사례 

__12.3.2 머신러닝 에이전트를 이용한 유튜브 사례 

__12.3.3 산업 문제에 머신러닝 에이전트를 적용한 사례 

__12.3.4 상용 게임에 머신러닝 에이전트를 적용한 사례

출판사 서평

저자 소개
저자 : 민규식, 이현호, 박유민
도서리뷰 (0)
이 책을 읽고 어떤 느낌을 받으셨나요? 리뷰를 남기고 다른 독자들과 함께 공유해보세요.

등록된 리뷰가 없습니다

첫번째 리뷰어가 되어주세요

교환/반품/환불
반품/교환방법
  • 마이페이지 > 주문관리 > 주문/배송조회 > 주문조회 후  [1:1상담신청]  또는 고객센터 (1544-9020)
  • ※ 오픈마켓, 해외배송 주문상품 문의 시 [1:1상담신청] 또는 고객센터 (1544-9020)
반품/교환 가능기간
  • 변심반품의 경우 수령 후 7일 이내
  • 상품의 결함 및 계약내용과 다를 경우 문제점 발견 후 30일 이내
반품/교환비용
  • 단순변심 혹은 구매착오로 인한 반품/교환은 반송료 고객 부담
  • 해외직배송 도서 구매 후 단순변심에 의한 취소 및 반품 시 도서판매가의 20% 수수료 부과
반품/교환 불가 사유
  • 소비자의 책임 있는 사유로 상품 등이 손실 또는 훼손된 경우
  • 소비자의 사용, 포장 개봉에 의해 상품 등의 가치가 현저히 감소한 경우
    예) 만화, 잡지, 수험서 및 문제집류
  • 복제가 가능한 상품 등의 포장을 훼손한 경우
    예) 음반/DVD/비디오, 소프트웨어, 만화책, 잡지, 영상 화보집
  • 소비자의 요청에 따라 개별적으로 주문 제작되는 상품의 경우
  • 디지털 컨텐츠인 eBook, 오디오북 등을 1회 이상 다운로드를 받았을 경우
  • 시간의 경과에 의해 재판매가 곤란한 정도로 가치가 현저히 감소한 경우
  • 전자상거래 등에서의 소비자보호에 관한 법률이 정하는 소비자 청약철회 제한 내용에 해당되는 경우
상품 품절
  • 공급사(출판사) 재고 사정에 의해 품절/지연될 수 있으며, 품절 시 관련 사항에 대해서는 이메일과 문자로 안내드리겠습니다.
소비자 피해보상
환불지연에 따른 배상
  • 상품의 불량에 의한 교환, A/S, 환불, 품질보증 및 피해보상 등에 관한 사항은 소비자분쟁 해결 기준 (공정거래위원회 고시)에 준하여 처리됨
  • 대금 환불 및 환불지연에 따른 배상금 지급 조건, 절차 등은 전자상거래 등에서의 소비자 보호에 관한 법률에 따라 처리함

매장에서 사용할 수 있는 바코드가 있어요!