본문내용 바로가기
MD의선택 무료배송 사은품 소득공제

수학으로 풀어보는 강화학습 원리와 알고리즘 딥러닝과 강화학습을 이해하기 위한 필수 수학 이론부터 | 다양한 강화학습 알고리즘, 모델 기반 강화학습까지

위키북스 데이터 사이언스 시리즈 73
박성수 지음 | 위키북스 | 2021년 09월 17일 출간
클로버 리뷰쓰기
  • 정가 : 30,000원
    판매가 : 27,000 [10%↓ 3,000원 할인]
  • 혜택 :
    [기본적립] 1500원 적립 [5% 적립] [추가적립] 5만원 이상 구매 시 2,000원 추가적립 안내 [회원혜택] 회원 등급 별, 3만원 이상 구매 시 2~4% 추가적립 안내 [리뷰적립] 리뷰 작성 시 e교환권 최대 300원 추가적립 안내
  • 추가혜택 : 포인트 안내 도서소득공제 안내 추가혜택 더보기
  • 배송비 : 무료 배송비 안내
  • 배송일정 : 서울특별시 종로구 세종대로 기준 지역변경
    당일배송 지금 주문하면 오늘(30일,화) 도착 예정 배송일정 안내
  • 바로드림 : 인터넷으로 주문하고 매장에서 직접 수령 안내 바로드림 혜택
    휴일에는 바로드림 픽업으로 더 빨리 받아 보세요. 바로드림 혜택받고 이용하기

이 책의 이벤트

해외주문/바로드림/제휴사주문/업체배송건의 경우 1+1 증정상품이 발송되지 않습니다.
  • 2021 올해의 IT 책 투표하고 e-교환권 받으세요!(선착순 ..
    2021.11.22 ~ 2021.12.03
  • 컴퓨터/IT 도서 2만원 이상 구매 시 개발자 매거진 사은품 선..
    2021.11.11 ~ 2021.12.31
  • 2022 캘린더 수록한 IT독자를 위한 readIT 노트 사은품
    2021.10.14 ~ 2021.12.31
상품상세정보
ISBN 9791158392734(1158392737)
쪽수 436쪽
크기 189 * 239 * 25 mm /938g 판형알림

책소개

이 책이 속한 분야

코딩하면서 알고리즘이 유도된 과정이 궁금하다면 이 책을 선택하기 바랍니다!
이 책은 딥러닝이나 강화학습 예제를 코딩하면서 그 배경 알고리즘의 유도 과정을 궁금해하는 사람을 위한 책이다. 술술 읽히는 책은 아니지만, 그렇다고 심하게 어려운 책도 아니다. 수학의 선수 지식으로 대학 2학년 때 배우는 공업수학을 이수한 정도면 충분하고, 딥러닝의 선수 지식으로는 텐서플로 또는 파이토치를 사용하여 MNIST와 같은 간단한 딥러닝 예제를 따라해 본 정도면 충분하다.

이 책은 강화학습뿐만 아니라 다른 머신러닝과 딥러닝의 기초가 되는 확률이론과 추정론에 대한 기본적인 이해를 바탕으로 강화학습의 여러 알고리즘을 처음부터 끝까지 생략하지 않고 수식으로 유도했다.

강화학습이 추구하는 기본 목표로부터 A2C, A3C, PPO, DDPG, SAC 및 모델 기반 강화학습 등 강화학습의 알고리즘이 무엇이고 어떤 목적으로 개발됐는지, 어떻게 수학적으로 유도했는지, 그리고 어떻게 코드로 구현해 적용했는지를 구체적으로 설명한다.

★ 이 책에서 다루는 내용 ★

◎ 강화학습을 이해하기 위한 기본 수학: 확률론, 추정론, 최적화, 벡터/행렬의 미분
◎ 강화학습 알고리즘: A2C, A3C, PPO, DDPG, SAC
◎ 최적제어 알고리즘: 반복적 LQR, 가우시안 LQR
◎ 로컬 모델 기반 강화학습: GMM, 모델 피팅 방법, LQR을 이용한 강화학습

상세이미지

수학으로 풀어보는 강화학습 원리와 알고리즘(위키북스 데이터 사이언스 시리즈 73) 도서 상세이미지

목차

▣ 01장: 강화학습 수학
1.1 확률과 랜덤 변수
___1.1.1 확률
___1.1.2 랜덤 변수
___1.1.3 누적분포함수와 확률밀도함수
___1.1.4 결합 확률함수
___1.1.5 조건부 확률함수
___1.1.6 독립 랜덤 변수
___1.1.7 랜덤 변수의 함수
___1.1.8 베이즈 정리
___1.1.9 샘플링
1.2 기댓값과 분산
___1.2.1 기댓값
___1.2.2 분산
___1.2.3 조건부 기댓값과 분산
1.3 랜덤벡터
___1.3.1 정의
___1.3.2 기댓값과 공분산 행렬
___1.3.3 샘플 평균
1.4 가우시안 분포
1.5 랜덤 시퀀스
___1.5.1 정의
___1.5.2 평균함수와 자기 상관함수
___1.5.3 마르코프 시퀀스
1.6 선형 확률 차분방정식
1.7 표기법
1.8 중요 샘플링
1.9 엔트로피
1.10 KL 발산
1.11 추정기
___1.11.1 최대사후 추정기
___1.11.2 최대빈도 추정기
1.12 벡터와 행렬의 미분
___1.12.1 벡터로 미분
___1.12.2 행렬로 미분
1.13 촐레스키 분해
1.14 경사하강법
___1.14.1 배치 경사하강법
___1.14.2 확률적 경사하강법
1.15 경사하강법의 개선
___1.15.1 모멘텀
___1.15.2 RMSprop
___1.15.3 아담
1.16 손실함수의 확률론적 해석
___1.16.1 가우시안 오차 분포
___1.16.2 베르누이 오차 분포

▣ 02장: 강화학습 개념
2.1 강화학습 개요
2.2 강화학습 프로세스와 표기법
2.3 마르코프 결정 프로세스
___2.3.1 정의
___2.3.2 가치함수
___2.3.3 벨만 방정식
___2.3.4 벨만 최적 방정식
2.4 강화학습 방법

▣ 03장: 정책 그래디언트
3.1 배경
3.2 목적함수
3.3 정책 그래디언트
3.4 REINFORCE 알고리즘

▣ 04장: A2C
4.1 배경
4.2 그래디언트의 재구성
4.3 분산을 감소시키기 위한 방법
4.4 A2C 알고리즘
4.5 A2C 알고리즘 구현
___4.5.1 테스트 환경
___4.5.2 코드 개요
___4.5.3 액터 클래스
___4.5.4 크리틱 클래스
___4.5.5 에이전트 클래스
___4.5.6 학습 결과
___4.5.7 전체 코드

▣ 05장: A3C
5.1 배경
5.2 그래디언트 계산의 문제
___5.2.1 샘플의 상관관계
___5.2.2 n-스텝 가치 추정
5.3 비동기 액터-크리틱(A3C) 알고리즘
5.4 그래디언트 병렬화 방식의 A3C 알고리즘 구현
___5.4.1 테스트 환경
___5.4.2 코드 개요
___5.4.3 액터 클래스
___5.4.4 크리틱 클래스
___5.4.5 에이전트 클래스
___5.4.6 학습 결과
___5.4.7 전체 코드
5.5 데이터 병렬화 방식의 A3C 알고리즘 구현
___5.5.1 코드 개요
___5.5.2 전체 코드

▣ 06장: PPO
6.1 배경
6.2 그래디언트의 재구성
6.3 정책 업데이트와 성능
6.4 PPO 알고리즘
6.5 어드밴티지 추정의 일반화 (GAE)
6.6 PPO 알고리즘 구현
___6.6.1 테스트 환경
___6.6.2 코드 개요
___6.6.3 액터 클래스
___6.6.4 크리틱 클래스
___6.6.5 에이전트 클래스
___6.6.6 학습 결과
___6.6.7 전체 코드

▣ 07장: DDPG
7.1 배경 240
7.2 그래디언트의 재구성
7.3 DDPG 알고리즘
7.4 DDPG 알고리즘 구현
___7.4.1 테스트 환경
___7.4.2 코드 개요
___7.4.3 액터 클래스
___7.4.4 크리틱 클래스
___7.4.5 액터-크리틱 에이전트 클래스
___7.4.6 학습 결과
___7.4.7 전체 코드

▣ 08장: SAC
8.1 배경
8.2 소프트 벨만 방정식
8.3 소프트 정책 개선
8.4 SAC 알고리즘
8.5 SAC 알고리즘 구현
___8.5.1 테스트 환경
___8.5.2 코드 개요
___8.5.3 액터 클래스
___8.5.4 크리틱 클래스
___8.5.5 에이전트 클래스
___8.5.6 학습 결과
___8.5.7 전체 코드

▣ 09장: 모델 기반 강화학습 기초
9.1 배경
9.2 최적제어
___9.2.1 LQR
___9.2.2 확률적 LQR
___9.2.3 가우시안 LQR
___9.2.4 반복적 LQR
9.3 모델 학습 방법

▣ 10장: 로컬 모델 기반 강화학습
10.1 배경
10.2 로컬 모델 피팅 기반 LQR
10.3 로컬 모델 피팅
___10.3.1 조건부 가우시안 방법
___10.3.2 GMM 사전분포를 이용한 로컬 모델 업데이트
10.4 로컬 제어 법칙 업데이트
___10.4.1 대체 비용함수 계산
___10.4.2 KL 발산 계산
___10.4.3 h 조정
___10.4.4 e 조정
10.5 가우시안 LQR을 이용한 강화학습 알고리즘
10.6 가우시안 LQR을 이용한 강화학습 알고리즘 구현
___10.6.1 테스트 환경
___10.6.2 코드 개요
___10.6.3 궤적 생성
___10.6.4 로컬 모델 피팅
___10.6.5 가우시안 LQR
___10.6.6 가우시안 혼합 모델
___10.6.7 LQR-FLM 에이전트 클래스
___10.6.8 학습 결과
___10.6.9 전체 코드
10.7 GPS로의 발전

▣ 참고문헌

Klover 리뷰 (0)

북로그 리뷰 (0) 쓰러가기

북로그 리뷰는 본인 인증 후 작성 가능합니다.
책이나 타인에 대해 근거 없이 비방을 하거나 타인의 명예를 훼손할 수 있는 내용은 비공개 처리 될 수 있습니다.
※ 북로그 리뷰 리워드 제공 2021. 4. 1 종료

문장수집 (0) 문장수집 쓰기 나의 독서기록 보기
※구매 후 문장수집 작성 시, 리워드를 제공합니다. 안내

교환/반품/품절안내

※ 상품 설명에 반품/교환 관련한 안내가 있는 경우 그 내용을 우선으로 합니다. (업체 사정에 따라 달라질 수 있습니다.)

교환/반품/품절안내
반품/교환방법 마이룸 > 주문관리 > 주문/배송내역 > 주문조회 > 반품/교환신청 ,
[1:1상담>반품/교환/환불] 또는 고객센터 (1544-1900)

※ 오픈마켓, 해외배송주문, 기프트 주문시 [1:1상담>반품/교환/환불]
    또는 고객센터 (1544-1900)
반품/교환가능 기간 변심반품의 경우 수령 후 7일 이내,
상품의 결함 및 계약내용과 다를 경우 문제점 발견 후 30일 이내
반품/교환비용 변심 혹은 구매착오로 인한 반품/교환은 반송료 고객 부담
반품/교환 불가 사유
  • 소비자의 책임 있는 사유로 상품 등이 손실 또는 훼손된 경우
    (단지 확인을 위한 포장 훼손은 제외)
  • 소비자의 사용, 포장 개봉에 의해 상품 등의 가치가 현저히 감소한 경우
    예) 화장품, 식품, 가전제품(악세서리 포함) 등
  • 복제가 가능한 상품 등의 포장을 훼손한 경우
    예) 음반/DVD/비디오, 소프트웨어, 만화책, 잡지, 영상 화보집
  • 소비자의 요청에 따라 개별적으로 주문 제작되는 상품의 경우 ((1)해외주문도서)
  • 디지털 컨텐츠인 eBook, 오디오북 등을 1회 이상 다운로드를 받았을 경우
  • 시간의 경과에 의해 재판매가 곤란한 정도로 가치가 현저히 감소한 경우
  • 전자상거래 등에서의 소비자보호에 관한 법률이 정하는 소비자 청약철회 제한 내용에
    해당되는 경우
(1) 해외주문도서 : 이용자의 요청에 의한 개인주문상품으로 단순변심 및 착오로 인한 취소/교환/반품 시 ‘해외주문 반품/취소 수수료’ 고객 부담 (해외주문 반품/취소 수수료 : ①서양도서-판매정가의 12%, ②일본도서-판매정가의 7%를 적용)
상품 품절 공급사(출판사) 재고 사정에 의해 품절/지연될 수 있으며, 품절 시 관련 사항에 대해서는
이메일과 문자로 안내드리겠습니다.
소비자 피해보상
환불지연에 따른 배상
  • 상품의 불량에 의한 교환, A/S, 환불, 품질보증 및 피해보상 등에 관한 사항은
    소비자분쟁해결 기준 (공정거래위원회 고시)에 준하여 처리됨
  • 대금 환불 및 환불지연에 따른 배상금 지급 조건, 절차 등은 전자상거래 등에서의
    소비자 보호에 관한 법률에 따라 처리함
바로가기
  • 우측 확장형 배너 2
  • 우측 확장형 배너 2
최근 본 상품