본문내용 바로가기
이벤트 무료배송

파이썬과 케라스로 배우는 강화학습 내 손으로 직접 구현하는 게임 인공지능

위키북스 데이터 사이언스 시리즈 4
이웅원 , 양혁렬, 김건우, 이영무, 이의령 지음 | 위키북스 | 2017년 07월 31일 출간

Klover 평점5명

  • 정가 : 27,000원
    판매가 : 24,300 [10%↓ 2,700원 할인]
  • 제휴할인가 : 18,220 교보-롯데카드 최대 25% 청구할인 카드/포인트 안내
  • 통합포인트 : 1,350 적립 [5% 적립]
  • 추가혜택 :
    naver네이버페이 결제 시 무조건 1% 추가 적립 payco페이코 결제 시 최대 1만원 적립 okcashbag 실 결제 금액의 0.5% 적립 안내
  • 배송비 : 무료 배송비 안내
  • 도착예정일 : 서울특별시 종로구 세종대로 기준 지역변경
    1일 이내 발송 예정 도착 예정일 안내
  • 바로드림 : 인터넷으로 주문하고 영업점에서 직접 수령 안내
행사도서 포함, 5만원이상 구매시 선택 (북백 2000P, 북파우치 1500P차감)
닫기
  • 행사도서 포함, 5만원이상 구매시 선택 (북백 2000P, 북파우치 1500P차감)
  • 단독 나를 지키는 구급함 증정 강상중 사유의 여정을 만나다
  • 단독 유시민 사인 피크닉 매트 증정 생각의 피크닉, 유시민 읽기
  • 독서노트 + 스티커 세트 증정 가을이라, 쓰고 읽는다
  • 내맘같은 내인생
  • 재테크 슈퍼 그뤠잇
  • 세상 모든 것의 기원을 만나다 오리진 캐릭터 스티치 노트 증정
  • 스무 살 패브릭 포스터 증정 O tvN 어쩌다 어른 X 교보문고 단독혜택
  • 어린이 가을독서 추천도서전

이 책의 이벤트 해외주문/바로드림/제휴사주문/업체배송건의 경우 1+1 증정상품이 발송되지 않습니다.

  • 동료 개발자들의 책장을 살펴보세요 :)
    2017.08.31 ~ 2018.12.31
  • 트래블워시백(청록색) 증정
    2017.08.10 ~ 2017.10.31
  • 웹개발 입문자를 위한 아주 약간의 가이드
    2017.07.11 ~ 2020.12.31
  • 설문참여 시 매월 5명 추첨통해 선물을 드립니다.
    10. 14 ~ 12. 31
상품상세정보
ISBN 9791158390723(1158390726)
쪽수 372쪽
크기 176 * 236 * 21 mm /817g 판형알림

책소개

이 책이 속한 분야

이 책의 주제어

“강화학습을 쉽게 이해하고 코드로 구현하기”

강화학습의 기초부터 최근 알고리즘까지 친절하게 설명한다! ‘알파고’로부터 받은 신선한 충격으로 많은 사람들이 강화학습에 관심을 가지기 시작했다. 하지만 처음 강화학습을 공부하는 분들을 위한 쉬운 자료나 강의를 찾아보기 어려웠다. 외국 강의를 통해 어렵게 이론을 공부하더라도 강화학습을 구현하는 데는 또 다른 장벽이 있었다. 이 책은 강화학습을 처음 공부하는 데 어려움을 겪는 독자를 위해 이론부터 코드 구현까지의 가이드를 제시한다.

상세이미지

파이썬과 케라스로 배우는 강화학습(위키북스 데이터 사이언스 시리즈 4) 도서 상세이미지

저자소개

저자 : 이웅원

저자 이웅원은 연세대학교 기계공학과를 졸업했다. '모두의연구소'에서 개최한 강화학습 스터디에 참여해 공부하면서 강화학습 관련 깃북(https://www.gitbook.com/book/dnddnjs/rl)을 작성했다. 현재는 제이마플에서 딥러닝을 사용해 소리를 인식하는 작업을 하고 있다.

저자 : 양혁렬

저자 양혁렬은 한양대학교에서 경영학과 컴퓨터 공학을 다중전공하고 있다. 현재는 음악/오디오 신호처리와 기계학습을 결합한 분야에 관심을 가지고 서울대학교 융합과학기술대학원의 음악 오디오 연구실에서 연구원으로 참여하고 있다.

저자 : 김건우

저자 김건우는 뉴욕대학교 컴퓨터 과학과에 재학 중이며 DeepCoding 그룹에서 딥러닝을 코딩에 적용하는 연구를 진행 중이다. 현재는 우버 샌프란시스코에서 소프트웨어 엔지니어 인턴으로 일하고 있다.

저자 : 이영무

저자 이영무는 중앙대학교 컴퓨터 공학과에 재학 중이며 '모두의연구소'에서 개최한 강화학습 스터디에서 공부했다. 현재 머신러닝, 딥러닝에 관련된 공부를 지속하고 있다.

저자 : 이의령

저자 이의령은 세종대학교에서 응용통계학과 경영학을 전공하고 졸업 후 스타트업에서 서버 개발 인턴으로 근무했다. 현재 '모두의연구소'에서 신호처리 관련 프로젝트를 진행하면서 머신러닝과 관련된 다양한 경험을 쌓고 있다.

목차

[1부] 강화학습 소개

▣ 1장: 강화학습 개요
강화학습의 개념
___스키너의 강화 연구
___우리 주변에서의 강화
___머신러닝과 강화학습
___스스로 학습하는 컴퓨터, 에이전트
강화학습 문제
___순차적 행동 결정 문제
___순차적 행동 결정 문제의 구성 요소
___방대한 상태를 가진 문제에서의 강화학습
강화학습의 예시: 브레이크아웃
___딥마인드에 의해 다시 빛을 본 아타리 게임
___브레이크아웃의 MDP와 학습 방법
정리
___강화학습의 개념
___강화학습 문제
___강화학습의 예시: 브레이크아웃

[2부] 강화학습 기초

▣ 2장: 강화학습 기초 1 - MDP와 벨만 방정식
MDP
___상태
___행동
___보상함수
___상태 변환 확률
___감가율
___정책
가치함수
___가치함수
___큐함수
벨만 방정식
___벨만 기대 방정식
___벨만 최적 방정식
정리
___MDP
___가치함수
___벨만 방정식

▣ 3장: 강화학습 기초 2 - 그리드월드와 다이내믹 프로그래밍
다이내믹 프로그래밍과 그리드월드
___순차적 행동 결정 문제
___다이내믹 프로그래밍
___격자로 이뤄진 간단한 예제: 그리드월드
다이내믹 프로그래밍 1: 정책 이터레이션
___강화학습 알고리즘의 흐름
___정책 이터레이션
___정책 평가
___정책 발전
___RLCode 깃허브 저장소
___정책 이터레이션 코드 설명
___정책 이터레이션 코드 실행
다이내믹 프로그래밍 2: 가치 이터레이션
___명시적인 정책과 내재적인 정책
___벨만 최적 방정식과 가치 이터레이션
___가치 이터레이션 코드 설명
___가치 이터레이션 코드 실행
다이내믹 프로그래밍의 한계와 강화학습
___다이내믹 프로그래밍의 한계
___모델 없이 학습하는 강화학습
정리
___다이내믹 프로그래밍과 그리드월드
___다이내믹 프로그래밍 1: 정책 이터레이션
___다이내믹 프로그래밍 2: 가치 이터레이션
___다이내믹 프로그래밍의 한계와 강화학습

▣ 4장: 강화학습 기초 3 - 그리드월드와 큐러닝
강화학습과 정책 평가 1: 몬테카를로 예측
___사람의 학습 방법과 강화학습의 학습 방법
___강화학습의 예측과 제어
___몬테카를로 근사의 예시
___샘플링과 몬테카를로 예측
강화학습과 정책 평가 2: 시간차 예측
___시간차 예측
강화학습 알고리즘 1: 살사
___살사
___살사 코드 설명
___살사 코드의 실행 및 결과
강화학습 알고리즘 2: 큐러닝
___살사의 한계
___큐러닝 이론
___큐러닝 코드 설명
___큐러닝 코드의 실행 결과
정리
___강화학습과 정책 평가 1: 몬테카를로 예측
___강화학습과 정책 평가 2: 시간차 예측
___강화학습 알고리즘 1: 살사
___강화학습 알고리즘 2: 큐러닝

[3부] 강화학습 심화

▣ 5장: 강화학습 심화 1 - 그리드월드와 근사함수
근사함수
___몬테카를로, 살사, 큐러닝의 한계
___근사함수를 통한 가치함수의 매개변수화
인공신경망
___인공신경망 1: 인공신경망의 개념
___인공신경망 2: 노드와 활성함수
___인공신경망 3: 딥러닝
___인공신경망 4: 신경망의 학습
인공신경망 라이브러리: 케라스
___케라스 소개
___간단한 케라스 예제
딥살사
___딥살사 이론
___딥살사 코드 설명
___딥살사의 실행 및 결과
폴리시 그레이디언트
___정책 기반 강화학습
___폴리시 그레이디언트
___REINFORCE 코드 설명
___REINFORCE의 실행 및 결과
정리
___근사함수
___인공신경망
___인공신경망 라이브러리: 케라스
___딥살사
___폴리시 그레이디언트

▣ 6장: 강화학습 심화 2 - 카트폴
알고리즘 1: DQN
___카트폴 예제의 정의
___DQN 이론
___DQN 코드 설명
___DQN 실행 및 결과
알고리즘 2: 액터-크리틱
___액터-크리틱 이론 소개
___액터-크리틱 코드 설명
___액터-크리틱 실행 및 결과
정리
___알고리즘 1: DQN
___알고리즘 2: 액터-크리틱

▣ 7장: 강화학습 심화 3 - 아타리
브레이크아웃 DQN
___아타리: 브레이크아웃
___컨볼루션 신경망(CNN)이란?
___브레이크아웃의 컨볼루션 신경망
___DQN 학습 전 준비 사항
___DQN 코드 설명
___텐서보드 사용법
___브레이크아웃 DQN 실행 및 결과
브레이크아웃 A3C
___DQN의 한계
___A3C란?
___멀티스레딩 소개
___브레이크아웃 A3C 코드 설명
___브레이크아웃 A3C 실행 결과
___브레이크아웃 DQN, A3C의 저장된 모델 플레이
정리
___브레이크아웃 DQN
___브레이크아웃 A3C

▣ 부록A: 학습결과 업로드
___오픈에이아이 짐의 다양한 예제
___오픈에이아이 짐에 학습 결과를 업로드

추천사

김남주(카카오브레인 AI 연구 총괄)

"간략한 이론 설명과 함께 실제로 돌아가는 풍부한 파이썬 예제를 통해 새로운 개념과 주제들을 쉽고 재미있게 소개해 나갑니다. 또한, 책 후반부에는 A3C와 같이 실제 연구에 사용되는 최신 강화학습 기법도 다룹니다. 덕분에 ... 더보기

김승일(모두의연구소 연구소)

"강화학습의 고전적인 이론뿐 아니라 최근의 연구 결과까지 이 한 권의 책으로 엮어 내고 있습니다. 또한 초보자도 쉽게 접할 수 있는 파이썬과 케라스를 통해 각 알고리즘을 구현하고, 아타리 게임이나 OpenAI Gym 시뮬레이... 더보기

정지훈(빅뱅엔젤스 매니징파트너)

"또 한 가지 이 책의 장점은 책에서 소개하는 다양한 예제들을 직접 github를 통해 접하고, 사용할 수 있다는 점이다. 향후 기술 발전으로 달라지는 내용이 생기더라도 그에 맞추어 예제들이 업데이트된다는 측면에서도 현재의 ... 더보기

출판사 서평

★ 이 책에서 다루는 내용 ★

◎ 강화학습의 배경과 개념
◎ 강화학습의 기초 이론: MDP, 벨만 방정식, 다이내믹 프로그래밍
◎ 고전 강화학습 알고리즘: 몬테카를로, 살사, 큐러닝
◎ 인공신경망을 이용한 강화학습 알고리즘: 딥살사, REINFORCE, DQN, 액터-크리틱, A3C
◎ 강화학습 알고리즘 구현: 그리드월드, 카트폴, 아타리게임

북로그 리뷰 (1) 전체보기 쓰러가기

도서 구매 후 리뷰를 작성하시면 통합포인트를 드립니다.
결제 90일 이내 작성 시 300원 / 발송 후 5일 이내 작성시 400원 / 이 상품의 첫 리뷰 작성 시 500원
(포인트 적립은 작성 후 다음 날 혹은 해당 도서 배송 출발 후 익일에 적립됩니다.
외서/eBook/음반/DVD/GIFT 및 잡지 상품 제외)
안내
  • 강화학습과 관련된 한글 책이 거의 없는 환경에서 이러한 책이 나와서 기쁘게 생각합니다. 지금까지 다른 인공지능, 딥러닝 책에서는 강화학습이 있다고 하더라도 정말 향기만 남기고 간 수준이었고 제대로 공부하기 위해서 서튼의 책을 보는순간...절망했던 적이 강화학습을 공부하셨던 분들이라면 한번쯤 있을 것입니다.   이 책은 강화학습에 입문하기에 가장 적합한 책입니다. 최대한 수식은 간결하게 / 문장으로 개념을 잡고가는 컨셉으로 머신러닝을 깊게 공부하지 않으신 분들이라도 쉽게 읽을 수 있습니다. 다만 개인적으로는 저자들이... 더보기

Klover 평점/리뷰 (0)

교환/반품/품절안내

※ 상품 설명에 반품/교환 관련한 안내가 있는 경우 그 내용을 우선으로 합니다. (업체 사정에 따라 달라질 수 있습니다.)

교환/반품/품절안내
반품/교환방법 마이룸 > 주문관리 > 주문/배송내역 > 주문조회 > 반품/교환신청 ,
[1:1상담>반품/교환/환불] 또는 고객센터 (1544-1900)

※ 오픈마켓, 해외배송주문, 기프트 주문시 [1:1상담>반품/교환/환불]
    또는 고객센터 (1544-1900)
반품/교환가능 기간 변심반품의 경우 수령 후 7일 이내,
상품의 결함 및 계약내용과 다를 경우 문제점 발견 후 30일 이내
반품/교환비용 변심 혹은 구매착오로 인한 반품/교환은 반송료 고객 부담
반품/교환 불가 사유
  • 소비자의 책임 있는 사유로 상품 등이 손실 또는 훼손된 경우
    (단지 확인을 위한 포장 훼손은 제외)
  • 소비자의 사용, 포장 개봉에 의해 상품 등의 가치가 현저히 감소한 경우
    예) 화장품, 식품, 가전제품(악세서리 포함) 등
  • 복제가 가능한 상품 등의 포장을 훼손한 경우
    예) 음반/DVD/비디오, 소프트웨어, 만화책, 잡지, 영상 화보집
  • 소비자의 요청에 따라 개별적으로 주문 제작되는 상품의 경우 ((1)해외주문도서)
  • 디지털 컨텐츠인 eBook, 오디오북 등을 1회 이상 다운로드를 받았을 경우
  • 시간의 경과에 의해 재판매가 곤란한 정도로 가치가 현저히 감소한 경우
  • 전자상거래 등에서의 소비자보호에 관한 법률이 정하는 소비자 청약철회 제한 내용에
    해당되는 경우
(1) 해외주문도서 : 이용자의 요청에 의한 개인주문상품으로 단순변심 및 착오로 인한 취소/교환/반품 시 ‘해외주문 반품/취소 수수료’ 고객 부담 (해외주문 반품/취소 수수료 : ①양서-판매정가의 12%, ②일서-판매정가의 7%를 적용)
상품 품절 공급사(출판사) 재고 사정에 의해 품절/지연될 수 있으며, 품절 시 관련 사항에 대해서는
이메일과 문자로 안내드리겠습니다.
소비자 피해보상
환불지연에 따른 배상
  • 상품의 불량에 의한 교환, A/S, 환불, 품질보증 및 피해보상 등에 관한 사항은
    소비자분쟁해결 기준 (공정거래위원회 고시)에 준하여 처리됨
  • 대금 환불 및 환불지연에 따른 배상금 지급 조건, 절차 등은 전자상거래 등에서의
    소비자 보호에 관한 법률에 따라 처리함

이 분야의 베스트

더보기+

이 분야의 신간

  • 길벗알앤디
    18,900원
  • 김진중
    19,800원
  • 이운희(땡글닷컴 쌍둥아빠)
    14,400원
  • 허팝
    13,500원
  • 김태영
    22,500원
더보기+

바로가기

  • 우측 확장형 배너 2

최근 본 상품