본문내용 바로가기
MD의선택 무료배송 이벤트 소득공제

파이썬으로 웹 크롤러 만들기 초간단 나만의 웹 크롤러로 원하는 데이터를 가져오는 방법

라이언 미첼 지음 | 한선용 옮김 | 한빛미디어 | 2016년 12월 01일 출간
| 5점 만점에 5점 리뷰 6개 리뷰쓰기

이 책의 다른 상품 정보

  • 정가 : 24,000원
    판매가 : 21,600 [10%↓ 2,400원 할인]
  • 통합포인트 :
    [기본적립] 1,200원 적립 [5% 적립] [추가적립] 5만원 이상 구매 시 2천원 추가적립 안내 [회원혜택] 실버등급 이상, 3만원 이상 구매 시 2~4% 추가적립 안내
  • 추가혜택 : 포인트 안내 도서소득공제 안내 추가혜택 더보기
  • 배송비 : 무료 배송비 안내
  • 개정정보 : 2019년 03월 출간된 개정판이 있습니다. 개정판 보기
  • 도서상태 : 절판

이 책의 이벤트 해외주문/바로드림/제휴사주문/업체배송건의 경우 1+1 증정상품이 발송되지 않습니다.

  • 새로 나온 O'Reilly 번역서를 확인해보세요!
    2019.06.14 ~ 2020.12.31
  • 개발자의 오랜친구, 한빛미디어의 책을 편리하게 모아보세요
    2017.11.22 ~ 2019.12.31
  • 웹개발 입문자를 위한 아주 약간의 가이드
    2017.07.11 ~ 2020.12.31
  • #리드잇 페이스북 페이지 팔로우 하시고, 신간소식 빠르게 받아보..
    2017.06.22 ~ 2025.07.31
  • MANNING, O'REILLY, PACKT, WILE..
    2016.03.07 ~ 2020.12.31
상품상세정보
ISBN 9788968484698(8968484694)
쪽수 284쪽
크기 184 * 237 * 15 mm /511g 판형알림
원서명/저자명 Web Scraping with Python/Ryan Mitchell

책소개

이 책이 속한 분야

웹 어디서든 내가 원하는 데이터를 쏙쏙쏙

웹에 존재한다면 그것이 어떤 형태이든 데이터로 추출할 수 있다. 필요한 무기는 이 책과 파이썬뿐. BeautifulSoup, 셀레니움, 테서랙트 등 강력한 파이썬 라이브러리 사용법과 함께 API, 인증, 이미지 및 텍스트 인식, 로그인 처리 등 웹 크롤링의 기초부터 고급 기법까지 종합적으로 다루는 유일한 책. 실제 업무와 생활에 적용할 수 있는 예제를 통해 일상의 데이터 분석가가 될 수 있다.

상세이미지

파이썬으로 웹 크롤러 만들기 도서 상세이미지

저자소개

저자 : 라이언 미첼

저자 라이언 미첼 Ryan Mitchell은 웹 크롤링, 보안, 데이터 과학에 관심이 많은 개발자. 현재 글로벌 펀드사 헤지서브(HedgeServ)에서 시니어 개발자로 근무하고 있습니다. 프랭클린 W. 올린 공과대학교를 졸업했고 하버드 대학교에서 소프트웨어 엔지니어링 석사 과정을 밟았습니다. 어바인(Abine)에서 웹 크롤러와 봇을 만들었고, 링크드라이브(LinkeDrive)에서는 API 및 데이터 분석 도구를 만들었습니다. 금융업 및 유통업 분야에서 웹 크롤링 프로젝트 컨설팅을 하고 있고, 교육과 강연 활동도 활발하게 펼치고 있습니다. 본서 외 저서로 『Instant Web Scraping with Java』(Packt, 2013)가 있습니다.

저자가 속한 분야

역자 한선용은 웹 표준과 자바스크립트에 관심이 많은 번역가. 2008년부터 웹 관련 일을 했으며, ‘WCAG 2.0을 위한 일반적 테크닉’ 등의 문서를 번역해 웹에 올렸습니다. 번역서로 『한 권으로 끝내는 Node & Express』(2015), 『자바스크립트를 말하다』(2014), 『데이터 시각화를 위한 데이터 인사이트』(2014), 『모던 웹을 요리하는 초간편 HTML5 Cookbook』(2012), 『Head First jQuery』(2012), 『jQuery Mobile』(2012), 『자바스크립트 성능 최적화』(2011, 이상 한빛미디어), 『자바스크립트 프로그래밍』(2013), 『처음 배우는 jQuery』(2012), 『에릭 마이어의 CSS 노하우』(2011, 이상 인사이트) 등이 있습니다.

한선용님의 최근작

전체작품보기

목차

CHAPTER 1 첫 번째 웹 스크레이퍼
1.1.연결
1.2.BeautifulSoup 소개

CHAPTER 2 고급 HTML 분석
2.1.닭 잡는 데 소 잡는 칼을 쓸 필요는 없습니다
2.2.다시 BeautifulSoup
2.3.정규 표현식
2.4.정규 표현식과 BeautifulSoup
2.5.속성에 접근하기
2.6.람다 표현식
2.7.BeautifulSoup를 넘어

CHAPTER 3 크롤링 시작하기
3.1.단일 도메인 내의 이동
3.2.전체 사이트 크롤링
3.3.인터넷 크롤링
3.4.스크래파이를 사용한 크롤링

CHAPTER 4 API 사용
4.1.API는 어떻게 동작하는가
4.2.공통 표기법
4.3.응답
4.4.에코 네스트
4.5.트위터
4.6.구글 API
4.7.JSON 파싱
4.8.모든 것을 하나로
4.9.마치며

CHAPTER 5 데이터 저장
5.1.미디어 파일
5.2.데이터를 CSV로 저장
5.3.MySQL
5.4.이메일

CHAPTER 6 문서 읽기
6.1.문서 인코딩
6.2.텍스트
6.3.CSV
6.4.PDF
6.5.마이크로소프트 워드와 .docx

CHAPTER 7 지저분한 데이터 정리하기
7.1.코드로 정리하기
7.2.사후 정리

CHAPTER 8 자연어 읽고 쓰기
8.1.데이터 요약
8.2.마르코프 모델
8.3.자연어 툴킷
8.4.추가 자료

CHAPTER 9 폼과 로그인 뚫기
9.1.파이썬 requests 라이브러리
9.2.기본적인 폼 전송
9.3.라디오 버튼, 체크박스, 기타 필드
9.4.파일과 이미지 전송
9.5.로그인과 쿠키 처리
9.6.기타 폼 문제

CHAPTER 10 자바스크립트 스크레이핑
10.1.자바스크립트에 관한 간단한 소개
10.2.Ajax와 동적 HTML
10.3.리다이렉트 처리

CHAPTER 11 이미지 처리와 텍스트 인식
11.1.라이브러리 개관
11.2.형식이 일정한 텍스트 처리
11.3.CAPTCHA 읽기와 테서랙트 훈련
11.4.CAPTCHA 가져오기와 답 보내기

CHAPTER 12 스크레이핑 함정 피하기
12.1.스크레이핑의 윤리에 관해
12.2.사람처럼 보이기
12.3.널리 쓰이는 폼 보안 기능
12.4.사람처럼 보이기 위한 체크리스트

CHAPTER 13 스크레이퍼로 웹사이트 테스트하기
13.1.테스트 입문
13.2.파이썬 unittest
13.3.셀레니움을 사용한 테스트
13.4.unittest vs 셀레니움

CHAPTER 14 원격 스크레이핑
14.1.원격 서버를 쓰는 이유
14.2.토르
14.3.원격 호스팅
14.4.추가 자료
14.5.미래를 향해

APPENDIX A 파이썬 훑어보기
A.1.설치와 ‘Hello, World!’

APPENDIX B 인터넷 훑어보기

APPENDIX C 웹 스크레이핑의 합법성과 윤리
C.1.상표? 저작권? 특허?
C.2.동산 침해
C.3.컴퓨터 사기와 악용에 관한 법률
C.4.robots.txt와 이용 약관
C.5.세 가지 웹 스크레이퍼 사례

추천사

에릭 반위크(컴퓨터 엔지니어)

이 책에 나오는 예제와 도구를 이용해 여러 반복 업무를 자동화할 수 있었고, 그 시간을 더 흥미로운 일에 쓸 수 있었다. 결과를 바로 확인할 수 있고, 실제 업무나 생활에서 접하는 문제를 예제로 설명하여 빠르고 쉽게 읽을 수... 더보기

클리프 추(Carousell 데이터 분석가)

웹에서 데이터를 모으고 싶다는 생각을 한 번이라도 해봤다면 이 책을 읽어보길 권한다. 이미 크롤링을 해본 적이 있다면 더욱 도움이 될 것이다. 크롤링을 막는 페이지를 만난 적이 있다면? 이 책은 크롤러가 ‘인간’처럼 보이게 ... 더보기

출판사 서평

복잡 다양한 웹에서 우아하게 데이터를 수집하는 방법 A to Z

우리는 생활 속의 많은 부분이 인터넷에서 이루어지는 시대에 살고 있습니다. 그 어느 때보다 많은 데이터로 넘쳐나는 웹 세상에서 필요한 데이터를 가져와 분석하는 일의 중요성도 커졌습니다. 인터넷을 활보하며 데이터를 수집하는 프로그램을 웹 크롤러 혹은 웹 스크레이퍼라고 합니다. 웹 크롤러는 데이터 수집을 자동화하므로 비즈니스 의사 결정에 큰 도움이 되고, 웹사이트 스캐너로 활용할 수도 있어 보안 분야에서도 사용됩니다.
웹 크롤링은 인증 같은 웹 기술에 대한 이해는... 더보기

북로그 리뷰 (6) 전체보기 쓰러가기

도서 구매 후 리뷰를 작성하시면
결제 90일 이내 300원, 발송 후 5일 이내 400원, 이 상품의 첫 리뷰 500원의 포인트를 드립니다.

포인트는 작성 후 다음 날 적립되며, 도서 발송 전 작성 시에는 발송 후 익일에 적립됩니다.
북로그 리뷰는 본인인증을 거친 회원만 작성 가능합니다.
(※ 외서/eBook/음반/DVD/GIFT 및 잡지 상품 제외) 안내
  • 웹에 존재한다면 그것이 어떤 형태이든 데이터로 추출할 수 있다. 필요한 무기는 이 책과 파이썬뿐. BeautifulSoup, 셀레니움, 테서랙트 등 강력한 파이썬 라이브러리 사용법과 함께 API, 인증, 이미지 및 텍스트 인식, 로그인 처리 등 웹 크롤링의 기초부터 고급 기법까지 종합적으로 다루는 유일한 책. 실제 업무와 생활에 적용할 수 있는 예제를 통해 일상의 데이터 분석가가 될 수 있다.그러나 이 책은 크롤링의 전체적인 플로우와 기본 설정 및 사용법, 그리고 간단한 실습까지 완벽했던 것 같다.이것들을 가지고 어떻게 응용하느냐는... 더보기
  • 최근에 미니 프로젝트로 생각해 둔 것이 있었는데, 매일 뉴스 기사에서 단어를 수집할 필요가 있었다. 그리고 파이썬으로 프로젝트를 해보고 싶은 생각도 있었는데 마침 필요한 것들이 전부 있는 책이 손에 들어왔다. HTML파싱에 필요한 라이브러리부터 문서 포맷 파싱, 자연어처리, 이미지 인식, 유닛 테스트까지 다루지 않는 부분이 없는 엄청난 책이었다. 전문서를 읽으면서 가끔 묘한 느낌이 들 때가 있는데 이 책이 그랬다. 책의 두께로만 봐서는 도저히 각 챕터를 전부 다룰 수 없을 것 같은데 정말 그렇게 하고 있었다. 초보자의 관점에서 ... 더보기
  •   전 세계가 네트워크를 통해 하나로 연결된 시대이다. 우리 삶도 스마트폰을 통해 온라인과 오프라인을 분명히 나눌 수 없을 정도로 깊이 엮여 있다. 그래서 사람들의 생활과 관심사가 그대로 드러나는 웹은 가공되지 않은 수많은 정보의 보고이다.   그런데 이 웹에서 특정 목적에 적합한 정보를 대규모로 수집하는 것은 사람의 손으로는 하기 힘든 일이다. 그래서 웹에서 정보를 수집해주는 기능을 전문적으로 하는 프로그램이 존재한다. 이 프로그램은 흔히 봇이라는 이름으로도 불리는데, 이 봇을 만들어 데이터를 모아서 DB... 더보기
  • 이 도서는 파이썬을 기초 수준으로 알고 있는 사람에게 웹 크롤러(Web Crawler)를 만드는 방법을 단계별로 친절하게 알려준다. 1. 왜 읽어야 하나요? 수년 전부터 오픈 웹, 오픈 API 등의 용어가 범람하고 있다. 우리가 알고 있는 각종 포털 및 SNS 사이트부터 공공기관까지 대부분의 웹 서비스 업체는 자신들이 생산하는 데이터를 활용할 수 있는 방법을 제공한다. 참고: 대한민국 정부는 공공기관의 데이터를 민간에게 공개하는 것을 골자로 하는 정부 3.0 이라는 정책하에 공공데이터포털(www.data.go... 더보기
  • 파이썬으로 웹 크롤러 만들기  - 초간단 나만의 웹 크롤러로   원하는 데이터를 가져오는 방법 웹 크롤러를 만든다는 제목의 이 책은 말 그대로  파이썬으로 웹 크롤러를 제작하는 방법을 알려주고 있습니다. 웹 크롤러가 뭔지도 모르는 사람이지만, 프로그래밍에 관심있는  사람이나, 웹 크롤러가 뭔지는 들어봤지만, 실제로 만들어 본적은 없는 사람들에게 크롤러에 대한 구조나 정보등을 알 수 있는  입문서로서 좋은 역할을 할 수 있는 책... 더보기

Klover 평점/리뷰 (0)

문장수집 (0) 문장수집 쓰기 나의 독서기록 보기
※구매도서의 문장수집을 기록하면 통합포인트 적립 안내

스토리K 1건의 스토리K가 있습니다.

    교환/반품/품절안내

    ※ 상품 설명에 반품/교환 관련한 안내가 있는 경우 그 내용을 우선으로 합니다. (업체 사정에 따라 달라질 수 있습니다.)

    교환/반품/품절안내
    반품/교환방법 마이룸 > 주문관리 > 주문/배송내역 > 주문조회 > 반품/교환신청 ,
    [1:1상담>반품/교환/환불] 또는 고객센터 (1544-1900)

    ※ 오픈마켓, 해외배송주문, 기프트 주문시 [1:1상담>반품/교환/환불]
        또는 고객센터 (1544-1900)
    반품/교환가능 기간 변심반품의 경우 수령 후 7일 이내,
    상품의 결함 및 계약내용과 다를 경우 문제점 발견 후 30일 이내
    반품/교환비용 변심 혹은 구매착오로 인한 반품/교환은 반송료 고객 부담
    반품/교환 불가 사유
    • 소비자의 책임 있는 사유로 상품 등이 손실 또는 훼손된 경우
      (단지 확인을 위한 포장 훼손은 제외)
    • 소비자의 사용, 포장 개봉에 의해 상품 등의 가치가 현저히 감소한 경우
      예) 화장품, 식품, 가전제품(악세서리 포함) 등
    • 복제가 가능한 상품 등의 포장을 훼손한 경우
      예) 음반/DVD/비디오, 소프트웨어, 만화책, 잡지, 영상 화보집
    • 소비자의 요청에 따라 개별적으로 주문 제작되는 상품의 경우 ((1)해외주문도서)
    • 디지털 컨텐츠인 eBook, 오디오북 등을 1회 이상 다운로드를 받았을 경우
    • 시간의 경과에 의해 재판매가 곤란한 정도로 가치가 현저히 감소한 경우
    • 전자상거래 등에서의 소비자보호에 관한 법률이 정하는 소비자 청약철회 제한 내용에
      해당되는 경우
    (1) 해외주문도서 : 이용자의 요청에 의한 개인주문상품으로 단순변심 및 착오로 인한 취소/교환/반품 시 ‘해외주문 반품/취소 수수료’ 고객 부담 (해외주문 반품/취소 수수료 : ①양서-판매정가의 12%, ②일서-판매정가의 7%를 적용)
    상품 품절 공급사(출판사) 재고 사정에 의해 품절/지연될 수 있으며, 품절 시 관련 사항에 대해서는
    이메일과 문자로 안내드리겠습니다.
    소비자 피해보상
    환불지연에 따른 배상
    • 상품의 불량에 의한 교환, A/S, 환불, 품질보증 및 피해보상 등에 관한 사항은
      소비자분쟁해결 기준 (공정거래위원회 고시)에 준하여 처리됨
    • 대금 환불 및 환불지연에 따른 배상금 지급 조건, 절차 등은 전자상거래 등에서의
      소비자 보호에 관한 법률에 따라 처리함

    이 분야의 베스트

    • 길벗R&D
      17,100원
    • 길벗R&D
      12,600원
    • 이남호
      23,310원
    • 조블리(조애리)
      20,700원
    • 윤인성
      16,200원
    더보기+

    이 분야의 신간

    더보기+

    이 책의 연관도서

    • 이강성
      31,500원
    • 데이비드 M. 비즐리
      34,200원
    • 신호철
      25,200원
    • 제이슨 R. 브리그스
      24,300원
    • 웨스 맥키니
      29,700원
    더보기+

    바로가기

    • 우측 확장형 배너 2
    • 우측 확장형 배너 2

    최근 본 상품