파이썬 네이버 실시간 검색어 스크래핑(크롤링)

지난번에 간략하게 파이썬 스크래핑 크롤링에 대해 설명을 하면서 예제로 네이버 실시간 검색어 가져오기를 했습니다. 네이버 실시간 검색어를 가져오는 것은 간단 하지만 스크래핑하는 데 있어 기초가 되지 않을까 생각되어 몇 가지 예제 소스를 더 만들어 보았습니다.
이전 글 보기https://wonderbout.tistory.com/31

개발자 도구를 이용해 네이버 소스를 보면 실시간 검색어에 대한 코드가 두 군데 있습니다. 하나는 클래스 명이 ah_roll로 시작하고 나머지 하나는 ah_list로 시작합니다. 만약 제목을 뽑기 위해서 제목에 해당하는 요소인 <span class="ah_k"> 만을 선택해 출력해 보면 1위부터 20위까지 20개가 나와야 하지만 40개의 중복된 제목이 출력됩니다. 1위부터 20위까지 20개만 출력하려면 부모 또는 조상의 클래스 명을 선택해야 합니다.

 

네이버 소스

 

여기서는 클래스명이 ah_list의 내용을 가져 오도록 하겠습니다.

 

실시간 검색어

 

간단하게 제목만 뽑아 오기

실행 환경

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com

  • OS : 윈도우 10
  • IDE : VScode
  • Python : 3.7
  • beautifulsoup4 : 4.6.3
  • requests : 2.19.1

간단하게 제목만 뽑아서 출력하는 소스입니다.
클래스명 ah_list의 자손 요소에 제목에 해당하는 클래스명 ah_k가 있습니다.

import requests
from bs4 import BeautifulSoup

resp = requests.get('https://www.naver.com/')
soup = BeautifulSoup(resp.text, 'html.parser')
titles = soup.select('.ah_list .ah_k')

for title in titles:
    print(title.get_text())

뽑아온 제목 앞에 임의로 순위을 넣기
위 예제 코드에서 for 문을 지우고 아래 코드로 대체 한다.

for i, title in enumerate(titles, 1):
    print(f'{i}{title.get_text()}')

제목과 순위 그리고 링크 주소 까지 가져오기

html코드를 보면 ah_list 클래스 밑에 ah_item 클래스 자식요소에 링크주소가 있습니다. a 태그를 이용해서 가져올 수도 있지만 여기서는 클래스 명(ah_a)으로 가져 옵니다. 그리고 그 자식클래스인 순위(ah_r)와 제목(ah_k)이 보입니다. 우선 모든 ah_item 요소들을 담고 그 자손들을 하나하나 선택해서 출력합니다.

참고로 select_one는 find와 같고 select는 find_all과 같습니다.

import requests
from bs4 import BeautifulSoup

resp = requests.get('https://www.naver.com/')
soup = BeautifulSoup(resp.text, 'html.parser')
hotkeywords = soup.select('.ah_list .ah_item')

for hotkey in hotkeywords:
    print(f'{hotkey.select_one(".ah_r").get_text()}위 '
          f'{hotkey.select_one(".ah_k").get_text()} '
          f'{hotkey.select_one(".ah_a").get("href")}')

다음 편에는 스크랩해온 데이터를 엑셀 또는 데이터베이스에 저장하는 것까지 해서 스크래핑을 완성하도록 하겠습니다.



출처: https://wonderbout.tistory.com/32 [원더바웃]

 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
44 [python] 크롤링한 데이터 DB에 저장하기 file 졸리운_곰 2021.01.29 3215
43 [python] 크롤러 만들어 db에 정보 insert 하기 졸리운_곰 2021.01.29 356
42 Python - mongoDB 다루기 졸리운_곰 2020.12.05 345
41 XML to JSON ( JSON to XML ) 파이썬 스크립트 변환 졸리운_곰 2020.10.04 365
40 [python] 크롤러 만들어 db에 정보 insert 하기 졸리운_곰 2020.10.02 525
39 python 으로 pdf 에서 text 문자열 추출 (뽑아내기) file 졸리운_곰 2020.09.05 1001
38 [파이썬] sqlite3 모듈 사용법 졸리운_곰 2020.05.06 510
37 Python 데이터 시각화 file 졸리운_곰 2020.05.06 587
36 파이썬 SQLite3 사용법 file 졸리운_곰 2020.05.06 450
35 How to create an SQLite3 database in Python 3 졸리운_곰 2020.04.30 40569
34 Python - Linked Lists 졸리운_곰 2020.03.25 439
33 python으로 GUID 만들기 졸리운_곰 2019.02.27 545
32 파이썬으로 구현한 기본적인 블록체인 : A Practical Introduction to Blockchain with Python file 졸리운_곰 2019.02.22 1078
31 파이썬-sql알케미-tutorial, sqlalchemy tutorial file 졸리운_곰 2018.08.27 524
30 node.js python-shell을 활용하여 python 실행 file 졸리운_곰 2018.08.14 689
29 Python, PyV8로 javascript 실행하기 file 졸리운_곰 2018.08.14 623
28 Does Python SciPy need BLAS? 졸리운_곰 2018.05.26 487
27 [파이썬으로 구현한 알고리즘] (7) 트리(Tree) file 졸리운_곰 2018.02.27 1957
26 [파이썬으로 구현한 알고리즘] (6) 쉘 정렬(Shell Sort) file 졸리운_곰 2018.02.27 771
25 [파이썬으로 구현한 알고리즘] (5) 삽입 정렬(Insertion Sort) file 졸리운_곰 2018.02.27 1033
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED