파이썬 네이버 실시간 검색어 스크래핑(크롤링)

지난번에 간략하게 파이썬 스크래핑 크롤링에 대해 설명을 하면서 예제로 네이버 실시간 검색어 가져오기를 했습니다. 네이버 실시간 검색어를 가져오는 것은 간단 하지만 스크래핑하는 데 있어 기초가 되지 않을까 생각되어 몇 가지 예제 소스를 더 만들어 보았습니다.
이전 글 보기https://wonderbout.tistory.com/31

개발자 도구를 이용해 네이버 소스를 보면 실시간 검색어에 대한 코드가 두 군데 있습니다. 하나는 클래스 명이 ah_roll로 시작하고 나머지 하나는 ah_list로 시작합니다. 만약 제목을 뽑기 위해서 제목에 해당하는 요소인 <span class="ah_k"> 만을 선택해 출력해 보면 1위부터 20위까지 20개가 나와야 하지만 40개의 중복된 제목이 출력됩니다. 1위부터 20위까지 20개만 출력하려면 부모 또는 조상의 클래스 명을 선택해야 합니다.

 

네이버 소스

 

여기서는 클래스명이 ah_list의 내용을 가져 오도록 하겠습니다.

 

실시간 검색어

 

간단하게 제목만 뽑아 오기

실행 환경

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com

  • OS : 윈도우 10
  • IDE : VScode
  • Python : 3.7
  • beautifulsoup4 : 4.6.3
  • requests : 2.19.1

간단하게 제목만 뽑아서 출력하는 소스입니다.
클래스명 ah_list의 자손 요소에 제목에 해당하는 클래스명 ah_k가 있습니다.

import requests
from bs4 import BeautifulSoup

resp = requests.get('https://www.naver.com/')
soup = BeautifulSoup(resp.text, 'html.parser')
titles = soup.select('.ah_list .ah_k')

for title in titles:
    print(title.get_text())

뽑아온 제목 앞에 임의로 순위을 넣기
위 예제 코드에서 for 문을 지우고 아래 코드로 대체 한다.

for i, title in enumerate(titles, 1):
    print(f'{i}{title.get_text()}')

제목과 순위 그리고 링크 주소 까지 가져오기

html코드를 보면 ah_list 클래스 밑에 ah_item 클래스 자식요소에 링크주소가 있습니다. a 태그를 이용해서 가져올 수도 있지만 여기서는 클래스 명(ah_a)으로 가져 옵니다. 그리고 그 자식클래스인 순위(ah_r)와 제목(ah_k)이 보입니다. 우선 모든 ah_item 요소들을 담고 그 자손들을 하나하나 선택해서 출력합니다.

참고로 select_one는 find와 같고 select는 find_all과 같습니다.

import requests
from bs4 import BeautifulSoup

resp = requests.get('https://www.naver.com/')
soup = BeautifulSoup(resp.text, 'html.parser')
hotkeywords = soup.select('.ah_list .ah_item')

for hotkey in hotkeywords:
    print(f'{hotkey.select_one(".ah_r").get_text()}위 '
          f'{hotkey.select_one(".ah_k").get_text()} '
          f'{hotkey.select_one(".ah_a").get("href")}')

다음 편에는 스크랩해온 데이터를 엑셀 또는 데이터베이스에 저장하는 것까지 해서 스크래핑을 완성하도록 하겠습니다.



출처: https://wonderbout.tistory.com/32 [원더바웃]

 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
15 [python 데이터분석] [jupyter] 주피터 노트북에 이미지 삽입 file 졸리운_곰 2025.09.06 526
14 [python 데이터분석] [Python] Streamlit 사용법 (python 데이터분석 웹 만들기) file 졸리운_곰 2024.12.22 462
13 [python 데이터분석] Anaconda : Error while loading conda entry point: conda-libmamba-solver (libarchive.so.19: cannot open shared object file: No such file or directory) 졸리운_곰 2024.12.14 520
12 [python 데이터분석] Anaconda | Conda update 반영 안됨(update 후에도 버전 변경 없음) file 졸리운_곰 2024.11.18 431
11 [python 데이터분석] Keeping Anaconda Up To Date 졸리운_곰 2024.05.30 552
10 [python 데이터 분석] 국내 경제 100대 통계지표 졸리운_곰 2024.02.18 672
9 [python 데이터 분석] Python 에서 R언어 패키지 호출 : Calling R From Python With rpy2 file 졸리운_곰 2024.01.28 676
8 [python 데이터 분석] 파이썬을 활용한 코스피, 달러 환율정보 수집부터 차트 시각화까지 file 졸리운_곰 2023.12.11 735
7 [Python 데이터분석][pandas] [Python pandas] DataFrame의 문자열 칼럼을 숫자형으로 바꾸기 : pd.to_numeric(), DataFrame.astype() file 졸리운_곰 2023.12.09 357
6 [Python 데이터분석] [Python 환경설정] VS code 설치 및 Anaconda와 연동하기 file 졸리운_곰 2023.03.17 527
5 [Python 데이터분석][python 데이터분석 프로덕션] [Python] Docker를 사용한 Dash 웹앱 생성 file 졸리운_곰 2021.12.10 403
4 [Python 데이터분석] [pandas] 공공데이터(csv) 활용시 한글 깨짐 현상 해결 file 졸리운_곰 2021.09.30 592
3 [Python 데이터분석] 공공데이터포털::공휴일 데이터 조회 (REST API) file 졸리운_곰 2021.09.30 358
2 [Python 데이터 분석] pandas의 to_csv()를 사용해서 csv 파일로 저장하기(save 하기) 졸리운_곰 2021.09.29 603
1 [Python 데이터 분석] 데이터 과학을 단순하게 만드는 3가지 Python 패키지 file 졸리운_곰 2021.09.24 513
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED