파이썬 네이버 실시간 검색어 스크래핑(크롤링)

지난번에 간략하게 파이썬 스크래핑 크롤링에 대해 설명을 하면서 예제로 네이버 실시간 검색어 가져오기를 했습니다. 네이버 실시간 검색어를 가져오는 것은 간단 하지만 스크래핑하는 데 있어 기초가 되지 않을까 생각되어 몇 가지 예제 소스를 더 만들어 보았습니다.
이전 글 보기https://wonderbout.tistory.com/31

개발자 도구를 이용해 네이버 소스를 보면 실시간 검색어에 대한 코드가 두 군데 있습니다. 하나는 클래스 명이 ah_roll로 시작하고 나머지 하나는 ah_list로 시작합니다. 만약 제목을 뽑기 위해서 제목에 해당하는 요소인 <span class="ah_k"> 만을 선택해 출력해 보면 1위부터 20위까지 20개가 나와야 하지만 40개의 중복된 제목이 출력됩니다. 1위부터 20위까지 20개만 출력하려면 부모 또는 조상의 클래스 명을 선택해야 합니다.

 

네이버 소스

 

여기서는 클래스명이 ah_list의 내용을 가져 오도록 하겠습니다.

 

실시간 검색어

 

간단하게 제목만 뽑아 오기

실행 환경

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com

  • OS : 윈도우 10
  • IDE : VScode
  • Python : 3.7
  • beautifulsoup4 : 4.6.3
  • requests : 2.19.1

간단하게 제목만 뽑아서 출력하는 소스입니다.
클래스명 ah_list의 자손 요소에 제목에 해당하는 클래스명 ah_k가 있습니다.

import requests
from bs4 import BeautifulSoup

resp = requests.get('https://www.naver.com/')
soup = BeautifulSoup(resp.text, 'html.parser')
titles = soup.select('.ah_list .ah_k')

for title in titles:
    print(title.get_text())

뽑아온 제목 앞에 임의로 순위을 넣기
위 예제 코드에서 for 문을 지우고 아래 코드로 대체 한다.

for i, title in enumerate(titles, 1):
    print(f'{i}{title.get_text()}')

제목과 순위 그리고 링크 주소 까지 가져오기

html코드를 보면 ah_list 클래스 밑에 ah_item 클래스 자식요소에 링크주소가 있습니다. a 태그를 이용해서 가져올 수도 있지만 여기서는 클래스 명(ah_a)으로 가져 옵니다. 그리고 그 자식클래스인 순위(ah_r)와 제목(ah_k)이 보입니다. 우선 모든 ah_item 요소들을 담고 그 자손들을 하나하나 선택해서 출력합니다.

참고로 select_one는 find와 같고 select는 find_all과 같습니다.

import requests
from bs4 import BeautifulSoup

resp = requests.get('https://www.naver.com/')
soup = BeautifulSoup(resp.text, 'html.parser')
hotkeywords = soup.select('.ah_list .ah_item')

for hotkey in hotkeywords:
    print(f'{hotkey.select_one(".ah_r").get_text()}위 '
          f'{hotkey.select_one(".ah_k").get_text()} '
          f'{hotkey.select_one(".ah_a").get("href")}')

다음 편에는 스크랩해온 데이터를 엑셀 또는 데이터베이스에 저장하는 것까지 해서 스크래핑을 완성하도록 하겠습니다.



출처: https://wonderbout.tistory.com/32 [원더바웃]

 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
57 [python 인공지능] Deploy ML models with FastAPI, Docker, and Heroku | Tutorial 졸리운_곰 2025.07.08 467
56 [python 인공지능] [VSCode] VSCode에서 ipynb 파일을 HTML(PDF 등..)로 졸리운_곰 2025.05.27 289
55 [Python 인공지능] [파이썬을 이용한 한글 NLP] 03. 간단한 키워드 추출기 졸리운_곰 2025.01.29 459
54 [Python 인공지능] [ 한글 키워드 시각화 ] 파이썬 python 텍스트 마이닝 한글 ( 워드 클라우드 WordCloud, squrify 트리맵으로 빅데이터 마스터) file 졸리운_곰 2025.01.29 401
53 [Python 인공지능] 기계 학습의 A to Z : IPython notebook과 scikit-learn을 활용한 기계 학습 file 졸리운_곰 2024.08.10 523
52 [python] 인공지능 python : 한글 문서 자동 요약 - lexrank 졸리운_곰 2023.07.06 404
51 [python] 인공지능 katiehouse / django-scikit-learn-tutorial file 졸리운_곰 2023.06.03 664
50 [python] [Anaconda]가상환경 설치,삭제 file 졸리운_곰 2022.12.03 405
49 [python][머신러닝] Scikit-learn Tutorial: Machine Learning in Python file 졸리운_곰 2022.11.29 497
48 [python] 파이썬(sklearn) 사이킷런(sklearn) 기초 졸리운_곰 2022.08.20 321
47 [python] scikit-learn이란 file 졸리운_곰 2022.08.20 455
46 [anaconde3][python] Create environment for tensorflow 1.4 in Anaconda 3 졸리운_곰 2022.07.02 563
45 [python][인공지능] [TensorFlow] Anaconda 가상환경 이용하여 TensorFlow GPU 설치 졸리운_곰 2022.01.20 438
44 [Python 인공지능] TextRank 를 이용한 키워드 추출과 핵심 문장 추출 (구현과 실험) file 졸리운_곰 2021.11.22 597
43 [python][인공지능] FLASK를 이용하여 PYTHON에서 PYTORCH를 REST API로 배포하기 졸리운_곰 2021.03.20 364
42 [python 파이썬] Creating REST API for TensorFlow models file 졸리운_곰 2021.02.01 488
41 [python 파이썬 인공지능] Keras 모델을 REST API로 배포해보기 file 졸리운_곰 2021.02.01 411
40 [파이썬 머신러닝] Scikit-learn 기초 졸리운_곰 2020.01.31 579
39 파이썬으로 간단한 뉴럴 네트워크 만들기 How to Create a Simple Neural Network in Python file 졸리운_곰 2020.01.29 22636
38 Keras를 활용한 주식 가격 예측 file 졸리운_곰 2019.02.25 984
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED