증권뉴스데이터 수집(2/3편)

 

 

 
 

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com

오늘은 지난 시간에 수집한 URL의 HTML 파일을 저장하는 단계입니다.

단계는 다음과 같습니다.

1. URL 목록 파일명을 입력받는다. (지난 시간에 만든 파일)
2. 출력 파일명을 입력받는다.
3. 기사 URL 파일을 연다
4. 출력 파일을 연다.
5. 기사 URL 파일르 한 줄씩 읽으며 더 읽을 내용이 없을 때 까지 반복한다.
  5.1 읽은 줄에서 기사 번호를 추출하여 인쇄용 URL을 만든다.
  5.2 인쇄용 URL로 기사에 접근하여 HTML을 얻는다.
  5.3 얻어온 HTML을 기사 파일에 기록한다.
  5.4 쉰다.
6. 출력파일을 닫는다.
7. URL 목록 파일을 닫는다.



#!/usr/bin/env python
# -*- coding: utf-8 -*-

"""
네이버 뉴스 기사를 수집한다.
"""

import time
import requests
import os

def get_url_file_name() :
"""
url 파일 이름을 받아 돌려준다.
:return:
"""

url_file_name = input("Enter url file name : ")

return url_file_name

def get_output_file_name():
"""
철력 파일의 이름을 입력받아 돌려준다.
:return:
"""

output_file_name = input("Enter output file name : ")

return output_file_name

def open_url_file(url_file_name):
"""
URL 파일을 연다.
:param url_file_name:
:return:
"""

url_file = open(url_file_name, "r", encoding ="utf-8")

return url_file

def create_output_file(output_file_name):
"""
출력 파일을 생성한다.
:param output_file_name:
:return:
"""

output_file = open(output_file_name, "w", encoding='utf-8')

return output_file

def gen_print_url(url_line):
"""
주어진 기사 링크 URL로 부터 인쇄용 URL을 만들어 돌려준다.
:param url_line:
:return:
"""
article_id = url_line[(len(url_line)-24):len(url_line)]
print_url = "http://news.naver.com/main/tool/print.nhn?" + article_id

return print_url

def get_html(print_url) :
"""
주어진 인쇄용 URL에 접근하여 HTML을 읽어서 돌려준다.
:param print_url:
:return:
"""
user_agent = "'Mozilla/5.0"
headers ={"User-Agent" : user_agent}

response = requests.get(print_url, headers=headers)
html = response.text

return html

def write_html(output_file, html):
"""
주어진 HTML 텍스트를 출력 파일에 쓴다.
:param output_file:
:param html:
:return:
"""

output_file.write("{}\n".format(html))
output_file.write("@@@@@ ARTICLE DELMITER @@@@\n")

def pause():
"""
3초동안 쉰다.
:return:
"""
time.sleep(3)

def close_output_file(output_file):
"""
출력 파일을 닫는다.
:param output_file:
:return:
"""

output_file.close()

def close_url_file(url_file):
"""
URL 파일을 닫는다.
:param url_file:
:return:
"""

url_file.close()

def main():
"""
네이버 뉴스기사를 수집한다.
:return:
"""

url_file_name = get_url_file_name()
output_file_name = get_output_file_name()

url_file = open_url_file(url_file_name)
output_file = create_output_file(output_file_name)

for line in url_file:
print_url = gen_print_url(line)
html = get_html(print_url)
write_html(output_file,html)

close_output_file(output_file)
close_url_file(url_file)

main()


 

 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
47 [python] 파이썬 f-string (파이썬 스트링 앞에 f') file 졸리운_곰 2021.07.17 446
46 [Python] 파이썬으로 복리 계산하기 file 졸리운_곰 2021.07.17 562
45 [python, 파이썬] 연습 문제: 복리 이자 계산 졸리운_곰 2021.07.17 925
44 [python] 파이썬 기초 문법 정리 졸리운_곰 2021.05.17 861
43 [python] [GPU]GPU 사용 Python 코드 실행 졸리운_곰 2021.04.21 567
42 [python] 파이썬 스케줄 수행 - schedule, apscheduler file 졸리운_곰 2020.07.26 454
41 파이썬 스크립트 스케줄링하기 file 졸리운_곰 2020.07.26 1012
40 Python Scheduler 만들기(APScheduler) 졸리운_곰 2020.07.26 1089
39 [python] 주피터 노트북에서 패키지 설치 졸리운_곰 2018.12.06 1225
38 Data Structures and Algorithm In python 파이썬으로 자료구조와 알고리즘 : 출처 인터넷 file 졸리운_곰 2018.08.27 514
37 Mastering Basic Algorithms in the Python Language 이북 출처 인터넷 file 졸리운_곰 2018.08.27 629
36 python dev 사용자 입력과 출력 졸리운_곰 2018.03.01 472
35 APScheduler 사용기 file 졸리운_곰 2018.02.09 1070
34 [파이썬, 조각코드] 스케쥴러 만들기. 졸리운_곰 2018.02.09 795
33 Python virtualenv 정리 (Linux/Windows) 졸리운_곰 2018.01.23 486
32 [Python] 코드난독화 file 졸리운_곰 2018.01.19 1002
31 Python - Way to recursively find and replace string in text files 졸리운_곰 2017.08.30 478
30 Python Coding for Minecraft 마인크래프트를 위한 파이썬 프로그래밍 file 졸리운_곰 2017.05.05 1794
29 Atom을 Python 개발 툴로 사용하기 file 졸리운_곰 2017.03.06 938
28 IPython Notebook을 통한 데이터 분석 #3 file 졸리운_곰 2017.03.05 754
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED