증권뉴스데이터 수집(3/3편)

 

 

 
 

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com

HTML 형식의 기사에서 HTML 태그를 제거하고 기사 제목과 작성 날짜, 시간, 그리고 본문을 구분하여 구조화한 기사를 생성하는 스크립트를 작성합니다.

1) HTML 파일 이름을 입력받는다.
2) 텍스트 기사 파일 입력 받는다.
3) HTML 기사 파일을 연다.
4) 다음의 동작을 반복한다.
 4-1) HTML 파일에서 HTML 기사 하나를 익는다.
 4-2) 읽은 기사가 빈 문자열이면 반복을 멈춘다.
 4-3) HTML 기사에서 제목을 추출한다.
 4-4) HTML 기사에서 기사 작성 날짜/ 시간을 추출한다.
 4-5) HTML 기사에서 HTML을 제거하고 본문을 추출한다.
 4-6) 텍스트 기사 파일에, 날짜/시간, 본문을 기록한다.
5) 텍스트 기사 파일을 닫는다.
6) HTML 기사 파일을 닫는다.

#!/usr/bin/env python
# -*- coding: utf-8 -*-

"""
네이버 뉴스 기사 HTML에서 순수 텍스트 기사를 추출한다.
"""

import bs4
import time
import requests
import os


ARTICLE_DELIMITER = "@@@@@ ARTICLE DELMITER @@@@\n"
TITLE_START_PAT = '<h3 class="font1">'
TITLE_END_PAT = '</h3>'
DATE_TIME_START_PAT = u'기사입력 <span class="t11">'
BODY_START_PAT = '<div class="article_body">'
BODY_END_PAT = '<div class="article_footer">'
TIDYUP_START_PAT = '<div class="article_footer">'

def get_html_file_name():
    """
    사용자로 부터 HTML 파일 이름을 입력받아 돌려준다.
    :return:
    """

    html_file_name = input("Enter HTML File name : ")

    return html_file_name

def get_text_file_name():
    """
    사용자로부터 텍스트 파일 이름을 입력받아 돌려준다.
    :return:
    """

    text_file_name = input("Enter text file name : ")

    return text_file_name

def open_html_file(html_file_name):
    """
    HTML 기사 파일을 열어서 파일 객체를 돌려준다.
    :param html_file_name:
    :return:
    """

    html_file = open(html_file_name, "r", encoding="utf-8")

    return html_file

def create_text_file(text_file_name):
    """
    텍스트 기사 파일을 만들어 파일 객체를 돌려준다.
    :param text_file_name:
    :return:
    """

    text_file = open(text_file_name, "w", encoding="utf-8")

    return text_file

def read_html_article(html_file):
    """
    HTML 파일에서 기사 하나를 읽어서 돌려준다.
    :param html_file:
    :return:
    """

    lines = []
    for line in html_file:
        if line.startswith(ARTICLE_DELIMITER):
            html_text = "".join(lines).strip()
            return html_text
        lines.append(line)

    return None

def ext_title(html_text):
    """
    HTML 기사에서 제목을 추출하여 돌려준다.
    :param html_text:
    :return:
    """
    p = html_text.find(TITLE_START_PAT)
    q = html_text.find(TITLE_END_PAT)
    title = html_text[p + len(TITLE_START_PAT):q]
    title = title.strip()

    return title


def ext_date_time(html_text):
    """
    HTML 기사에서 날짜와 시간을 추출하여 돌려준다.
    :param html_text:
    :return:
    """
    start_p = html_text.find(DATE_TIME_START_PAT)+len(DATE_TIME_START_PAT)
    end_p = start_p + 10
    date_time = html_text[start_p:end_p]
    date_time = date_time.strip()

    return date_time

def strip_html(html_body):
    """
    HTML 본문에서 HTML 태그를 제거하고 돌려준다.
    :param html_body:
    :return:
    """
    page = bs4.BeautifulSoup(html_body, "html.parser")
    body = page.text

    return body

def tidyup(body):
    """
    본문에서 필요없는 부분을 자르고 돌려준다.
    :param body:
    :return:
    """

    p = body.find(TIDYUP_START_PAT)
    body = body[:p]
    body = body.strip()

    return body

def ext_body(html_text):
    """
    HTML 기사에서 본문을 추출하여 돌려준다.
    :param html_text:
    :return:
    """

    p = html_text.find(BODY_START_PAT)
    q = html_text.find(BODY_END_PAT)
    html_body = html_text[p + len(BODY_START_PAT):q]
    html_body = html_body.replace("<br />","\n")
    html_body = html_body.strip()
    body = strip_html(html_body)
    body = tidyup(body)

    return body

def write_article(text_file, title, date_time, body):
    """
    텍스트 파일에 항목이 구분된 기사를 출력한다.
    :param text_file:
    :param title:
    :param date_time:
    :param body:
    :return:
    """

    text_file.write("{}\n".format(title))
    text_file.write("{}\n".format(date_time))
    text_file.write("{}\n".format(body))
    text_file.write("{}\n".format(ARTICLE_DELIMITER))

def main():
    """
    네이트 뉴스 기사 HTML에서 순수 텍스트 기사를 추출한다.
    :return:
    """

    html_file_name = get_html_file_name()
    text_file_name = get_text_file_name()
    html_file = open_html_file(html_file_name)
    text_file = create_text_file(text_file_name)

    while True:

        html_text = read_html_article(html_file)

        if not html_text:
            break

        title = ext_title(html_text)
        date_time = ext_date_time(html_text)
        body = ext_body(html_text)
        write_article(text_file, title, date_time, body)

    html_file.close()
    text_file.close()

main()


좀 쉬었다가 다음에는 진짜 수집된 데이터를 기반으로 텍스트 마이닝을 시작하겠습니다.

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
42 Django에서 MySQL DB를 연동하기 pycharm file 졸리운_곰 2018.04.10 732
41 Python Flask 로 간단한 REST API 작성하기 file 졸리운_곰 2018.04.07 496
» 증권뉴스데이터 수집(3/3편) 졸리운_곰 2018.02.18 709
39 증권뉴스데이터 수집(2/3편) 졸리운_곰 2018.02.18 437
38 증권뉴스 데이터 수집(1.5/3.0) 졸리운_곰 2018.02.18 482
37 증권뉴스 데이터 수집(1/3) file 졸리운_곰 2018.02.18 601
36 python 활용 웹 사이트가 존재하는지 체크 : Python check if website exists 졸리운_곰 2018.01.16 446
35 파이썬3을 이용하여 코인원,빗썸,코빗의 가상화폐 시세정보를 불러오는 프로그램을 만들었다. file 졸리운_곰 2017.12.02 716
34 네이버 실시간 검색어를 자동 추출하는 방법 file 졸리운_곰 2017.11.14 631
33 Cinema 3 - (Extremely Simplified) Example of Microservices in Python file 졸리운_곰 2017.08.03 395
32 나만의 웹 크롤러 만들기 with Requests/BeautifulSoup file 졸리운_곰 2017.07.08 586
31 Web Scraping using Python / FinAlgML(놀러온특강) Python을 통한 웹 스크래핑 및 DB화 file 졸리운_곰 2017.07.08 728
30 PiP - Python in PHP 졸리운_곰 2017.05.06 893
29 Developing a RESTful micro service in Python file 졸리운_곰 2017.03.06 1120
28 BitTorrent 프로토콜의 동작원리 file 졸리운_곰 2017.02.26 1014
27 Torrent의 원리 file 졸리운_곰 2017.02.26 1445
26 How to automatically search and download torrents with Python and Scrapy 졸리운_곰 2017.02.26 774
25 Web scraping, article extraction and sentiment analysis with Scrapy, Goose and TextBlob 졸리운_곰 2017.02.26 395
24 [Python] 네이버 주식 종목별 일별 데이터 가져오기 file 졸리운_곰 2017.02.24 1869
23 [파이썬으로 웹 크롤러 만들기] 크롤링 시작하기(3/3) file 졸리운_곰 2017.02.16 705
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED