- 전체
- Python 일반
- Python 수학
- Python 그래픽
- Python 자료구조
- Python 인공지능
- Python 인터넷
- Python SAGE
- wxPython
- TkInter
- iPython
- wxPython
- pyQT
- Jython
- django
- flask
- blender python scripting
- python for minecraft
- Python 데이터 분석
- Python RPA
- cython
- PyCharm
- pySide
- kivy (python)
Python 인공지능 [Python 인공지능] [파이썬을 이용한 한글 NLP] 03. 간단한 키워드 추출기
2025.01.29 01:17
[Python 인공지능] [파이썬을 이용한 한글 NLP] 03. 간단한 키워드 추출기
테스트 환경
CPU : Intel(R) Core(TM) i5-2500 CPU @ 3.30GHz
O.S : Window 7, 64bit
language version : Anaconda Python 3.5.3
RAM : 8.00GB
아래 글에서 키워드를 추출해봅시다. 여기서 제가 말하는 키워드란, 글의 주제를 나타내는 단어 또는 복합어를 의미합니다.
보통 자주 언급된 단어나 어절은 중요도가 높습니다. 네이버의 실시간 검색어도 사람들에게 자주 언급된 순으로 랭킹을 매겨서 보여줍니다. 제가 만든 키워드 추출기도 이러한 가정을 바탕에 두고 있습니다. 단어가 등장한 횟수를 계산해 가장 많이 등장한 순서대로 어절을 반환해줍니다.
텍스트 마이닝에선 단어나 어절의 등장횟수를, 각 어절의 TF점수( Term-Frequency Score )라고 부릅니다. 이것에 대해선 나중에 TF-IDF에 대해 포스팅하면서 더 자세히 설명하겠습니다.
네이버에서도 실시간 검색어 TOP10을 메인에 표시해주죠. 그래서, 저 또한 키워드 추출 함수 내부에서각 어절에 대해 TF를 계산하고, 이중에서 상위 10개를 반환하도록 구현하였습니다. 아래는 그 소스코드입니다 :
#-*-coding:utf-8-*-
from konlpy.tag import Twitter
text = """도로와 철도 레일 위를 모두 달릴 수 있는 '레일버스'가 개발돼 벽지 노선 등에 투입될 것으로 보인다.
코레일은 "현재 25인승 버스를 개조해 만든 레일버스의 안전성 검증과 기술 추가 개발이 끝나면 3대를 제작해 이르면 2019년 말 강원 정선 지역의 정선선 등에 투입할 계획"이라고 6일 밝혔다.
레일버스는 버스 차량이 철도 레일 위에서도 달릴 수 있도록 일종의 보조 바퀴 역할을 하는 '가이드 휠'을 단 차량이다. 25~35인승 버스를 개조해 만들 계획이며 선로 위에서 시속 80㎞ 속도로 달릴 수 있다. 코레일 담당자는 "필요할 경우 차량 3대를 연결 운행하면 75~105명까지 탈 수 있을 것"이라고 말했다. 레일버스는 도로에서도 달릴 수 있어 기차역에 도착한 뒤 관광지, 버스 정류장까지 도로 주행이 가능하다. 도로를 달릴 때는 유압으로 가이드 휠을 들어 올리고 주행하는 방식이다.
코레일은 올해 초부터 레일버스 시험 차량을 제작해 대전의 시험 선로에서 운행하고 있다. 레일버스 개발에는 총 20억원이 들어갈 것으로 보이며, 차량 1대 제작 가격은 3억원 수준이다. 코레일 측은 "영국에서는 버스를 열차로 완전히 개조해 운행한 사례가 있으며, 일본은 2020년까지 레일버스와 형태가 비슷한 DMV(Dual Mode Vehicle)를 2020년까지 상용화할 계획"이라고 밝혔다.
코레일은 "레일버스가 투입되면 벽지 노선 적자는 줄이면서도 운행 횟수는 늘려나갈 수 있다"고 밝혔다. 예를 들여 정선선에 레일버스를 투입하면 정선선에서 발생하는 연간 적자를 18억원에서 13억원 수준으로 5억원 줄이면서 열차 운행 횟수는 현재(관광 열차 편도 2회)의 6.5배 수준인 편도 13회까지 늘릴 수 있을 것으로 기대하고 있다. 레일버스를 투입하면 현재 운행 중인 새마을·무궁화호급 열차보다 운영비 등을 줄일 수 있기 때문이다. 코레일은 이용객이 적고 적자가 나는 다른 벽지 노선 등에도 레일버스를 투입할 수 있을 것으로 기대하고 있다."""
def keyword_extractor(tagger, text):
tokens = tagger.phrases(text)
tokens = [ token for token in tokens if len(token) > 1 ] # 한 글자인 단어는 제외
count_dict = [(token, text.count(token)) for token in tokens ]
ranked_words = sorted(count_dict, key=lambda x:x[1], reverse=True)[:10]
return [ keyword for keyword, freq in ranked_words ]
if __name__ == '__main__':
twit = Twitter()
print( keyword_extractor(twit, text) )
결과는 아래와 같습니다.
이것만 봐도 대충은 어떤 내용인지 감이 오는 것 같습니다. 다음에는 TF-IDF 점수를 이용해 여러개의 문서군에서 주요 키워드를 추출하는 방법에 대해 포스팅하겠습니다.
[출처] [파이썬을 이용한 한글 NLP] 03. 간단한 키워드 추출기|작성자 ISTP
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
댓글 0
| 번호 | 제목 | 글쓴이 | 날짜 | 조회 수 |
|---|---|---|---|---|
| 2 |
[PyCharm] 파이참 에러
| 졸리운_곰 | 2023.04.29 | 459 |
| 1 |
[PyCharm] 파이썬 - UNKNOWN ENCODING: X-WINDOWS-949 에러
| 졸리운_곰 | 2023.04.29 | 361 |

