- 전체
- Sample DB
- database modeling
- [표준 SQL] Standard SQL
- G-SQL
- 10-Min
- ORACLE
- MS SQLserver
- MySQL
- SQLite
- postgreSQL
- 데이터아키텍처전문가 - 국가공인자격
- 데이터 분석 전문가 [ADP]
- [국가공인] SQL 개발자/전문가
- NoSQL
- hadoop
- hadoop eco system
- big data (빅데이터)
- stat(통계) R 언어
- XML DB & XQuery
- spark
- DataBase Tool
- 데이터분석 & 데이터사이언스
- Engineer Quality Management
- [기계학습] machine learning
- 데이터 수집 및 전처리
- 국가기술자격 빅데이터분석기사
- 암호화폐 (비트코인, cryptocurrency, bitcoin)
[기계학습] machine learning 한국어 뉴스 데이터로 딥러닝 시작하기 - 4. doc2vec 모델 훈련하기
2020.01.04 00:45
한국어 뉴스 데이터로 딥러닝 시작하기 - 4. doc2vec 모델 훈련하기
한국어 뉴스 데이터로 딥러닝 시작하기
4. doc2vec 모델 훈련하기
word2vec이나 doc2vec을 사용하기 위해서는 gensim 패키지를 설치해야한다.
gensim은 topic modeling 관련 corpus 및 알고리즘들이 포함되어 있는 파이썬 패키지이다.
아래 gensim 설치 페이지를 참고해서 gensim을 설치하자.
아래는 doc2vec 관련 사이트들이다.
특히 doc2vec 사용 예제 스크립트는 정말 유용하니 doc2vec 사용시 참고하면 좋을 것이다.
https://radimrehurek.com/gensim/models/doc2vec.html
doc2vec github
https://github.com/RaRe-Technologies/gensim/tree/develop/gensim/models
#-*- coding: utf-8 -*-
from gensim.models import doc2vec
import sys
import multiprocessing
reload(sys)
sys.setdefaultencoding('utf-8')
cores = multiprocessing.cpu_count()
#doc2vec parameters
vector_size = 300
window_size = 15
word_min_count = 2
sampling_threshold = 1e-5
negative_size = 5
train_epoch = 100
dm = 1 #0 = dbow; 1 = dmpv
worker_count = cores #number of parallel processes
print len(sys.argv)
if len(sys.argv) >= 3:
inputfile = sys.argv[1]
modelfile = sys.argv[2]
else:
inputfile = "./data/sample.txt"
modelfile = "./model/doc2vec.model"
word2vec_file = modelfile + ".word2vec_format"
sentences=doc2vec.TaggedLineDocument(inputfile)
#build voca
doc_vectorizer = doc2vec.Doc2Vec(min_count=word_min_count, size=vector_size, alpha=0.025, min_alpha=0.025, seed=1234, workers=worker_count)
doc_vectorizer.build_vocab(sentences)
# Train document vectors!
for epoch in range(10):
doc_vectorizer.train(sentences)
doc_vectorizer.alpha -= 0.002 # decrease the learning rate
doc_vectorizer.min_alpha = doc_vectorizer.alpha # fix the learning rate, no decay
# To save
doc_vectorizer.save(modelfile)
doc_vectorizer.save_word2vec_format(word2vec_file, binary=False)
생성한 모델 파일을 로딩해서 간단하게 테스트를 해보자.

출처: https://adana.tistory.com/entry/한국어-뉴스-데이터로-딥러닝-시작하기-4-doc2vec-모델-훈련하기 [일인개발자 되기]
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.

