한국어 뉴스 데이터로 딥러닝 시작하기 - 5. 한국어 word2vec 데모 사이트 만들기  

한국어 뉴스 데이터로 딥러닝 시작하기 

 

 

5. 한국어 word2vec 데모 만들기 

 

 

1. 한국어 위키 덤프 다운로드 받기 바로가기  

2. 위키 덤프 데이터 파싱하기 바로가기

3. 위키 데이터 한국어 형태소 태깅하기 바로가기

4. doc2vec 모델 훈련하기

 

 

 

 

아래 doc2vec 모델 훈련하기 포스팅에서 훈련시킨 

doc2vec model (word2vec 포멧으로 저장버전)을 이용해서 

한국어 word2vec 데모 페이지를 만들었습니다. 

 

한국어 word2vec 데모 이동하기 

 

 

위키 뉴스와 경제 신문으로 훈련을 시켰고 

데모 사이트는 flask 를 사용하여 제작했습니다. 

(참고사이트 바로가기https://github.com/3Top/word2vec-api)

 

 

현재 지원하는 기능은 단어를 입력하면 

벡터 공간에서 제일 가까이 있는 (제일 유사한) 단어들을 보여주는 것입니다. 

 

 

 

 

 

 

 

 

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com

 

 

그 외 word2vec 함수들과 디자인은 향후 개선 예정이며 

doc2vec 데모 사이트도 이어서 만들어볼 생각입니다 ㅋ

 

 

 

 

참고로 이 데모 사이트에서 사용한 한국어 word2vec web embedding api는 

아래 github에서 다운로드 가능합니다. 

 

doc2vec-api github 바로가기

 

 

 

 

# install dependencies

 

pip2 install -r requirements.txt

 

 

# word2vec web api 서비스 시작하기  

 

python /home/stock/public_html/word2vec/word2vec-api.py --model wiki_dmpv_100_no_taginfo_user_dic_word2vec_format.bin --binary BINARY --path /word2vec --host 0.0.0.0 --port 4000

 
 

# Example call

curl http://127.0.0.1:4000/word2vec/most_similar?positive=무증

 

["\uac10\uc790", "\u318d\ubb34\uc0c1\uc99d\uc790", "\uc720\uc99d", "\ucc44\ubb34\uc778\uc218", "\ubb34\uc704\ubc95", "\ud589\uc815\uccad", "\uc6cc\ud06c\uc544\uc6c3", "\ub9e4\ub3c4\uc778", "\ubc30\uc218\uc9c4", "\uc785\ubc95\uad8c"]

 
 

 

 

 

 

 

 



출처: https://kugancity.tistory.com/entry/한국어-뉴스-데이터로-딥러닝-시작하기-5-한국어-word2vec-데모-사이트-만들기 [you've got to find what you love.]

 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
공지 오라클 기본 샘플 데이터베이스 졸리운_곰 2014.01.02 86307
공지 [SQL컨셉] 서적 "SQL컨셉"의 샘플 데이타 베이스 SAMPLE DATABASE of ORACLE 가을의 곰을... 2013.02.10 78758
공지 [G_SQL] Sample Database 가을의 곰을... 2012.05.20 95506
644 Docker에서 SQL Server 컨테이너 이미지 구성 file 졸리운_곰 2020.01.23 1554
643 MSSQL 설치형 한글 환경으로 변경 file 졸리운_곰 2020.01.23 2886
642 FastText, 실전 사용하기 file 졸리운_곰 2020.01.12 1096
641 Generative Models Part 2: ImprovedGAN,InfoGAN,EBGAN file 졸리운_곰 2020.01.09 1202
640 Generative Models Part 1: VAE,GAN,DCGAN file 졸리운_곰 2020.01.09 1156
639 VAE & GAN 간단 비교 file 졸리운_곰 2020.01.09 1099
638 구글 Colab을 이용한 BERT-Base Model 학습하기 file 졸리운_곰 2020.01.08 1079
637 BERT 톺아보기 file 졸리운_곰 2020.01.08 1161
636 BERT 한국어버전(korquad) training 및 evaluating 해보기 file 졸리운_곰 2020.01.08 1001
635 딥 러닝 용어 - batch, iteration, epoch 졸리운_곰 2020.01.08 1068
634 tensorflow 로 mnist 흉내내는 GAN 만들기 file 졸리운_곰 2020.01.08 846
633 텐서플로우(TensorFlow)를 이용해서 MNIST 데이터를 생성하는 GAN(Generative Adversarial Networks) 생성 모델(Generative Model) 구현해보기 – GAN 예제 file 졸리운_곰 2020.01.08 965
632 Tensorflow로 50줄짜리 Original GAN Code 구현하기 졸리운_곰 2020.01.08 1194
631 Inductive bias란? 졸리운_곰 2020.01.05 936
630 형태소 분석기를 이용한 Bert-Multilingual Model 기반 Korquad 결과의 성능 개선 file 졸리운_곰 2020.01.05 1229
629 Bert-Multilingual model을 이용해 KorQuAD 수행해보기 Part 2 제출 file 졸리운_곰 2020.01.05 1182
628 Bert-Multilingual model을 이용해 KorQuAD 수행해보기 Part 1 훈련 및 평가 file 졸리운_곰 2020.01.05 1066
627 [기계독해][MRC] R-NET: MACHINE READING COMPREHENSION WITH SELF-MATCHING NETWORKS file 졸리운_곰 2020.01.05 1164
626 한국어 뉴스 데이터로 딥러닝 시작하기- 6. doc2vec으로 문사 유사도 측정하기 file 졸리운_곰 2020.01.04 1727
» 한국어 뉴스 데이터로 딥러닝 시작하기 - 5. 한국어 word2vec 데모 사이트 만들기 file 졸리운_곰 2020.01.04 961
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED