한국어 자연어 처리 데이터셋 목록

한국어 자연어 처리 데이터셋 목록

*** NLP / NLU 모델 학습을 위한 한국어 데이터셋 모음 *** 

(8/1 UPDATE) AI HUB에 언어 인식기술 관련 멋진 데이터들이 대량 공개된 것 발견!! 특히 대화모델 학습용 데이터가 많이 포함되어 있습니다.

 

 


분류 분석 (감성분석/ 의도분류)

이름 설명 링크
네이버 영화 리뷰 네이버 영화 리뷰 데이터에 대한 긍/부정 라벨 데이터
- 학습 15만건 / 테스트 5만건
github
Toxic Comment Data 네이버 영화 리뷰 데이터의 라벨을 상세화한 데이터
- toxic / obscene / threat / insult / identity_hate 분류

github

3i4k 의도분류 학습용 데이터셋
- 문장에 대해 7가지 클래스 라벨 부여
- 논문: https://arxiv.org/pdf/1811.04231.pdf
github
korean-hage-speech 한국어 혐오발언 분류 데이터셋
- 연예 뉴스 댓글에 대한 혐오 / 사회적 편견 유무 라벨 데이터
- 사회적 편견은 성별/ 기타/ 없음 세 가지로 분류
- 9,381건(7,896 / 471 / 974)
github

 

유사도 판별

이름 설명 링크
KorNLI 두 문장의 관계를 entailment/neutral/contradiction 으로 분류
- 학습/ 검증/ 테스트 데이터로 분리되어 있음.
github
KoSTS 두 문장의 유사도 점수를 라벨링한 데이터
- 학습/ 검증/ 테스트 데이터로 분리되어 있음.
github
Question pair 두 개의 질문이 같은 질문인지 아닌지 레이블링한 데이터
- 학습 6,888건 / 테스트 688건 제공
github
ParaKQC 10개의 비슷한 문장에 대한 1,000개의 집합으로 구성
- 문장 유사도 데이터 494,500건 생성 가능
- 패러프래이징 데이터 45,000건 생성 가능
github

 


자연어 질의응답 (기계독해 / MRC)

이름 설명 링크
KorQuAD 1.0 한국어 기계독해를 위한 표준 데이터셋
- 리더보드 운영중
webpage
KorQuAD 2.0 구조를 가진 HTML 문서에 대한 기계 독해 데이터셋
- 리더보드 운영중
webpage
AI HUB 기계독해 한국어 기계독해를 위한 데이터셋
- SQuAD1.0 / 2.0(no-answer) 타입의 데이터 제공
- 질문 답변과 답변을 선택한 단서 제공
webpage

 

자연어 질의응답 (일반 상식)

이름 설명 링크
AI HUB 일반상식 QA 일반 상식에 대한 {entity, attribute, value} 트리플
질문 -> 답변 -> 제시문에 대한 말뭉치 제공
webpage

 


대화 모델

이름 설명 링크
Chatbot_data 일상 챗봇 학습용 문답 페어 11,876건
일상(0) / 이별,부정(1) / 사랑,긍정(2) 라벨 부여 
github
AI HUB 한국어대화 소상공인, 공공민원 관련 10개 분야에 대한 1만건 이상의 데화 데이터셋
- 대화 데이터와 함께 의도(Intent) 라벨링 포함
webpage
클로바 AI Call 데이터 자동 음성 인식을 위한 Goal-oriented 대화 음성 코퍼스 데이터셋
- 비영리/ 학계 소속 기관은 신청을 통해 다운로드 가능
github
웰니스 대화 스크립트 세브란스 상담 데이터를 기반으로 구축한 정신 상담 데이터셋
- 359개 대화의도에 대한 5,232개 사용자 발화
- 1,023개 챗봇 발화 포함
webpage
KETI 한국어 대화 데이터 멀티턴 대화 데이터 758개 
- 각 대화는 3~12개의 턴으로 구성
- 문장 단위로는 4,975건의 발화문 존재
webpage
트위터기반 일상 대화 트위터상에 둘 이상의 화자가 대화한 내용 모음
- 1~17 턴의 데이터로 구성되어 있음
- 1차년도 데이터로 2,000 셋트가 공개됨
webpage
대화형 한글 에이전트  영화/드라마/SNS등에 대한 멀티턴 대화 데이터
- 8,000개의 대화 셋트 포함
- 각 대화는 2~10 턴의 대화 포함
webpage
한국어 감정 정보가 포함된
연속적 대화 데이터셋
크롤링으로 수집한 멀티턴 대화 데이터셋
- 각 발화문은 7가지 감정정보로 레이블링되어 있음
- 10,000개의 대화 셋트/ 각 대화는 약 5.6개 턴으로 구성
- 문장 단위로는 55,627건의 발화문 존재
webpage

 

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com


기타 (기계번역 / NER / 요약 / ...)

 > 기계 번역

이름 설명 링크
기계 번역
AI HUB 한영 말뭉치
한국어-영어 160만 문장의 번역 말뭉치
- 문어체, 구어체, 대화체 등 다양한 소스 포함
webpage
기계 번역
korean parallel corpora
한국어 -영어 번역
한국어 - 프랑스어 번역 데이터 포함
github
기계 번역
카이스트 중-한 데이터
중-한 문장 세트로 구성된 데이터셋
60,000개 문장 포함
webpage

 > NER

이름 설명 링크
KoreanNERCorpus 한국어 개체명인식 태스크 수행을 위한 데이터  github
NER 말뭉치 - 형태소 - 개체명 태깅 데이터셋 github

 > 텍스트 요약

이름 설명 링크
sci-news-sum-kr-50 네이버 뉴스 중 IT/과학 분야 기사 50개
원문 중 요약에 해당하는 문장을 태깅한 데이터셋
github

 


RAW Corpus

이름 설명 링크
국립국어원 말뭉치 다양한 분야에 대한 방대한 한국어 raw 코퍼스 webpage
카이스트 코퍼스 1994~1997년 수집한 70,000,000 어절의 코퍼스 webpage
위키피디아 덤프 한국어 위키피디아
(추출기- 링크)
webpage
나무위키 덤프 나무위키 
(추출기 - 링크)
webpage
한국 정치인 관련 뉴스 한국 정치인 19인에 대한 뉴스 수집 데이터셋 github
인공지능 윤리연구를 위한
비정형 텍스트 데이터셋

윤리 연구를 위해 윤리/비윤리 데이터 코퍼스 구축
1차년도: 뉴스기사 댓글 7,000만 건, 트위터 3,000만 건
2차년도: 온라인커뮤니티 (일베저장소) 댓글4,500만건
3차년도: 온라인커뮤니티 (일베저장소) 댓글2,000만건

webpage

 [출처] https://littlefoxdiary.tistory.com/42

 

 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
공지 오라클 기본 샘플 데이터베이스 졸리운_곰 2014.01.02 86985
공지 [SQL컨셉] 서적 "SQL컨셉"의 샘플 데이타 베이스 SAMPLE DATABASE of ORACLE 가을의 곰을... 2013.02.10 79249
공지 [G_SQL] Sample Database 가을의 곰을... 2012.05.20 95989
46 [데이터분석 & 데이터 사이언스] 수많은 데이터 사이언티스트들이 직장을 떠나는 이유는 무엇인가? file 졸리운_곰 2025.03.09 907
45 [데이터분석][파이썬][python] 한글 글꼴 사용 (matplotlib) 졸리운_곰 2024.04.18 1364
44 [데이터분석 & 데이터 사이언스] 데이터에 관한 꼭 알아야 할 오해와 진실 12가지 졸리운_곰 2024.01.17 1317
43 [데이터분석][파이썬][python] Awesome Dash Awesome file 졸리운_곰 2021.07.10 2346
42 [데이터분석][파이썬][python] ???? Introducing Dash ???? file 졸리운_곰 2021.07.10 1611
41 [dataset] (한글) 욕설 감지 데이터셋 file 졸리운_곰 2021.05.12 1561
40 [데이터분석][python] Dash를 사용하는 초보자 및 기타 모든 사용자를위한 Python의 대시 보드 file 졸리운_곰 2021.04.14 1768
39 [데이터분석][python] Dash를 사용하는 초보자 및 기타 모든 사용자를위한 Python의 대시 보드 file 졸리운_곰 2021.04.14 1609
38 [데이터분석][데이터 사이언스][python][Dash] Python, Dash 및 Plotly를 사용하여 COVID-19 사례 데이터 시각화 file 졸리운_곰 2021.03.28 1504
37 [데이터분석][머신러닝] When not to use machine learning or AI Adventures in wishful thinking, nonstationarity, and pattern-finding / 기계 학습 또는 AI를 사용하지 않아야하는 경우 희망찬 사고, 비정상 성, 패턴 찾기의 모험 file 졸리운_곰 2021.03.28 21624
36 [MSA][머신러닝] 쿠버네티스 기반의 End2End 머신러닝 플랫폼 Kubeflow #1 - 소개 file 졸리운_곰 2021.03.21 1141
35 [데이터사이언스] 데이터 과학자를위한 3 가지 훌륭한 디자인 패턴, 3 Great Design Patterns for Data Scientists file 졸리운_곰 2021.03.04 783
34 [데이터분석] 시계열 데이터에 AI를 사용하는 이유는 무엇입니까? file 졸리운_곰 2021.02.28 1196
33 [데이터분석] AI 예측 및 이상 탐지를위한 시계열 데이터 전처리 file 졸리운_곰 2021.02.28 1039
32 [데이터분석] bitcoin analysis 비트 코인 시계열 데이터에 대한 AI 이상 탐지 file 졸리운_곰 2021.02.27 1601
31 [데이터분석 & 데이터 사이언스] How To Create a Data Science Portfolio Website file 졸리운_곰 2021.02.14 1835
30 [데이터수집4] 오픈 API 데이터 수집 (소셜미디어 데이터 수집) file 졸리운_곰 2020.06.12 1956
29 [데이터수집3] 관계형 데이터베이스 데이터 수집 file 졸리운_곰 2020.06.12 1322
28 [데이터수집2] 분산시스템 로그 수집 (빅데이터 수집) file 졸리운_곰 2020.06.12 1502
27 [데이터수집1] 웹 크롤링, 웹 스크래핑 file 졸리운_곰 2020.06.12 1806
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED