텍스트 마이닝 1편. 소개

 

 

 
 

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com

텍스트 마이닝은 텍스트로부터 유의미한 정보를 추출하는 과정을 말합니다.
텍스트분석 + 데이터마이닝 = 텍스트 마이닝 입니다.

정확히는 연관성, 참신성, 흥미성이 있는 정보를 텍스트에서 추출하여 정보의 속성을 얻는 과정입니다.
텍스트 마이닝의 핵심은 자연어처리 기술과 다양한 분석 기법을 이용하여 텍스트를 분석 가능한 데이터로 변화하는 것이라고 할 수 있습니다.

텍스트마이닝을 활용한 대표적인 작업은 다음과 같습니다.

감성 분석 : 텍스트에 표현된 긍부정 감성을 인식하는 일로 오피니언 마이닝이라고도 불립니다.
개념 추출 : 텍스트의 내용 혹은 의미를 요약하거나 대표할 수 있는 개체명을 인식하고 추출합니다.
텍스트 분류 : 주어진 학습 자료로부터 기계학습을 통해 분류 모델을 구축하여 Labeling 합니다.
텍스트 군집 : 학습 자료 없이 텍스트에서 속성을 추출하여 비슷한 텍스트 끼리 묶습니다.
텍스트 요약 : 긴 텍스트를 짧은 텍스트로 요약
개체 관계 모델링 : 텍스트에서 추출한 개체관의 관계를 인식

컴퓨터에서 문자를 처리하는 방법
컴퓨터는 숫자를 다루는 기계입니다. 그러므로 컴퓨터에서 문자를 다루려면 문자를 숫자로 변환하고 숫자를 문자로 바꾸는 과정이 필요합니다. 보통은 이 과정이 컴퓨터의 운영체제에서 자동적으로 이루어지기 때문에 사용자들은 이를 인식하지 못합니다.
자세한 내용은 운영체제에 대한 추가 교육을 받아야 합니다. 

다만, 텍스트 자료를 다룰 때에 흔히 언급되는 몇 가지 부호화 방식은 미리 알아 둘 필요가 있습니다.

유니코드 : 국제 표준 문자 부호화 체계로 전 세계에서 사용했거나 사용하는 모든 문자를 표현하는 것을 목표로 하는 방식.

ASCII: 미국에서 산업 표준으로 정해진 라틴 문자 부호화 방식.

UTF–8: 유니코드를 실제로 컴퓨터에서 사용할 때에 기존 소프트웨어 환경과의 호환성을 최대한 유지할 수 있도록 만들어진 문자 부호화 방식

EUC-KR: 유니코드 이전에 한글을 유닉스 운영체제 상에서 표현하기 위해 벨 연구소에서 제안한 부호화 체계,  한글 음절 가운데 2,350자만 표현 가능

CP949: 마이크로소프트에서 사용하는 비표준 부호화 체계로 EUC-KR을 확장하여 한글 음절 8,822 자를 추가하여 이론적으로 생성 가능한 현대 한글 음절 11,172자를 모두 표현

문자 부호화의 표준은 이제 UTF-8로 봐도 무관합니다. 한국은 CP949나 EUC-KR 부호화가 적용된 상태로 존재하는 텍스트가 많은데 현재 UTF-8로 이동하고 있습니다.

본격적인 이야기는 다음편부터....

 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
15 [python 데이터분석] [jupyter] 주피터 노트북에 이미지 삽입 file 졸리운_곰 2025.09.06 526
14 [python 데이터분석] [Python] Streamlit 사용법 (python 데이터분석 웹 만들기) file 졸리운_곰 2024.12.22 462
13 [python 데이터분석] Anaconda : Error while loading conda entry point: conda-libmamba-solver (libarchive.so.19: cannot open shared object file: No such file or directory) 졸리운_곰 2024.12.14 520
12 [python 데이터분석] Anaconda | Conda update 반영 안됨(update 후에도 버전 변경 없음) file 졸리운_곰 2024.11.18 431
11 [python 데이터분석] Keeping Anaconda Up To Date 졸리운_곰 2024.05.30 552
10 [python 데이터 분석] 국내 경제 100대 통계지표 졸리운_곰 2024.02.18 672
9 [python 데이터 분석] Python 에서 R언어 패키지 호출 : Calling R From Python With rpy2 file 졸리운_곰 2024.01.28 676
8 [python 데이터 분석] 파이썬을 활용한 코스피, 달러 환율정보 수집부터 차트 시각화까지 file 졸리운_곰 2023.12.11 735
7 [Python 데이터분석][pandas] [Python pandas] DataFrame의 문자열 칼럼을 숫자형으로 바꾸기 : pd.to_numeric(), DataFrame.astype() file 졸리운_곰 2023.12.09 357
6 [Python 데이터분석] [Python 환경설정] VS code 설치 및 Anaconda와 연동하기 file 졸리운_곰 2023.03.17 527
5 [Python 데이터분석][python 데이터분석 프로덕션] [Python] Docker를 사용한 Dash 웹앱 생성 file 졸리운_곰 2021.12.10 403
4 [Python 데이터분석] [pandas] 공공데이터(csv) 활용시 한글 깨짐 현상 해결 file 졸리운_곰 2021.09.30 592
3 [Python 데이터분석] 공공데이터포털::공휴일 데이터 조회 (REST API) file 졸리운_곰 2021.09.30 358
2 [Python 데이터 분석] pandas의 to_csv()를 사용해서 csv 파일로 저장하기(save 하기) 졸리운_곰 2021.09.29 603
1 [Python 데이터 분석] 데이터 과학을 단순하게 만드는 3가지 Python 패키지 file 졸리운_곰 2021.09.24 513
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED