- 전체
- Python 일반
- Python 수학
- Python 그래픽
- Python 자료구조
- Python 인공지능
- Python 인터넷
- Python SAGE
- wxPython
- TkInter
- iPython
- wxPython
- pyQT
- Jython
- django
- flask
- blender python scripting
- python for minecraft
- Python 데이터 분석
- Python RPA
- cython
- PyCharm
- pySide
- kivy (python)
Python 자료구조 텍스트 마이닝 1편. 소개
2018.02.18 23:31
텍스트 마이닝 1편. 소개
텍스트 마이닝은 텍스트로부터 유의미한 정보를 추출하는 과정을 말합니다.
텍스트분석 + 데이터마이닝 = 텍스트 마이닝 입니다.
정확히는 연관성, 참신성, 흥미성이 있는 정보를 텍스트에서 추출하여 정보의 속성을 얻는 과정입니다.
텍스트 마이닝의 핵심은 자연어처리 기술과 다양한 분석 기법을 이용하여 텍스트를 분석 가능한 데이터로 변화하는 것이라고 할 수 있습니다.
텍스트마이닝을 활용한 대표적인 작업은 다음과 같습니다.
감성 분석 : 텍스트에 표현된 긍부정 감성을 인식하는 일로 오피니언 마이닝이라고도 불립니다.
개념 추출 : 텍스트의 내용 혹은 의미를 요약하거나 대표할 수 있는 개체명을 인식하고 추출합니다.
텍스트 분류 : 주어진 학습 자료로부터 기계학습을 통해 분류 모델을 구축하여 Labeling 합니다.
텍스트 군집 : 학습 자료 없이 텍스트에서 속성을 추출하여 비슷한 텍스트 끼리 묶습니다.
텍스트 요약 : 긴 텍스트를 짧은 텍스트로 요약
개체 관계 모델링 : 텍스트에서 추출한 개체관의 관계를 인식
컴퓨터에서 문자를 처리하는 방법
컴퓨터는 숫자를 다루는 기계입니다. 그러므로 컴퓨터에서 문자를 다루려면 문자를 숫자로 변환하고 숫자를 문자로 바꾸는 과정이 필요합니다. 보통은 이 과정이 컴퓨터의 운영체제에서 자동적으로 이루어지기 때문에 사용자들은 이를 인식하지 못합니다.
자세한 내용은 운영체제에 대한 추가 교육을 받아야 합니다.
다만, 텍스트 자료를 다룰 때에 흔히 언급되는 몇 가지 부호화 방식은 미리 알아 둘 필요가 있습니다.
유니코드 : 국제 표준 문자 부호화 체계로 전 세계에서 사용했거나 사용하는 모든 문자를 표현하는 것을 목표로 하는 방식.
ASCII: 미국에서 산업 표준으로 정해진 라틴 문자 부호화 방식.
UTF–8: 유니코드를 실제로 컴퓨터에서 사용할 때에 기존 소프트웨어 환경과의 호환성을 최대한 유지할 수 있도록 만들어진 문자 부호화 방식
EUC-KR: 유니코드 이전에 한글을 유닉스 운영체제 상에서 표현하기 위해 벨 연구소에서 제안한 부호화 체계, 한글 음절 가운데 2,350자만 표현 가능
CP949: 마이크로소프트에서 사용하는 비표준 부호화 체계로 EUC-KR을 확장하여 한글 음절 8,822 자를 추가하여 이론적으로 생성 가능한 현대 한글 음절 11,172자를 모두 표현
문자 부호화의 표준은 이제 UTF-8로 봐도 무관합니다. 한국은 CP949나 EUC-KR 부호화가 적용된 상태로 존재하는 텍스트가 많은데 현재 UTF-8로 이동하고 있습니다.
본격적인 이야기는 다음편부터....
[출처] 텍스트 마이닝 1편. 소개|작성자 엉드루
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.

