텍스트 마이닝 1편. 소개

 

 

 
 

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com

텍스트 마이닝은 텍스트로부터 유의미한 정보를 추출하는 과정을 말합니다.
텍스트분석 + 데이터마이닝 = 텍스트 마이닝 입니다.

정확히는 연관성, 참신성, 흥미성이 있는 정보를 텍스트에서 추출하여 정보의 속성을 얻는 과정입니다.
텍스트 마이닝의 핵심은 자연어처리 기술과 다양한 분석 기법을 이용하여 텍스트를 분석 가능한 데이터로 변화하는 것이라고 할 수 있습니다.

텍스트마이닝을 활용한 대표적인 작업은 다음과 같습니다.

감성 분석 : 텍스트에 표현된 긍부정 감성을 인식하는 일로 오피니언 마이닝이라고도 불립니다.
개념 추출 : 텍스트의 내용 혹은 의미를 요약하거나 대표할 수 있는 개체명을 인식하고 추출합니다.
텍스트 분류 : 주어진 학습 자료로부터 기계학습을 통해 분류 모델을 구축하여 Labeling 합니다.
텍스트 군집 : 학습 자료 없이 텍스트에서 속성을 추출하여 비슷한 텍스트 끼리 묶습니다.
텍스트 요약 : 긴 텍스트를 짧은 텍스트로 요약
개체 관계 모델링 : 텍스트에서 추출한 개체관의 관계를 인식

컴퓨터에서 문자를 처리하는 방법
컴퓨터는 숫자를 다루는 기계입니다. 그러므로 컴퓨터에서 문자를 다루려면 문자를 숫자로 변환하고 숫자를 문자로 바꾸는 과정이 필요합니다. 보통은 이 과정이 컴퓨터의 운영체제에서 자동적으로 이루어지기 때문에 사용자들은 이를 인식하지 못합니다.
자세한 내용은 운영체제에 대한 추가 교육을 받아야 합니다. 

다만, 텍스트 자료를 다룰 때에 흔히 언급되는 몇 가지 부호화 방식은 미리 알아 둘 필요가 있습니다.

유니코드 : 국제 표준 문자 부호화 체계로 전 세계에서 사용했거나 사용하는 모든 문자를 표현하는 것을 목표로 하는 방식.

ASCII: 미국에서 산업 표준으로 정해진 라틴 문자 부호화 방식.

UTF–8: 유니코드를 실제로 컴퓨터에서 사용할 때에 기존 소프트웨어 환경과의 호환성을 최대한 유지할 수 있도록 만들어진 문자 부호화 방식

EUC-KR: 유니코드 이전에 한글을 유닉스 운영체제 상에서 표현하기 위해 벨 연구소에서 제안한 부호화 체계,  한글 음절 가운데 2,350자만 표현 가능

CP949: 마이크로소프트에서 사용하는 비표준 부호화 체계로 EUC-KR을 확장하여 한글 음절 8,822 자를 추가하여 이론적으로 생성 가능한 현대 한글 음절 11,172자를 모두 표현

문자 부호화의 표준은 이제 UTF-8로 봐도 무관합니다. 한국은 CP949나 EUC-KR 부호화가 적용된 상태로 존재하는 텍스트가 많은데 현재 UTF-8로 이동하고 있습니다.

본격적인 이야기는 다음편부터....

 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED