빅 데이터를 위한 간단한 새로운 알고리즘

http://mirian.kisti.re.kr/futuremonitor/view.jsp?cn=GTB2014061218&service_code=03
KISTI 미리안 글로벌동향브리핑 2014-07-02




goldju21_1403963238087.jpg


전문가들은 사진, 비디오, 텍스트와 같은 대량의 정보를 나타내는 빅 데이터를 사용하게 된다. 이러한 정보들은 컴퓨터, 스마트폰 및 다른 전자기기들에서 수십억 명의 사람들이 언제나 공유할 수 있게 된다. 현재의 시나리오는 예측할 수 없는 전망들을 제공해주게 된다. 그래서 독감과 같은 전염병을 추적하고, 도로의 교통상황을 실시간으로 모니터링하거나 자연 재해에 대한 비상 상황을 처리할 수 있도록 만들어주게 될 것이다. 이와 같은 거대한 데이터를 사용하기 위해서 우리는 그것들을 이해해야 하며, 효율적이며, 빠르고 자동화된 방법으로 그것들을 목록화해야 할 것이다.

가장 일반적으로 사용되어지고 있는 시스템 중 하나는 CA(Cluster Analysis)라는 연속적인 통계학적 기술이다. 이것은 유사성에 따라서 데이터 셋을 그룹으로 만들 수 있다. SISSA(International School of Advanced Studies)의 두 연구원들은 간단하고 강력한 원리에 기초한 CA의 한 종류를 개발하였다. 이것은 이러한 종류의 분석을 할 때 발생하는 가장 일반적인 몇 가지의 문제들을 해결할 수 있는 가장 효율적인 방법으로 증명되었다.

데이터 셋은 다양한 공간에서 데이터 포인트에 대한 클라우드로서 상상될 수 있다. 이러한 포인트들은 일반적으로 다르게 분포되기 때문에 한 면적에서 더 넓게 분포되거나 다른 면적에서는 더 조밀하게 분포된다. CA는 효율적으로 더 조밀한 면적을 감지하는데 사용되고 있으며, 이러한 기준에 기초한 상당한 서브셋의 특정한 숫자들 내에서 데이터를 그룹으로 만들게 된다. 각 서브셋은 목록에 따르게 된다.

“얼굴 사진에 대한 데이터베이스를 생각해보면, 데이터베이스는 같은 사람에 대한 한 가지 이상의 사진을 가지게 될 것이다. 그래서 CA는 각 개인들에 대한 모든 사진들을 그룹화하는데 사용된다. 이러한 종류의 분석은 자동화된 얼굴인식 시스템과 같은 곳에서 실행될 수 있다”고 SISSA의 통계학 및 생물물리학과 Alessandro Laio 교수가 설명했다.

“우리는 현재 사용되고 있는 것보다 더 효율적인 알고리즘을 개발하려고 노력했다. 그리고 기존의 CA에 대한 몇 가지 문제를 해결하려고 노력했다”고 Laio가 덧붙였다.

“우리가 개발한 방법은 클러스터의 중심인 서브셋을 감지하는 새로운 방법에 기초하고 있다”고 이 논문의 공동저자인 Alex Rodrigez가 설명했다. “지도를 액세스하지 않고 세계에 있는 모든 도시들을 감지하는 것을 상상할 수 있다. 우리는 결과를 얻기 위해서 간단한 규칙이 되는 경험을 확인하게 되었다”고 그는 덧붙였다.

만약 이웃들의 수를 세기 위해서 각각의 주민들에게 요청할 수 있는 도시인지를 알아내야 할 것이다. 즉, 얼마나 많은 사람들이 그의 집 주변 100m 내에 살고 있는지를 알아내야 하는 것이다. 우리가 그러한 수치를 가지게 된다면, 많은 사람들이 살고 있는 곳에서 각 주민들이 서로 가장 단거리에 살고 있는 사람을 찾을 수 있게 될 것이다. “이러한 두 가지의 데이터들은 모두 개인들이 살고 있는 곳이 얼마나 사람들로 밀집되어 있는지와 가장 가까운 이웃들 간의 거리가 어느 정도인지를 우리에게 알려주는 것이다. 자동으로 이러한 데이터를 크로스 체킹함으로써 우리는 모든 세계 인구들을 위한 클러스터의 중심을 나타내는 개인들을 감지할 수 있다. 이것은 다양한 도시에서 적용할 수 있다”고 Laio가 설명했다. “우리의 알고리즘은 이러한 종류의 계산을 정확하게 수행하며, 많은 다른 설정들을 적용할 수 있다”고 Rodriguez가 덧붙였다.

이러한 절차에 대한 성능은 최적인 것으로 증명되었다. “우리는 얼굴 사진에 대한 아카이브인 올리베티 얼굴 데이터베이스(Olivetti Face Database)에서 수학적인 모델을 테스트하였으며, 매우 만족스러운 결과를 얻게 되었다. 이 시스템은 대부분의 개인들을 올바르게 인식하였으며, 결코 긍정 오류(false positive) 결과를 만들어내지 않았다”고 Rodriguez가 설명했다. “이것은 어떠한 대상을 인식하지 못한 경우를 의미하는 것이 아니다. 그러나 이것은 서로 다른 개인들을 결코 혼동하지는 않는다. 다른 유사한 방법들과 비교하여 우리의 방법은 아웃라이어(outliers)를 제거하는데 특별히 효율적이다. 즉, 분석을 왜곡시킬 수 있는 다른 것들로부터 매우 차별화된 데이터 포인트를 가지고 있다”고 Rodriguez가 말했다. 

        
자료를 가져가실 때에는 출처 KISTI 미리안 글로벌동향브리핑을 밝혀 주시기 바랍니다.


경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com





본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
27 최적화 알고리즘을 최적화하는 방법 file 졸리운_곰 2015.01.28 314
26 커피숍에서 받게 되는 새로운 해커의 공격 file 졸리운_곰 2015.01.20 468
25 모바일 사용자 서비스에 대한 세 가지 예측 방향 졸리운_곰 2015.01.15 202
24 빅데이터보다 100배는 다루기 어려운 스몰데이터가 다가온다. file 졸리운_곰 2015.01.15 294
23 분석 소프트웨어의 고도화가 가장 큰 관심사인것으로 나타나 file 졸리운_곰 2014.10.30 371
22 데이터에 대한 잘못된 믿음 다섯가지 졸리운_곰 2014.10.14 303
21 향후 IoT의 근간은 5G가 될 것이지만, 보안위협 해결이 전제되어야 file 졸리운_곰 2014.10.14 321
20 보안성 구축에 가장 큰 위협은 내부사용자라는 주장 제기 file 졸리운_곰 2014.10.14 276
19 새로운 형태의 트래블 앱 개발 졸리운_곰 2014.07.21 2816
» 빅 데이터를 위한 간단한 새로운 알고리즘 file 가을의곰 2014.07.02 1221
17 미래 예측을 가능케 할 빅 데이터 file 가을의곰 2014.07.02 1251
16 구글이 선보일 스마트 홈 가젯과 웨어러블 장치 졸리운_곰 2014.06.30 673
15 2014년 정보보안 10가지 핵심기술 졸리운_곰 2014.06.30 247
14 정보 인프라에 큰 변화를 일으키고 있는 모바일 앱 졸리운_곰 2014.06.28 282
13 Bluetooth 4.1이 여는 새로운 IoT의 세계 file 졸리운_곰 2014.06.28 425
12 비주얼 검색 기술의 개발 졸리운_곰 2014.06.28 387
11 3-D로 매핑된 새로운 형태의 스마트폰 졸리운_곰 2014.06.07 514
10 ITU, 사이버공격 대응을 위한 글로벌 협력 활동 전개 file 졸리운_곰 2014.05.31 404
9 새로운 스타일의 컴퓨터를 본격적으로 채택하기 시작 졸리운_곰 2014.05.31 383
8 웹 컨퍼런싱 산업에서의 세가지 트렌드 : 중국시장을 중심으로 가을의 곰을... 2013.12.18 3802
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED