- 전체
- Sample DB
- database modeling
- [표준 SQL] Standard SQL
- G-SQL
- 10-Min
- ORACLE
- MS SQLserver
- MySQL
- SQLite
- postgreSQL
- 데이터아키텍처전문가 - 국가공인자격
- 데이터 분석 전문가 [ADP]
- [국가공인] SQL 개발자/전문가
- NoSQL
- hadoop
- hadoop eco system
- big data (빅데이터)
- stat(통계) R 언어
- XML DB & XQuery
- spark
- DataBase Tool
- 데이터분석 & 데이터사이언스
- Engineer Quality Management
- [기계학습] machine learning
- 데이터 수집 및 전처리
- 국가기술자격 빅데이터분석기사
- 암호화폐 (비트코인, cryptocurrency, bitcoin)
stat(통계) R 언어 [R lang 크롤링] R - 크롤링
2023.12.10 18:52
[R lang 크롤링] R - 크롤링
rvest 라이브러리 설치 및 임포트
install.packages("rvest")
library(rvest)
# 만약 오류가 나면 iconv로 인코딩 하면된다.
# UTF-8로 되어있으면 문제 없음
html <- read_html(iconv("주소", from = 'euc-kr',to='cp949'),encoding='cp949')
# character 인코딩 체계가 어떻게 되어있는지 확인(확률값)
guess_encoding(html)
# xpath로 텍스트 뽑아내기
html_nodes(html,xpath='//*[@id="old_content"]/table/tbody/tr/td[2]/text()')
예시 : 인공지능 신문 - 의료 AI 기사 크롤링
|
# html 주소 불러오기 html <- read_html("http://www.aitimes.kr/news/articleList.html") |
![]() |
|
# url 저장 url <- html_nodes(html,".list-titles")%>% |
![]() |
|
# 기사 내용 불러오기 news <- c() for(i in 1:length(url)){ html <- read_html(paste0("http://www.aitimes.kr",url[i])) text <- html_node(html,'#article-view-content-div')%>% html_text() news <- c(news,text) } |
![]() |
|
# 기사 내용 정제작업 t <- c() for(i in 1:length(news)){ x22 <- SimplePos22(news[i]) x22 str_match(x22, "[A-z가-힣]+/N") word_nn <- as.vector(na.omit(str_match(x22, "([A-z가-힣]+)/N")[,2])) t <- c(t,word_nn) word <- table(t) } |
![]() |
|
# 워드클라우드로 띄워보기 wordcloud2(word) |
![]() |
[출처] https://truman.tistory.com/161
[R lang 크롤링] R - 크롤링
rvest 라이브러리 설치 및 임포트
install.packages("rvest")
library(rvest)
# 만약 오류가 나면 iconv로 인코딩 하면된다.
# UTF-8로 되어있으면 문제 없음
html <- read_html(iconv("주소", from = 'euc-kr',to='cp949'),encoding='cp949')
# character 인코딩 체계가 어떻게 되어있는지 확인(확률값)
guess_encoding(html)
# xpath로 텍스트 뽑아내기
html_nodes(html,xpath='//*[@id="old_content"]/table/tbody/tr/td[2]/text()')
예시 : 인공지능 신문 - 의료 AI 기사 크롤링
|
# html 주소 불러오기 html <- read_html("http://www.aitimes.kr/news/articleList.html") |
![]() |
|
# url 저장 url <- html_nodes(html,".list-titles")%>% |
![]() |
|
# 기사 내용 불러오기 news <- c() for(i in 1:length(url)){ html <- read_html(paste0("http://www.aitimes.kr",url[i])) text <- html_node(html,'#article-view-content-div')%>% html_text() news <- c(news,text) } |
![]() |
|
# 기사 내용 정제작업 t <- c() for(i in 1:length(news)){ x22 <- SimplePos22(news[i]) x22 str_match(x22, "[A-z가-힣]+/N") word_nn <- as.vector(na.omit(str_match(x22, "([A-z가-힣]+)/N")[,2])) t <- c(t,word_nn) word <- table(t) } |
![]() |
|
# 워드클라우드로 띄워보기 wordcloud2(word) |
![]() |
[출처] https://truman.tistory.com/161
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
댓글 0
| 번호 | 제목 | 글쓴이 | 날짜 | 조회 수 |
|---|---|---|---|---|
| 공지 | 오라클 기본 샘플 데이터베이스 | 졸리운_곰 | 2014.01.02 | 86129 |
| 공지 | [SQL컨셉] 서적 "SQL컨셉"의 샘플 데이타 베이스 SAMPLE DATABASE of ORACLE | 가을의 곰을... | 2013.02.10 | 78632 |
| 공지 | [G_SQL] Sample Database | 가을의 곰을... | 2012.05.20 | 95353 |






