- 전체
- Sample DB
- database modeling
- [표준 SQL] Standard SQL
- G-SQL
- 10-Min
- ORACLE
- MS SQLserver
- MySQL
- SQLite
- postgreSQL
- 데이터아키텍처전문가 - 국가공인자격
- 데이터 분석 전문가 [ADP]
- [국가공인] SQL 개발자/전문가
- NoSQL
- hadoop
- hadoop eco system
- big data (빅데이터)
- stat(통계) R 언어
- XML DB & XQuery
- spark
- DataBase Tool
- 데이터분석 & 데이터사이언스
- Engineer Quality Management
- [기계학습] machine learning
- 데이터 수집 및 전처리
- 국가기술자격 빅데이터분석기사
- 암호화폐 (비트코인, cryptocurrency, bitcoin)
stat(통계) R 언어 [R lang 크롤링] R - 크롤링
2023.12.10 18:52
[R lang 크롤링] R - 크롤링
rvest 라이브러리 설치 및 임포트
install.packages("rvest")
library(rvest)
# 만약 오류가 나면 iconv로 인코딩 하면된다.
# UTF-8로 되어있으면 문제 없음
html <- read_html(iconv("주소", from = 'euc-kr',to='cp949'),encoding='cp949')
# character 인코딩 체계가 어떻게 되어있는지 확인(확률값)
guess_encoding(html)
# xpath로 텍스트 뽑아내기
html_nodes(html,xpath='//*[@id="old_content"]/table/tbody/tr/td[2]/text()')
예시 : 인공지능 신문 - 의료 AI 기사 크롤링
|
# html 주소 불러오기 html <- read_html("http://www.aitimes.kr/news/articleList.html") |
![]() |
|
# url 저장 url <- html_nodes(html,".list-titles")%>% |
![]() |
|
# 기사 내용 불러오기 news <- c() for(i in 1:length(url)){ html <- read_html(paste0("http://www.aitimes.kr",url[i])) text <- html_node(html,'#article-view-content-div')%>% html_text() news <- c(news,text) } |
![]() |
|
# 기사 내용 정제작업 t <- c() for(i in 1:length(news)){ x22 <- SimplePos22(news[i]) x22 str_match(x22, "[A-z가-힣]+/N") word_nn <- as.vector(na.omit(str_match(x22, "([A-z가-힣]+)/N")[,2])) t <- c(t,word_nn) word <- table(t) } |
![]() |
|
# 워드클라우드로 띄워보기 wordcloud2(word) |
![]() |
[출처] https://truman.tistory.com/161
[R lang 크롤링] R - 크롤링
rvest 라이브러리 설치 및 임포트
install.packages("rvest")
library(rvest)
# 만약 오류가 나면 iconv로 인코딩 하면된다.
# UTF-8로 되어있으면 문제 없음
html <- read_html(iconv("주소", from = 'euc-kr',to='cp949'),encoding='cp949')
# character 인코딩 체계가 어떻게 되어있는지 확인(확률값)
guess_encoding(html)
# xpath로 텍스트 뽑아내기
html_nodes(html,xpath='//*[@id="old_content"]/table/tbody/tr/td[2]/text()')
예시 : 인공지능 신문 - 의료 AI 기사 크롤링
|
# html 주소 불러오기 html <- read_html("http://www.aitimes.kr/news/articleList.html") |
![]() |
|
# url 저장 url <- html_nodes(html,".list-titles")%>% |
![]() |
|
# 기사 내용 불러오기 news <- c() for(i in 1:length(url)){ html <- read_html(paste0("http://www.aitimes.kr",url[i])) text <- html_node(html,'#article-view-content-div')%>% html_text() news <- c(news,text) } |
![]() |
|
# 기사 내용 정제작업 t <- c() for(i in 1:length(news)){ x22 <- SimplePos22(news[i]) x22 str_match(x22, "[A-z가-힣]+/N") word_nn <- as.vector(na.omit(str_match(x22, "([A-z가-힣]+)/N")[,2])) t <- c(t,word_nn) word <- table(t) } |
![]() |
|
# 워드클라우드로 띄워보기 wordcloud2(word) |
![]() |
[출처] https://truman.tistory.com/161
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
댓글 0
| 번호 | 제목 | 글쓴이 | 날짜 | 조회 수 |
|---|---|---|---|---|
| 공지 | 오라클 기본 샘플 데이터베이스 | 졸리운_곰 | 2014.01.02 | 86127 |
| 공지 | [SQL컨셉] 서적 "SQL컨셉"의 샘플 데이타 베이스 SAMPLE DATABASE of ORACLE | 가을의 곰을... | 2013.02.10 | 78631 |
| 공지 | [G_SQL] Sample Database | 가을의 곰을... | 2012.05.20 | 95351 |
| 13 |
[데이터 수집 및 전처리] 주식 전종목 어떻게 불러올까? 거래소 종목 불러오기
| 졸리운_곰 | 2023.12.09 | 1701 |
| 12 |
[데이터 수집 및 전처리] [Python/파이썬]네이버증권API 활용 - 회사명, 종목코드 받아오기
| 졸리운_곰 | 2023.12.08 | 1509 |
| 11 |
[데이터 수집 및 전처리] 네이버 금융(차트)에서 주가 갈무리(크롤링)하기
| 졸리운_곰 | 2023.12.08 | 1495 |
| 10 |
[데이터 수집 및 전처리] 네이버 증권에서 일봉, 주봉 데이터 가져오기
| 졸리운_곰 | 2023.12.08 | 1499 |
| 9 |
[데이터 수집 및 전처리] (놀라운) 한글 데이터 짱! AwesomeKorean_Data
| 졸리운_곰 | 2023.03.07 | 1197 |
| 8 |
[데이터 수집 및 전처리] Crawling, Scraping
| 졸리운_곰 | 2022.05.21 | 1476 |
| 7 |
[데이터분석][데이터수집 전처리] MS 엑셀(Excel)에서 UTF-8 로 된 csv 파일 가져오기
| 졸리운_곰 | 2021.09.30 | 1415 |
| 6 | 카프카 설치 시 가장 중요한 설정 4가지 | 졸리운_곰 | 2021.07.13 | 1925 |
| 5 |
Prometheus Query(PromQL) 기본 이해하기
| 졸리운_곰 | 2020.12.17 | 1413 |
| 4 |
[인프라 모니터링 오픈소스] Prometheus 를 알아보자
| 졸리운_곰 | 2020.12.17 | 1906 |
| 3 |
Prometheus + Grafana 대시보드
| 졸리운_곰 | 2020.12.17 | 2488 |
| 2 |
Grafana란?
| 졸리운_곰 | 2020.12.17 | 2158 |
| 1 | Importing wikipedia dump to MySql | 졸리운_곰 | 2020.10.04 | 2494 |






