PySpark와 pandas 데이터 프레임 간의 변환 최적화

Apache 화살표 는 JVM과 Python 프로세스 간에 데이터를 효율적으로 전송 하기 위해 Apache Spark에 사용 되는 메모리 내 칼럼 형식 데이터 형식입니다. 이는 pandas 및 NumPy 데이터를 사용 하는 Python 개발자에 게 유용 합니다. 그러나이는 자동으로 수행 되지 않으며, 모든 이점을 활용 하 고 호환성을 보장 하기 위해 구성 또는 코드를 약간 변경 해야 합니다.

PyArrow 버전

PyArrow는 Databricks Runtime에 설치 됩니다. 각 Databricks Runtime 버전에서 사용할 수 있는 PyArrow 버전에 대 한 자세한 내용은 Databricks Runtime 릴리스 정보를 참조 하세요.

지원 되는 SQL 형식

모든 Spark SQL 데이터 형식은 MapType , 및 중첩 된를 제외 하 고 화살표 기반 변환에서 지원 됩니다 ArrayType TimestampType StructType . StructType 는 대신로 표시 됩니다 pandas.DataFrame pandas.Series . BinaryType PyArrow가 0.10.0 보다 크거나 같은 경우에만 지원 됩니다.

PySpark 데이터 프레임를 pandas 데이터 프레임로 변환

PySpark 데이터 프레임를로 변환 하 고 PySpark 데이터 프레임에서 pandas 데이터 프레임을로 변환 하는 경우에는 최적화로 화살표를 사용할 수 있습니다 toPandas() createDataFrame(pandas_df) . 이러한 메서드에 대 한 화살표를 사용 하려면 Spark 구성을 spark.sql.execution.arrow.enabled 로 설정 합니다 true . 이 구성은 기본적으로 사용 되지 않습니다.

또한 spark.sql.execution.arrow.enabled Spark 내에서 계산 전에 오류가 발생 하는 경우에서 사용 하는 최적화가 비 화살표 구현으로 대체 될 수 있습니다. Spark 구성을 사용 하 여이 동작을 제어할 수 있습니다 spark.sql.execution.arrow.fallback.enabled .

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com

예제

Python
import numpy as np
import pandas as pd

# Enable Arrow-based columnar data transfers
spark.conf.set("spark.sql.execution.arrow.enabled", "true")

# Generate a pandas DataFrame
pdf = pd.DataFrame(np.random.rand(100, 3))

# Create a Spark DataFrame from a pandas DataFrame using Arrow
df = spark.createDataFrame(pdf)

# Convert the Spark DataFrame back to a pandas DataFrame using Arrow
result_pdf = df.select("*").toPandas()

화살표 최적화를 사용 하면 화살표가 설정 되지 않은 경우와 동일한 결과가 생성 됩니다. 화살표가 있는 경우에도 toPandas() 데이터 프레임의 모든 레코드를 드라이버 프로그램으로 수집 하 고 작은 데이터 하위 집합에 대해 수행 해야 합니다.

또한 모든 Spark 데이터 형식이 지원 되는 것은 아니므로 열에 지원 되지 않는 형식이 있으면 오류가 발생할 수 있습니다. 중에 오류가 발생 하면 createDataFrame() Spark는 화살표 없이 데이터 프레임를 만들도록 대체 합니다.

 

[출처] https://docs.microsoft.com/ko-kr/azure/databricks/spark/latest/spark-sql/spark-pandas

 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
공지 오라클 기본 샘플 데이터베이스 졸리운_곰 2014.01.02 86727
공지 [SQL컨셉] 서적 "SQL컨셉"의 샘플 데이타 베이스 SAMPLE DATABASE of ORACLE 가을의 곰을... 2013.02.10 79056
공지 [G_SQL] Sample Database 가을의 곰을... 2012.05.20 95821
13 [데이터 수집 및 전처리] 주식 전종목 어떻게 불러올까? 거래소 종목 불러오기 file 졸리운_곰 2023.12.09 1703
12 [데이터 수집 및 전처리] [Python/파이썬]네이버증권API 활용 - 회사명, 종목코드 받아오기 file 졸리운_곰 2023.12.08 1510
11 [데이터 수집 및 전처리] 네이버 금융(차트)에서 주가 갈무리(크롤링)하기 file 졸리운_곰 2023.12.08 1497
10 [데이터 수집 및 전처리] 네이버 증권에서 일봉, 주봉 데이터 가져오기 file 졸리운_곰 2023.12.08 1501
9 [데이터 수집 및 전처리] (놀라운) 한글 데이터 짱! AwesomeKorean_Data file 졸리운_곰 2023.03.07 1200
8 [데이터 수집 및 전처리] Crawling, Scraping file 졸리운_곰 2022.05.21 1477
7 [데이터분석][데이터수집 전처리] MS 엑셀(Excel)에서 UTF-8 로 된 csv 파일 가져오기 file 졸리운_곰 2021.09.30 1417
6 카프카 설치 시 가장 중요한 설정 4가지 졸리운_곰 2021.07.13 1930
5 Prometheus Query(PromQL) 기본 이해하기 file 졸리운_곰 2020.12.17 1414
4 [인프라 모니터링 오픈소스] Prometheus 를 알아보자 file 졸리운_곰 2020.12.17 1912
3 Prometheus + Grafana 대시보드 file 졸리운_곰 2020.12.17 2493
2 Grafana란? file 졸리운_곰 2020.12.17 2162
1 Importing wikipedia dump to MySql 졸리운_곰 2020.10.04 2497
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED