PySpark와 pandas 데이터 프레임 간의 변환 최적화

Apache 화살표 는 JVM과 Python 프로세스 간에 데이터를 효율적으로 전송 하기 위해 Apache Spark에 사용 되는 메모리 내 칼럼 형식 데이터 형식입니다. 이는 pandas 및 NumPy 데이터를 사용 하는 Python 개발자에 게 유용 합니다. 그러나이는 자동으로 수행 되지 않으며, 모든 이점을 활용 하 고 호환성을 보장 하기 위해 구성 또는 코드를 약간 변경 해야 합니다.

PyArrow 버전

PyArrow는 Databricks Runtime에 설치 됩니다. 각 Databricks Runtime 버전에서 사용할 수 있는 PyArrow 버전에 대 한 자세한 내용은 Databricks Runtime 릴리스 정보를 참조 하세요.

지원 되는 SQL 형식

모든 Spark SQL 데이터 형식은 MapType , 및 중첩 된를 제외 하 고 화살표 기반 변환에서 지원 됩니다 ArrayType TimestampType StructType . StructType 는 대신로 표시 됩니다 pandas.DataFrame pandas.Series . BinaryType PyArrow가 0.10.0 보다 크거나 같은 경우에만 지원 됩니다.

PySpark 데이터 프레임를 pandas 데이터 프레임로 변환

PySpark 데이터 프레임를로 변환 하 고 PySpark 데이터 프레임에서 pandas 데이터 프레임을로 변환 하는 경우에는 최적화로 화살표를 사용할 수 있습니다 toPandas() createDataFrame(pandas_df) . 이러한 메서드에 대 한 화살표를 사용 하려면 Spark 구성을 spark.sql.execution.arrow.enabled 로 설정 합니다 true . 이 구성은 기본적으로 사용 되지 않습니다.

또한 spark.sql.execution.arrow.enabled Spark 내에서 계산 전에 오류가 발생 하는 경우에서 사용 하는 최적화가 비 화살표 구현으로 대체 될 수 있습니다. Spark 구성을 사용 하 여이 동작을 제어할 수 있습니다 spark.sql.execution.arrow.fallback.enabled .

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com

예제

Python
import numpy as np
import pandas as pd

# Enable Arrow-based columnar data transfers
spark.conf.set("spark.sql.execution.arrow.enabled", "true")

# Generate a pandas DataFrame
pdf = pd.DataFrame(np.random.rand(100, 3))

# Create a Spark DataFrame from a pandas DataFrame using Arrow
df = spark.createDataFrame(pdf)

# Convert the Spark DataFrame back to a pandas DataFrame using Arrow
result_pdf = df.select("*").toPandas()

화살표 최적화를 사용 하면 화살표가 설정 되지 않은 경우와 동일한 결과가 생성 됩니다. 화살표가 있는 경우에도 toPandas() 데이터 프레임의 모든 레코드를 드라이버 프로그램으로 수집 하 고 작은 데이터 하위 집합에 대해 수행 해야 합니다.

또한 모든 Spark 데이터 형식이 지원 되는 것은 아니므로 열에 지원 되지 않는 형식이 있으면 오류가 발생할 수 있습니다. 중에 오류가 발생 하면 createDataFrame() Spark는 화살표 없이 데이터 프레임를 만들도록 대체 합니다.

 

[출처] https://docs.microsoft.com/ko-kr/azure/databricks/spark/latest/spark-sql/spark-pandas

 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
공지 오라클 기본 샘플 데이터베이스 졸리운_곰 2014.01.02 86309
공지 [SQL컨셉] 서적 "SQL컨셉"의 샘플 데이타 베이스 SAMPLE DATABASE of ORACLE 가을의 곰을... 2013.02.10 78764
공지 [G_SQL] Sample Database 가을의 곰을... 2012.05.20 95510
42 블록체인 기반 플랫폼 비즈니스를 이해하자 졸리운_곰 2017.09.10 1554
41 다운타임 없는 서비스 구현 패턴 file 졸리운_곰 2017.09.10 1229
40 테이블의 수직분할과 수평분할에 대한 이해 file 졸리운_곰 2017.09.10 3910
39 정규화와 응집도에 대한 고찰 file 졸리운_곰 2017.05.28 1782
38 머신러닝 새 도전…“클라우드를 벗어나라" file 졸리운_곰 2017.05.28 1711
37 보안성 높이는 공공 거래장부 블록체인 file 졸리운_곰 2017.05.28 1757
36 디지털, 속도의 전쟁 VS 데이터, 품질의 전쟁 file 졸리운_곰 2017.05.05 1515
35 04. 데이터 모델링의 3단계 진행 file 졸리운_곰 2016.03.15 1659
34 데이터베이스 설계의 기본 원리.pdf file 졸리운_곰 2016.03.15 2353
33 실체유형(Entity Type) 정의 사항 및 도출 file 졸리운_곰 2015.05.21 2199
32 마농의 SQL 백문백답: 단순하고 쉽게 작성하는 SQL 노하우 [1회] file 졸리운_곰 2015.05.21 1830
31 sql개발자-sql전문가자격시험 시험 예제.pdf file 졸리운_곰 2015.02.15 2303
30 데이터베이스 선정에는 비밀이 있다 - 4부 졸리운_곰 2015.01.15 2099
29 데이터베이스 선정에는 비밀이 있다 - 3부 졸리운_곰 2015.01.15 2043
28 데이터베이스 선정에는 비밀이 있다 - 2부 졸리운_곰 2015.01.15 1828
27 데이터베이스 선정에는 비밀이 있다 - 1부 졸리운_곰 2015.01.15 2391
26 지금 우리에게 필요한 것은 데이터베이스 성능 최적화이다 (2부) 졸리운_곰 2015.01.15 1488
25 우리에게 필요한 것은 데이터베이스 성능 (1부) 졸리운_곰 2015.01.15 1780
24 21회 결과 secret 졸리운_곰 2014.11.10 0
23 [데이터아키텍쳐준전문가] 시험 fail 자료 secret 졸리운_곰 2014.08.31 0
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED