PySparkのユースケース
Data Platform Python SDKを使用した5つのPySparkユースケース:バケットの読み取りからオブジェクトストレージへの書き込みまで
目的
このガイドでは、Data Platform Python SDKを使用した5つのPySparkユースケースについて説明します。バケットからの読み取り、SQLを使用したデータベースのクエリ、DataFrameの抽出、バケットまたはオブジェクトストレージへの書き込みです。
ユースケース1:バケットから読み取り、データセットに書き込み
このサンプルでは、Data Platform Bucketのbucket_testからデータを取得し、Lakehouse Managerのdefault_datasetデータセットに挿入する方法を示します。
接続文字列の詳細については、Data Platform Buckets ConnectorとLakehouse Manager Dataset Connectorを参照してください。
ユースケース2:データベースをSQLでクエリ
このサンプルでは、Data Platform Connector objectのget_spark_options()およびget_spark_context()メソッドを使用してデータベースをクエリする方法を紹介します。
このユースケースはMySQL、PostgreSQL、Snowflakeのみで動作します
ユースケース3:PySpark DataFrameを抽出(オプション付き)
このサンプルでは、extract_dataframe()メソッドを使用してSpark DataFrameを素早く抽出する方法と、get_spark_url()、get_spark_context()、およびget_spark_session()メソッドを使用して手動で行う方法を示します。
ユースケース4:別のバケットに書き込み
このサンプルでは、get_spark_url()メソッドを使用して、1つのData Platform Bucketから別のバケットに書き込む方法を示します。
ユースケース5:insert_dataframeを使用してオブジェクトストレージに書き込み
insert_dataframe()関数は、前のユースケースの操作を簡素化します。
これは、互換性のあるオブジェクトストレージタイプのPySparkコネクタ(現在のData Platform Buckets、S31、およびAzure Blob Storage)で利用可能です。
PySparkでPySpark DataFrameをファイルシステム(例:S3)に保存すると、PySparkは分散処理を行うため、単一のファイルの代わりにフォルダーを作成します。このフォルダー内には、DataFrameのパーティションを表す複数のpart-*.csvファイルが生成され、ファイルの数はDataFrameのパーティション数に依存します。また、成功した書き込み操作を示す空の_SUCCESSファイルも作成されます。
さらに詳しく
当社のソリューションを実装するためのトレーニングや技術サポートが必要な場合は、営業担当者にお問い合わせください、またはこのリンクをクリックして見積もりを依頼し、当社のプロフェッショナルサービスの専門家にプロジェクトのカスタム分析を依頼してください。
Data Platformを構築するチームと直接やり取りし、質問をする、フィードバックを提供する、専用のDiscordチャネルに参加してください。
OVHcloudサービスについてサポートが必要な場合は、ヘルプセンターでリクエストを作成してください。
ユーザーコミュニティに参加してください。
1: S3はAmazon Technologies, Inc.の商標です。OVHcloudのサービスはAmazon Technologies, Inc.によってスポンサー、承認、または提携されていません。

