Load PySpark アクション
データ処理システムの最初のステップとして、接続されたソースからのデータに対して他のプロセスを実行する前に必要です
目的
Load PySpark アクションは、ソースからの生データを抽出し、データウェアハウスの主要テーブルに挿入します Apache Spark™を使用して。これは、接続されたソースからのデータに対して他のプロセスを実行する前に、通常、データ処理システムの最初のステップとして必要です。
言い換えれば、Connectorsを通じてコネクタを設定した場合、プロジェクトにはソースに接続する情報とそのメタデータが含まれていますが、Load PySpark アクションを使用して実際にロードするまで、実際のデータは含まれていません。
Load PySpark アクションは、次のソースコネクタのみと互換性があります:MySQL、PostgreSQL、Snowflake、Trino、AWS S31、Microsoft Azure Blob Storage、Data Platform Buckets、File Upload、およびS3。
Load PySpark アクションの設定
Load PySpark アクションを新規作成するには、Data Processing Engine(DPE)のActionsタブに移動し、New Actionをクリックし、Load PySpark アクションを選択します。
ソースと宛先の選択
Load PySpark アクションを設定するには、まずConnectorsのSourcesタブで既に設定したソースのリストから選択します。
次に、データを送信する宛先テーブルを選択します。ソースと同様に、テーブルはLakehouse ManagerのTablesタブで事前に設定する必要があります。データモデルを構築していない場合、テーブルはプラットフォームの他のコンポーネントからアクセスできません。
属性のマッピング
ソースと宛先が選択されたら、システムは自動的に宛先テーブルの宛先属性を、生データソースで識別した異なる列とマッピングします。
下の画像では、date属性の隣にメモ帳のアイコンの横に'1'という値があることがわかります。これは、Connectorsで定義されたデータ検証ルール、またはブループリントルールの数を示しています。データをロードする際に自動的に適用されます。ブループリントルールを使用すると、ユーザーはnull/空のセルのような無効なデータを迅速にフィルタリングしたり、日付や通貨のような値を再フォーマットしたりできます。
注意:宛先テーブルに生のテキストを直接挿入したい場合があります。例えば、データポイントの数をカウントしたり、後で集計テーブルで使用するラベルで特定のソースをタグ付けしたい場合などです。そのためには、< txt >を選択して、ソース属性を生のテキスト入力フィールドに設定します。
アクションの設定の構成
属性のマッピングに満足したら、設定タブに移動してアクション設定を構成します。
アクションの編集が完了したら、Createをクリックしてアクションを確定します。
アドバンスモード
アクションのJSON設定ファイルにアクセスする必要がある場合は、Advancedをページの上部にクリックしてアドバンスモードを有効にします。
さらに詳しく
当社のソリューションを実装するためのトレーニングや技術サポートが必要な場合は、営業担当者に問い合わせるか、このリンクをクリックして見積もりを依頼し、当社のプロフェッショナルサービスの専門家にプロジェクトのカスタム分析を依頼してください。
Data Platformを構築するチームと直接やり取りし、質問をしたり、フィードバックを送信したり、Discordの専用チャネルで交流したりできます。
OVHcloudサービスについてサポートが必要な場合は、ヘルプセンターでリクエストを作成してください。
ユーザーコミュニティに参加してください。
1: S3はAmazon Technologies, Inc.の商標です。OVHcloudのサービスはAmazon Technologies, Inc.によってスポンサーされ、承認され、またはその他の方法で提携していません。

