For AI agents: the complete documentation index is available at https://docs.dataplatform.ovh.net/ja/llms.txt, the full documentation bundle is available at https://docs.dataplatform.ovh.net/ja/llms-full.txt, and this page is available as Markdown at https://docs.dataplatform.ovh.net/ja/developers-python-sdk-reference.md.
  • 🇯🇵 日本語
  • SDK リファレンス: connect と bulk_insert

    カスタムアクションSDKのすべてのスクリプトが始まる2つの関数: データセット、テーブル、バケット、またはソースに接続するためのconnect()

    目的

    Custom Actions SDKのすべてのスクリプトが始まる2つの関数: connect()はデータセット、テーブル、バケット、またはソースに接続するためのものであり、bulk_insert()はデータフレームを書き戻すためのものです。

    connect 関数

    connect()関数は、ほとんどの場合、Projectと相互作用するための主要なエントリーポイントです。

    この関数は接続文字列をパラメータとして受け取り、Connectorオブジェクトを返します。 例えば:

    from forepaas.dwh import connect
    
    connection_string = "dwh/default_dataset/"
    connector_default = connect(connection_string)

    接続文字列を変更して、Data Platform環境内の異なるソースに接続します。 その結果、connect(...)によって返されるオブジェクトと利用可能なメソッドは異なります。

    Connectors and Connection Strings記事では、各オプションについてより詳しく説明しています。以下に、2つの一般的なコネクタのメソッドリストを示します:

    bulk_insert 関数

    bulk_insert()関数は、SDKの非常に重要な部分です。これを使用して、データをテーブルに挿入できます。以下のコードのように、Dataset Connector、テーブル名、およびpandas DataFrameをパラメータとして受け取ります。

    import pandas as pd
    from forepaas.dwh import connect
    from forepaas.dwh import bulk_insert
    
    # make connection to the default dataset
    cn = connect("dwh/default_dataset/")
    
    # extract data from the table with no SQL required
    df = cn.select("stations_rides")
    
    # perform your custom transform in the dataframe
    df.loc[df["station_name"] == 'Harlem-Lake', "rides"] = 0
    
    # reinsert your dataframe in the destination table
    stats = bulk_insert(cn, "stations_rides", df) 

    bulk_insert(connector, table, data, source_default_schema=, batch_size=None)

    入力パラメータ

    名前タイプ説明
    connectorConnectorconnect()関数からのコネクタインスタンスcn = connect("dwh/default_dataset/")
    tablestrデータがロードされる先のテーブル名-
    dataframepandas.DataFrame挿入するデータのデータフレーム。ターゲットテーブルと同じ列名と型を持つ必要があります。-
    default_schemadict--
    batch_sizeint挿入バッチサイズ-

    出力

    タイプ説明
    Tuple(stats, error)挿入の統計のタプル-

    PySpark サポート

    Data Platformは、PySparkを使用してデータを処理するための広範なサポートを提供しています。 すべては、ConnectorオブジェクトのSpark互換メソッドを通じて行われます。 さらに詳しい情報については、PySpark記事を参照してください。

    さらに深く掘り下げる

    トレーニングや技術的なアシスタンスが必要な場合は、営業担当者にお問い合わせください、またはこのリンクをクリックして、プロフェッショナルサービスの専門家にカスタム分析を依頼するための見積もりを取得してください。

    Discordの専用チャネルで、Data Platformを構築するチームと直接質問し、フィードバックを共有し、交流してください。

    OVHcloudサービスについてサポートが必要な場合は、ヘルプセンターでリクエストを作成してください。

    ユーザーコミュニティに参加してください。