For AI agents: the complete documentation index is available at https://docs.dataplatform.ovh.net/ja/llms.txt, the full documentation bundle is available at https://docs.dataplatform.ovh.net/ja/llms-full.txt, and this page is available as Markdown at https://docs.dataplatform.ovh.net/ja/getting-started-organize-data.md.
  • 🇯🇵 日本語
  • データモデルの作成と構築

    Lakehouse Manager は、次に使用するコンポーネントです。Lakehouse Manager を使用して、データ構造を概念レベルで計画します

    目的

    Lakehouse Manager は、次に使用するコンポーネントです。このコンポーネントは、以下を制御します:

    • データウェアハウス
    • ポリシータグ管理

    Lakehouse Manager を使用して、概念レベル でデータ構造を計画します。これは、Tables 機能のお世話になります。

    Lakehouse Manager
    Info

    このチュートリアルは、Lakehouse Manager Engine を使用する Standard Datasets を対象としています。External Datasets で同じ手順を実行するには、こちらをクリックしてください。

    データをテーブルで整理する

    プライマリスキーマを作成する

    データモデルにテーブルを追加する

    メタデータの抽出が完了したら、次はテーブルダッシュボードに移動します。ここでは、すべてのデータの統一されたクエリ可能なビューを構築します。

    空のテーブルページは次のように表示されます。

    Lakehouse Manager

    すべてのテーブル タブでは、すべてのデータにアクセスできます。新しいビュー タブでは、データの一部のみを表示するビューを作成でき、大規模なチームでの協力が容易になります。このチュートリアルはシンプルなものなので、すべてのテーブル タブで作業してください。

    次に、プライマリテーブルとその属性の作成に集中しましょう。

    まず、画面右側の青い ➕ 新しいテーブル ボタンの上にカーソルを置きます。これにより、作成オプションが表示されます。

    • ファイルをアップロード
    • コネクタソースから作成
    • 空のテーブルを作成
    Info

    このチュートリアルでは、コネクタソースから作成 を進めます。ファイルをアップロードしてテーブルを作成するには、テーブルの作成 ドキュメントを参照してください。

    Lakehouse Manager

    コネクタソースから作成 をクリックすると、前のステップで表示されたソースのリストが表示されます。追加したいソースをクリックし、次に進むには 次へ をクリックします。ここではデフォルト設定を変更する必要はありません。

    Info

    テーブルを構築、テーブルを一度読み込み、後で読み込みアクションを生成する オプションは無効にでき、各ステップを個別に実行することもできます。詳細はこちらで詳しく説明されています。

    作成 をクリックし、同じ手順を2番目のテーブルでも繰り返します。

    Lakehouse Manager Lakehouse Manager
    Info

    テーブルページで変更を加えるたびに、視覚的な構成が自動的に保存されます。

    この段階で、テーブルページは次のように表示されるはずです。

    Lakehouse Manager
    Info

    プラットフォームは、アナライザステップでキャプチャしたメタデータ情報を使用して、テーブルを自動的に作成し、属性名とタイプを割り当てます。提供されたソースファイルはそのまま使用できますが、実際のプロジェクトでは、テーブルページにドラッグアンドドロップする前に、アナライザを使用してデータソースを確認する必要があります。

    集約テーブルを作成する

    次に、ソース(主に乗車、日付、温度)からすべての重要なデータを1つのテーブルに集約します。このテーブルは最終アプリケーションで使用されます。最初の集約テーブルを作成するには、青い ➕ アイコンをクリックします。空のテーブルを作成 を選択すると、新しいテーブル構成が表示されます。名前(例:dataset_history)を設定して保存します。

    lakehouse manager lakehouse manager

    新しく作成した空のテーブルに属性を追加する前に、画面右下のリストからキャンバスに表示を変更する必要があります。これにより、次の手順が容易になります。

    lakehouse manager lakehouse manager

    以下の属性をドラッグアンドドロップして dataset_history に移動します。

    元のテーブルドラッグアンドドロップする属性
    stations_ridesdate / lat / lng / rides / station_id / station_name
    chicago_calendar_fullmonth / temperature / week_day / week_day_label / weekend /
    lakehouse manager

    最後に、数値温度データを理解しやすいカテゴリ(寒い、暑いなど)に変換するのに役立つ新しい属性を作成する必要があります。

    まず、テーブル dataset_history をクリックすると、上部に ➕ アイコンが表示されます。これにより、テーブル内で属性を作成または編集できます。

    属性を次のように定義します。

    属性名タイプ性質
    cat_temperature文字列次元
    lakehouse manager
    Info

    この属性は現在物理的に指定されていませんが、心配しないでください! これはすぐに別のコンポーネントで実行されます:Data Processing Engineです。

    テーブルについてさらに詳しく

    ビルドを完了する

    Warning

    最後に素早く確認 ✋! 次のステップに進む前に、データモデルがスクリーンショットと完全に同じであることを確認してください。属性が不足している場合、チュートリアルの後続のステップで行き詰まる可能性があります。

    次に、青い ➕ アイコンの下にある ビルド アイコンをクリックして、データセット内のテーブルと属性を実際に作成/更新します。これにより、データがテーブルに読み込まれるわけではありません(これは次の記事で実行されます)。これは、基本的にテーブルと属性の論理スキーマを適用するだけです。

    lakehouse manager
    Info

    データの視覚的な論理スキーマは自動的に保存されますが、テーブルへの変更は、ビルドされない限りプラットフォームの他の部分に表示されません。

    このチュートリアルのビルドタスクは数分で完了するはずです。完了したら、次に進むことができます。

    バーチャル属性で関連メトリクスを追加する

    このモデルへのデータの物理的な処理(ETL/ELT)に進む前に、後で分析に使用する追加メトリクスを準備しましょう。このチュートリアルに従って構築している最終アプリケーションには、特定の駅での1日あたりの乗車数 を示すチャートが含まれています。

    lakehouse manager

    ただし、このチャートをプライマリソースに直接構築するための必要なデータはありません。特定の駅の1日あたりの平均乗車数を示すメトリクスが必要です。このメトリクスはクエリとダッシュボードで使用できます。

    しかし、プラットフォームを使用してこれを計算するにはどうすればよいでしょうか? その方法の1つは、バーチャル属性 を作成することです。バーチャル属性を使用すると、SQL式を計算できます。これらは必要に応じて計算され、データベースに保存されません。これらは最終ダッシュボードのクエリまたはチャートで使用できます。

    Info

    バーチャル属性の追加または編集には、スキーマの再構築は必要ありません。

    属性 ページに切り替えます。このページでは、データモデル内のすべての物理的およびバーチャル属性と、プロジェクト内のラインナンスを一覧表示できます。

    lakehouse manager

    新しい属性 ボタンをクリックして、バーチャル属性を作成します。

    lakehouse manager

    作成ウィンドウでは、バーチャル を領域として選択することを確認します。

    lakehouse manager

    次に、これらの2つの属性とそのSQLコードを追加します。

    属性名SQL
    avg_rides_per_day_per_stationSUM(rides)/COUNT(DISTINCT CONCAT(CAST(date AS VARCHAR), CAST(station_id AS VARCHAR)))
    yearmonthSUBSTR(CAST(date as VARCHAR),1,7)

    yearmonth 属性は、yyyy-mm 形式で年と月を提供します。これは後で使用します。

    Info

    インポートしたデータから新しい属性/メトリクスを生成するために、2つの異なる方法を使用したことに注意してください:集約テーブルに属性を追加 することと バーチャル属性 を使用することです。

    • 新しい物理属性を追加すると、ストレージを使用し、Data Processing Engineで物理的に定義する必要がありますが、これにより、データモデル全体を変更せずにその仕様を編集できるため、より厳密になります。
    • バーチャル属性は素早く実行できますが、スケーリング時に修正する必要がある場合、管理が難しくなる可能性があります。

    次に、Data Processing Engineに進み、次に何をするかを見てみましょう。

    Data Processing Engineでデータパイプラインを準備する

    さらに詳しく

    当社のソリューションを実装するためのトレーニングや技術的なアシスタンスが必要な場合は、営業担当者にお問い合わせください、またはこのリンクをクリックして見積もりを取得し、当社のプロフェッショナルサービスの専門家にプロジェクトのカスタム分析を依頼してください。

    DiscordチャネルでData Platformを構築するチームと直接やり取りし、質問をしたり、フィードバックを送信したり、交流したりしてください。

    OVHcloudサービスに関するサポートが必要な場合は、ヘルプセンターでリクエストを作成してください。

    ユーザーコミュニティに参加してください。