機械学習用のデータの準備
このチュートリアルでは、Machine Learning Managerを使用します。これは、OVHcloud Data Platformで利用できないForePaaS Legacy Platformのサービスです。現在のチュートリアルを参照してください。
シカゴ交通局で働いており、時間的および環境的要因に基づいて地下鉄駅が混雑するかどうかを予測するAIシステムを設定したいと考えています。
Photo by Skyler Gerald on Unsplash
AIモデルのデータを準備するために、以下の手順を実行します:
前提条件
このチュートリアルを実行する前に:
- このzipをダウンロードし、このガイドで必要な2つのデータファイルml_dataset.csvとml_sample.csvを含みます。
- ファイルをConnectorsに読み込みます:
- ファイルをConnectorsのSourcesタブに読み込みます。
- Analyzerでメタデータを抽出します。
- Lakehouse Managerでデータモデルを構築します:
- 両方のテーブル(それぞれml_datasetとml_sampleと名前を付けます)をTablesタブに追加します。
- 対応するLoadアクションを有効にすることを忘れないでください。
- 両方のテーブルの主キーとしてdateとstation_idが設定されていることを確認します。
- Playアイコンをクリックしてモデルを保存し、ビルドします。
- Data Processing Engine(DPE)で物理データを処理します:
- DPEを開き、Workflowsタブに移動します。
- 両方の新しく作成されたLoadアクションを含むワークフローを作成します。
- ワークフローを実行し、ジョブが完了するのを数分間待ちます。
- Lakehouse Managerに戻り、Tablesタブのリストビューで、両方のテーブルがデータで埋められていることを確認します(行数が0より大きい)。
準備完了です! 今作成したサンプルデータモデルは、今から構築する機械学習モデルで使用されます。
準備はできましたか? では、始めましょう! 🏃
最初のパイプラインを構築する
プロジェクトのホームページから、Machine Learning Managerを開きます。

歓迎ページを読むことをお勧めします。準備ができたら、New Projectをクリックします。

すべてのAIファイルは、生産レベルのバージョン管理を確保するためにForePaaSリポジトリ(Defaultと呼ばれる)に保存されます。独自のGitリポジトリに接続するオプションもあります。この方法については、Product Guideを参照してください。
ForePaas Platformでは、独自のトレーニング済みMLモデルをインポートし、Jupyter Notebooksを使用することもできます。独自のモデルを構築するため、Pipelineをクリックし、Get Startedをクリックします。

ForePaaS Platformで最初のMLパイプラインを作成しました。今、それを構成する時間です! 🔩
ヘッダーのパイプライン名をダブルクリックして、Chicago ML Pipelineに名前を変更します。

ForePaaSパイプラインは、データ前処理からデプロイオプションまでの5つの構成ステップで構成されています。このGetting Started for Machine Learningシリーズの各ガイドでは、そのうちの1つを扱います。すぐにライブ配信できるようになります!
データセットの準備
ソーステーブルの定義
Datasetパネルを開きます。

Lakehouse Managerで作成したデータモデルのデータを使用するため、Tablesを入力タイプとして選択します。

AIプロジェクトで使用されるデータは、通常、2つのサブセットに分かれています。1つはモデルをトレーニングするためのもの、もう1つはテストするためのものです。トレーニングデータを選択するには、Trainingの下でml_datasetを選択します。
このテーブルをテストデータのソースにもしたい場合は、TrainingとTestingの間のlink 🔗アイコンがアクティブになっていることを確認します。このアイコンをクリックしてオンとオフを切り替えることができます。

トレーニングデータとテストデータの割合を選択するには、Trainingに対してデータの85%、テストに対して15%にスライドバーを移動します。

Tablesの初期パネルに示されているように、入力テーブルの行のランダムな分割が行われます。このチュートリアルと同じ結果を得るために、分割の再現性をSeedで制御できます。シードとして27062020を記入します。

パイプラインは自動保存されます! 💾 いつでも終了して後で戻ってくることができます。
特徴量の定義
AIモデリングの次のステップは、XとYの変数を選択することです。Yは予測する値であり、Xはこの予測に影響を与える特徴量のセットです。この場合、シカゴ都市圏の地下鉄駅が混雑するかどうかを予測するために利用可能なデータを使用したいと考えています。
まず、Y値である「混雑」の結果を追加することから始めましょう。Yの横のAdd a sourceをクリックします。

次に、ml_datasetからis_overcrowdedを選択します。Yの可能な値は、駅が混雑している場合は1、混雑していない場合は0です。これらの結果を反映する説明を追加し、Saveを押します。

次に、X特徴量を追加します。Xの横のAdd a sourceをクリックします。

Add all variablesをクリックします。重複について心配する必要はありません。このオプションは、予測するY値をXに追加しません! ✨

前処理
上記の手順で、X変数を一括で追加しました。これは、各変数を1つずつ手動で追加する必要がないため便利です。ただし、すべての変数が追加されたため、本当にすべての変数が必要かどうかを確認する必要があります。 👀
例えば、ml_datasetのX変数の一部は冗長であり、予測に悪影響を与える可能性があります。変数を削除するには、変数行の右側のtrash 🗑 iconをクリックします。Xセットから以下の変数を削除します:

データセットは正常に構成され、クールな🤖機械学習に使用する準備ができました。 次のステップに進みましょう:トレーニング手順の選択と構成です。


