For AI agents: the complete documentation index is available at https://docs.dataplatform.ovh.net/ja/llms.txt, the full documentation bundle is available at https://docs.dataplatform.ovh.net/ja/llms-full.txt, and this page is available as Markdown at https://docs.dataplatform.ovh.net/ja/legacy/getting-started-ml-tuning.md.
  • 🇯🇵 日本語
  • モデルのハイパーパラメータを微調整する

    Warning

    このチュートリアルでは、Machine Learning Managerを使用します。これは、ForePaaS Legacy Platformのサービスであり、OVHcloud Data Platformでは利用できません。現在のチュートリアルを参照してください。

    このチュートリアルでは、Random Forestアルゴリズムのハイパーパラメータを設定し、最初のトレーニングとスコアリングジョブを実行します。

    Info

    ハイパーパラメータは、データサイエンティストが学習プロセスの前に設定する機械学習アルゴリズムの核心的な変数です。これは、オーブンの温度と調理時間を設定するようなものです。同様に、ハイパーパラメータの設定とは、トレーニングに使用される基礎となる数学モデルの特定の構成を指します。 Wikipediaでハイパーパラメータについてさらに学ぶ

    以下の手順を実行します:


    パラメータの最初の検索

    ハイパーパラメータチューニングスタジオに到着しました。現在のところ空っぽです🙇‍♂️が、すぐに貴重な洞察で埋めることができます!

    上部の2つのパネル、EstimatorとOptionsは、前のステップで選択したトレーニングアルゴリズムとスコアリング関数の概要を提供します。パイプライン内のスコアの色コードを変更することで、スコアグラデーションを構成できます。

    machinelearning

    ハイパーパラメータのリストに焦点を当てましょう。これは、ランダムフォレストアルゴリズムを構成するすべてのパラメータで埋められています。

    machinelearning

    ハイパーパラメータチューニングスタジオでは、複数の構成を生成し、トレーニングとスコアリングを行うことができます。これにより、最適なハイパーパラメータの組み合わせについての洞察を得ることができ、その組み合わせのいずれかを使用するか、検索の2回目の反復でより正確になることができます。デフォルトでは、各反復はスコアに基づいて最良のモデルのみを保存し、次のステップで使用するためのものです

    リストの最初の2つのパラメータはbootstrapcriterionです。これらはSingleモードで、デフォルト値TrueGiniのままにしてください。

    💡 すべてのパラメータには、アルゴリズムによって定義されたデフォルト値があります。

    machinelearning

    リストの3番目のパラメータはmax_depthです。これは、フォレスト内の各決定木の最大可能な深さを表します。

    💡 各ハイパーパラメータの説明を取得するには、名前の上にマウスを置きます。

    このパラメータのいくつかの値を探索してみましょう。ModeMultipleに設定し、ValueフィールドでNone値タグを削除し、57911、および13を入力します。

    machinelearning

    次に、リスト内のパラメータn_estimatorsを見つけます。これは、使用する決定木の数を定義します。 スコアは通常、木の数に応じて増加しますが、トレーニング時間と過剰適合のリスクも増加します。ModeMultipleに設定し、Valueフィールドで100値タグを削除し、50200、および400を入力します。

    machinelearning

    最後に、すべての他のパラメータの構成が以下のようになっていることを確認します:

    ハイパーパラメータモード
    max_featuresSingle'Auto'
    max_leaf_nodeSingleNone
    max_samples.SingleNone
    min_impurity_decreaseSingle0
    min_samples_leafSingle1
    min_samples_splitSingle2
    min_weight_fraction_leafSingle0
    random_stateSingleNone

    machinelearning

    パラメータリストの右上部にあるように、15の組み合わせを生成します。

    これで、パイプラインを初めて実行する準備が整いました。Playを押します。Dataset GenerationTrainingのみを有効にし、実行します。

    machinelearning

    ホットドリンクが必要です。☕️ その間に、ForePaaS Platformはデータセットを生成し、モデルをトレーニングし、検証セットで組み合わせをスコアリングするためのクラウドインスタンスを展開しています。

    5分後、すべてのジョブが完了し、次のステップに進むことができます:勝者モデルのデプロイ。

    ステップ4:モデル選択