ラベル Machine Learning の投稿を表示しています。 すべての投稿を表示
ラベル Machine Learning の投稿を表示しています。 すべての投稿を表示

2020年8月23日日曜日

Dataiku DSS Ver8.0 新機能:Dataiku Applications

 

Dataiku DSS Ver8.0 がリリースされました。

今年の3月中旬にリリースされたDataiku DSS Ver7.0から、更に機能が追加された
Dataiku DSS Ver8.0が7月中旬にリリースされました。
ちょっと調べたのですが、おそらく世界でも早い方の機能レビューではないでしょうか。

詳細については、以下のリンクを参考にしていただくとして、数回に分けてVer8.0の機能をいくつかレビューをしていきます。

DSS Ver8.0 New Features

今回は作成されたFlowを使って、簡単にビジネスユーザーが利用するシンプルなアプリケーションを作成できる、Dataiku Applicationsについて説明をします。

Dataiku Applications とは

Dataiku Applicationとは、これまで作成されてきたDSS Projectをシンプルなアプリケーションに変換できる機能です。

実際のビジネス現場で利用される場合、依頼された現場の方や実際にデータを利用したい方へ分析した結果・機械学習を使った結果を提供されるかと思います。また、新しいデータセットを使って同じモデルの結果を得たいという要望も出てくるかと思います。

そういった要望を叶えるための機能がDataiku Applications になります。

使い方としては、以下のステップで作成することが可能です。

  1. Dataiku Applications 化したいプロジェクトを選択
    今回は、前回作成利用した、「キャンペーンに応募する顧客判定」のプロジェクトを利用します。

    Flowを開いて、ツールバーにあるApplication Designerを選択します。そうすると、Dataiku Applications を設定できる画面に遷移します。





  2. 利用者に行わせたいアクションを検討し、選択
    この画面で、
     -「新しいデータセットを選択できる」
     -「モデルの実行を行う」
     -「結果をDashboardで閲覧できる」
     -「アウトプットをダウンロードできる」
    の4つをユーザーが利用できるようにします。
    この画面の下の方に行くと、「ADD TILE」というボタンが表示されており、それを選択すると、選択できるアクションを見ることができます。

    ここでは、上記アクションを行うために、以下のTILEを選択します。
     -「新しいデータセットを選択できる」 → Upload file in dataset(Customer用)
                        → Upload file in dataset(Orders用)
     -「モデルの実行を行う」       → Run scenario
     -「結果をDashboardで閲覧できる」   → View dashboard
     -「アウトプットをダウンロードできる」→ Download datase


    それぞれ該当のアクションと対象となるデータセットなどの指定をしますと、準備完了です。

  3. Dataiku Applicationsの結果を確認。
    右上にある、SAVEボタンをクリックして一度保存します。その後、その隣りにあるTESTボタンをクリックすると、以下のような画面が表示されるかと思います。

    この画面のタイトルと説明はApplication Designerから自由に変更することが可能です。この画面では、先程指定した、ファイルのアップロード、シナリオの実行、Dashboardの閲覧、最終アウトプットデータのダウンロードが設置されています。

    実際にユーザーへの配布については、ログインした後のトップページにApplicationsという項目ができておりますので、こちらからアクセスしてもらってください。

今回は、Dataiku Applicationsで実際のデータを利用するユーザーに向けてのシンプルなアプリケーションを作成する方法を紹介してみました。

実際の現場では、ユーザー側から様々な要望(データを新しくしたいので、もう一度モデルを回してみてほしい、どのようにProjectを使えばよいかわからないから教えてほしい、結果のDashboardがみたい等々…)などの問い合わせをこちらのアプリケーションを上手に設定することで、一度に解決ができるようになるかと思います。ぜひ使ってみてください。

聞くよりも実際に触ってみたほうが実感が湧くかと思いますので、ぜひ触ってみてください。フリーエディションはずっと使えて、機能的にも十分に利用することが可能です!

[フリーエディション]

2020年8月15日土曜日

Dataiku DSS Ver8.0 新機能:Flow Zones

 

Dataiku DSS Ver8.0がリリースされました

今年の3月中旬にリリースされたDataiku DSS Ver7.0から、更に機能が追加された
Dataiku DSS Ver8.0が7月中旬にリリースされました。
ちょっと調べたのですが、おそらく世界でも早い方の機能レビューではないでしょうか。

詳細については、以下のリンクを参考にしていただくとして、数回に分けてVer8.0の機能をいくつかレビューをしていきます。

DSS Ver8.0 New Features

Flow Zones

まずひとつ目に紹介するのは、「Flow Zones」です。
これは、Flowに並べられた各オブジェクトが複雑化したり、長くなったりしたときに、グループ化してFlowの中で各処理がどのような意味があるのかをグループ化できる機能になります。

例えば、以下のようなFlowがあった場合、データをインポート、データ整形、機械学習(学習、スコアリング)がわかりにくい場合があります。このようなステップをFlow中に追加できる機能になります。(すでに作成されているFlowに対しても追加ができます)

実際にやってみよう

Dataiku DSSでこのようなFlowを作成してみました。このFlowは、顧客マスタと注文履歴と判定したい顧客リストを使って、キャンペーンに反応する顧客かどうかを判定するためのFlowになります。
ただ、このFlowだけだと一見してどの部分がどのような役割を果たしているのかが、少しわかりにくいのではないでしょうか。特にDSSに慣れていない方は理解するのに少し時間がかかるかと思われます。

そこで、実際にこのFlowを新機能のFlow Zonesを使って分けてみましょう。

[既存のFlow]

Flow Zones を作る際には、Flow内右上の「+ZONE」をクリックすると、以下のような画面が出てきます。ここでは、Flow Zoneの名前を決めます。この画面では、データインポートの部分のグループを作成したいので、「Data_Import」という名前をつけます。
同じように、データハンドリングのFlow Zoneの「Data_wrangling」、機械学習部分の「Machine Learning」というFlow Zoneを作成してます。

それぞれFlow Zoneを作成した後は、それぞれのオブジェクトをそれぞれのFlow Zoneに所属させます。オブジェクトを選択すると、右ペイン内に以下のようなパートが表示されます。
オブジェクトを選択した後、「Move」を選択すると、指定したFlow Zoneにオブジェクトが移動します。

この作業を今回作成した「Data_Import」、「Data_wrangling」、「Machine Learning」のそれぞれ実行します。

そうすると、これまでFlowとして一つにまとまっていたオブジェクトが、それぞれのFlow Zonesに別れたことがわかるかと思います。
これで、初めてこのProjectに触る人や、あとで修正したい人にとってもFlowがわかりやすくなったかと思います。

聞くよりも実際に触ってみたほうが実感が湧くかと思いますので、ぜひ触ってみてください。フリーエディションはずっと使えて、機能的にも十分に利用することが可能です!

[フリーエディション]




2020年4月6日月曜日

Dataiku Version7 新機能 : Github(Git)との連携

Dataikuが3月の中旬に新しいバージョンアップされました。前回は、Interactive Statistics を紹介して、DataikuのEDA(Exploratory Data Analysis)の機能が大幅に拡充されたのを紹介しました。

今回はGithubとの連携について紹介をします。
※ Github、Gitの使い方についてこちらでは紹介いたしません。こちらをご参考ください。

GithubへのSSHキーの設定

まずはGithubのアカウントの取得とSSHキーの設定をしてください。
GithubのSSHキーの設定の仕方はこちらになります。

サーバーの設定をしてからDataikuを起動

私はハマってしまったのですが、Dataikuが動いているサーバーのSSHキー設定が完了してから、Dataikuを起動してください。私の場合はそこがわからなかったため、Dataikuを先に起動し、後からSSHキーを設定したために、後述のRepositoryを設定する際にエラーが発生してハマってしまいました。

GithubへPush・Pull

では、実際にDataikuとGithubを連携してみましょう。
Githubの貢献したいRepositoryに移動し、以下のSSHのCloneアドレスを取得しましょう。
次に、Dataikuに移動し、連携させたいProjectを選択します。ツールバー>︙>Version Control を選択するとGithubと連携ができる画面に遷移します。
Add Remoteを選択すると、先程取得したアドレスを入力する画面が表示されます。
この入力画面で何もエラーがでなければ、無事にGithubの該当Reposirotyと接続ができています。ちなみに私はここでエラーに遭遇しまして、Permission Denied が表示されました。
無事にGithubに接続できたら、以下のような有効化された画面が表示され、設定したRepositoryにPush、Pullができるようになります。
また、新しいbranchを作成したい場合は、master▼をクリックすると、branchを作成できるメニューが表示されます。Create new branch をクリックします。
ここで表示されている、Duplicate project ~ を選択すると、次の画面に遷移します。この選択は、branch用に新しいProjectを作成するという意味になります。
また、Use current project ~ を選択すると、いま表示しているProjectで新しいbranchを作成することになります。

新しいbranchが作成されると、Project名の隣にbranch名が表示されます。



では、新しいbranchを作ってみたところで、実際にGithubの該当RepositoryにPushをしてみましょう。以下の画面まで行き、Pushをクリックしてください。
そうすると、メッセージが表示され、問題なくPushができたことがわかります。
Github側の画面に行くと、以下のように表示され、無事にPushができました。

Pullについても同様で、メニューリストからPullを選択すると、変更された内容が現在表示しているProjectに反映されます。

想定される使い方

Dataikuのコンセプトは、複数人(データエンジニア・マーケティング・データサイエンティスト等)が同時に扱えるというコラボレーションを重視した製品です。
反面、少し試したいこと(新しいデータセットを追加したり、モデルを変更したり等)については、現在の環境を直接変更することで行うしかありませんでした。こういった変更が後工程の人に影響を及ぼすことも容易に想像できます。

そういった事故を防ぐ、少し試してみたいという際にこのGithubの連携機能を使ってみることができそうです。

例えば、データセット・モデルのチューニングをする新しいbranchを作成して、試してみて問題なければMasterにMerge、MasterをDataikuのProjectにPullして使うという使い道がありそうです。

聞くよりも実際に触ってみたほうが実感が湧くかと思いますので、ぜひ触ってみてください。フリーエディションでも十分に利用することが可能かと思います。

[フリーエディション]


2020年3月29日日曜日

Dataiku Version7 新機能 : Interactive Statistics

Dataikuの最新バージョンがリリース

2020年3月16日週にDataikuの最新バージョンがリリースされました。
大きな目玉は、
  • Interactive Statistics
    • データセットの統計値(代表値)の算出・検定・分布・主成分分析・相関行列をワンクリックで表示
  • Enhanced Git Integration for Projects
    • Git(Github)との連携強化
  • Individual Prediction Explanations
    • 予測した各個別のデータがどのような変数から影響を受けたかを示す。
      (Interpretable Machine Learning:説明できる機械学習)
などです。

これまでは、Data Wringling(データ加工)やAutoML(自動的に適切なモデルを選択してくれる)などの特徴的だったのですが、今回のリリースではここ数ヶ月でトレンドとなっている「説明できる機械学習」や「Git(Github)との連携」などが組み込まれており、現場で機械学習を使う人、結果を解釈して判断をするマネージャー以上の人達にとっては嬉しい機能が盛り込まれています。

これから一つずつどのような機能がリリースされたのかを紹介していきます。

Interactive Statistics

これまでのDataikuでは、既存のデータセットの分析(代表値・分布など)を取得しようとすると、カラムレベルでAnalyzeをしたり、Chart タブを使いグラフを作成して、使おうとしているデータの特徴を掴む必要がありました。これらの機能は嬉しい反面、一つずつ選択する必要があり、面倒な部分もありました。

今回のバージョンアップで、そういった面倒な作業を行わなくても統計値を集計できるようになりました。また合わせて検定も行えるように実装がされています。

Statisticsの種類

これからは、みなさん大好きな iris(アヤメのがくの長さ、花びらの長さのデータ)を使って紹介します。ちなみにこのデータセットはRStudio から AWS S3に保存して、Dataikuで読み出しています。RStudioからAWS S3へのエクスポートの仕方はこちらの記事を参考にしてください。

データセットをインポートした後、インポートしたデータセット開くと、画面上のメニューに「Statistics」が追加されています。ここからInteractive Statisticsを実行ができます。


このStatisticsをクリックすると、どの分析をするかを聞かれます。
水色背景で記載をどのような分析ができるかを追記しています。


Univariate Analysis

まずは、Univeriate Analysis(一変量統計)を選択してみましょう。
Univariate Analysisを選択すると、以下のように変数を選択することができます。
この場合はすべての変数を選択しています。(左側の1 available variables から右側のVariables to describeに各変数をドラッグアンドドロップできます)
また、Optionsでは作成するチャートを選択できます。

選択後、右下の「CREATE CARD」をクリックすると実行され、以下のようなチャートが自動的に生成されます。数値項目については箱ひげ図や四分位点、Percentileが表示され、テキスト項目(グルーピングに使う項目)は棒グラフとFrequecyが表示されます。

また、あるグループごとで集計した結果を見たい場合もあるかと思います。
その際は、Splitを使います。
Splitを使ってみると、グループごとで集計して統計値を返してくれます。
今回はirisのデータの中のSpeciesを使ってグループごとに集計をしています。
同じチャートがこの後設定した数値変数ごとで続きます。


RやPythonを使うと一つ一つの集計やチャート作成にコードを作成する必要がありますが、このStatisticsを使うとコードを書かずともこのような数字・チャートを作成することが可能です。

Statistical Test

次はStatistical Test、日本語だと「検定」になります。今回のバージョンアップで利用できるようになった検定方法は以下となります。


今回は比較的よく使うであろう、t検定(Two-sample test > Student t-test)を行ってみます。二つのグループの平均値に違いがあるかどうかを検定します。

Two-sample test から Student t-test を選択すると、以下のような画面が表示され、それぞれ変数を選択し、比較したいグループを入力します。
今回は、分析対象として、Sepal.Length を選択し、比較カテゴリはSpecies内のsetosa と versicolor を選択しています。この2つのグループのSepal.Lengthの平均値が異なっているかどうかを検定します。
右下のCREATE CARDをクリックすると、以下のような結果が表示されます。
一番下に結果が表示され、この2つのグループの平均値は異なるということがわかりました。

Correlation Matrix

相関行列です。統計を始めたばかりの人にはあまり馴染みが無いかもしれませんが、相関係数を行列形式で表示し、どれとどれの変数の相関が強いのかをひと目で分かるものです。
Correlation Matrixを選択すると、以下のような画面からスタートします。
相関行列を作成したい変数をVariablesに移したら、右下のCREATE CARDをクリックします。そうすると、以下のような相関行列が表示されます。

こちらもUnivariate Analysisと同様にSplitをすることができます。
以下は上で作成した相関行列をSpeciesで分割した結果となります。種類によって相関行列の値が異なることがひと目で分かるかと思います。

Principal Components(主成分分析)

最後は、主成分分析です。変数をまとめて(縮約)して解釈をしやすい形にしてくれる分析手法になります。
Principal Components を選択し、どの変数を対象にするかを選びます。今回は数値項目すべてを選択しました。

必要な変数を選択したら、いつものように右下のCREATE CARDををクリックすると、以下のようなチャートが作成されます。
PCAを行ったことがある方はご存知かもしれませんが、左側のチャートが第一主成分 〜第四主成分までを表し、線グラフが累計割合を示しています。
下のグラフは各変数ごとに第一主成分〜第四主成分がどのような構成になっているかを示しています。

これまで紹介した一部の内容が一つのWorkSheet 単位にまとめられます。このWorkSheetは新規に追加したり、複製させることができます。


また他の人とデータセットの分析結果を共有したいと場合は、「︙」 をクリックし、Publishが出てくるので選択します。そうすると、どのDashboardに掲載するかの画面が表示されます。選択し終わると、今回作成した分析結果をDashboardに取り込むことができ、共有することが可能です。


 今回作成した結果(PCA・t検定・一変量統計の結果)を一枚のDashboardに取り込むことができました。これを他のユーザーと共有することで、どのようなデータセットなのかが他のユーザーもひと目で分かります。

まとめ

今回のバージョンアップの目玉の一つである、Interactive Statistics はこれまでRやPythonで一つずつコーディングが必要だった作業を、変数選択するだけで集計・チャートを作成してくれるだけでなく、検定や主成分分析もサポートしています。

データサイエンスで大事な作業として、分析対象のデータがどのような分布をしているかを理解するのが大事で、この機能を使うことで探索の時間が短縮されるのではないかと感じました。

次回以降は残り2つの紹介をしていきます。

2020年1月1日水曜日

Dataikuを使ってみよう #4 DataikuのAutoML(機械学習の自動化)

これまでの記事では、Dataikuでできるデータ加工、データハンドリングやデータ分割を掲載してきました。
いよいよ、データ分析の醍醐味である、メインイベントである「データモデリング」について、Dataikuではどのように行うのかを紹介します。

従来のデータモデリング

従来のデータモデリングは、データを加工・変換し、モデリングのロジックを「ひとつずつコーディング」していく必要がありました。例えば、ロジスティック回帰とRandom Forestの両方のロジックを比較したい場合は、一つずつコードを書き、パラメーターを設定し実行、結果が思わしくない場合や新しいロジックを追加…とコーディング作業が必要でした。

Dataikuでは、よく利用するアルゴリズムがデフォルトで組み込んであり、マウス選択という簡単な操作でモデルを実行、比較をしてくれます。次からはどのようなステップで実行するかを確認していきます。

DataikuでAutoML(機械学習の自動化)

Dataikuでは分析したいモデルをクリックするだけで複数モデルを走らせることができます。
最近では、このような機能のことを最近では「AutoML」と言われているようです。

AutoML(Automated Machine Learning: 自動化された機械学習)とは?https://www.atmarkit.co.jp/ait/articles/1901/06/news029.html
では、Dataikuではどのように利用できるのかを見ていきましょう。

最初に考えておくべきこと

まず最初に大事なことは、分析対象の項目を「予測したい」のか、「分類したい」のかを決めておきます。なぜかというと、モデルを適応させる際に選択をしなければいけないためです。
今回はDataikuのチュートリアルで提供してある、以下の内容のデータフローを利用します。モデリングを適応する前までの準備は、すでにこれまで紹介してきた記事で対応が可能です。

実際にアルゴリズムを回してみる(Prediction)

今回は、上記のサンプルのように、「メンテナンスが必要な資産がどれかを予測するための分析」をしてみましょう。

まずは、以下のように分析をしたい対象のデータセットを選択して、右ペイン中の「LAB」をクリックします。

そうすると、以下の画面が表示され、どのプロセスに進むかを選択できます。ここでは、すでにデータ加工については終わっているものとして、「Quick Model」を選択します。

右ペイン中の「Code Notebook」はPythonやR、Scala、SQL、Hive、Impalaなどを使ってカスタマイズしたコードを入力できます。また、「PREDEFINED」はすでに定義済みのコードを利用できるものになります。自分でコードを書いて分析をしたい、カスタマイズをしてやりたいというユーザーはこちらを利用することをお勧めします。


Quick Modelを選択したら、次のが画面が表示され、「Prediction」か「Clustering」かを選択する必要があります。今回は、資産の故障予測を行いたいため、Predictionを選択します。
Predictionを選択した後は、予測をしたい分析項目を指定します。ここでは、「Failur bin」を指定しましょう。
選択すると、以下のように選択肢が表示されます。

ここでは、「Automated Machine Learning」を選択しましょう。
「Expert Mode」は、Deep Learningの適応やPython、Scalaで自分自身で独自の推定量(Estimator)を書くことができますい。

Automated Machine Learningを選択した後、以下のような画面が表示されます。ここでは「Quick Prototypes」を選択します。ほかの選択肢もありますが、後日説明をします。
選択後、右下の「CREATE」ボタンをクリックして前準備は完了です。
準備が完了すると、以下のような画面になります。最初は何も表示されていませんが、分析対象データセットの変数やアルゴリズムの選択などをするために、「DESIGN」タブをクリックします。
左ペイン中にいくつかのメニューが並んでおり、それぞれデータセットに関するものやアルゴリズムに関して設定を変更することが可能です。

Train/Test Set では、アルゴリズムを適応するデータセットの分割方法について指定ができます。サンプリングの割合や具体的な行数を指定したりすることが可能です。
次にMericsの画面では、何を指標として最適化を目指すのかを指定することが可能です。AUCなのかLoglossなのか、Accuracyなのか…。分析の目的にあった指標を選ぶことで、それぞれのモデルで最適な値を目指して学習をしてくれます。
Feature Handlingの画面では変数の取り扱いをどうするかを選択できます。分析対象に各変数を入れるかどうか、欠損値だったらどう扱うかなど、処理を行うことができます。また、項目内の値も分布として表示されますので、
Feature Generationは、変数結合(Pairwise liner combinations / Pairwise polynomial combinations / Explicit pairwise interactions)  を選択することができます。これらは複数組み合わせることも可能です。ただし、お気づきのように変数組みあわせとなるので、元の変数が多い場合は、多数の変数組み合わせが発生するため、アルゴリズムを実行する際に時間がかかるので注意をしてください。

Feature Reductionは上記と反対で、変数を減らす方法を指定できます。分析対象との相関が強いもの、Tree-Based、PCAを使った変数選択などを利用できます。


続いて、Modelingの項目に移ります。

Algorithm では、Dataikuで事前に組み込まれたどのアルゴリズムを利用するかを選択することができます。Predictionで選べるモデルは11種類(Random Forest、XGB、ロジスティック回帰、SVMなど)あり、On/Offを選択するだけで適応できます。
また、選択したアルゴリズムの右側にはそれぞれのアルゴリズムのパラメータを指定することが可能です。パラメータを変更したい場合には役に立つかもしれません。


HyperParameters では、Grid Searchの反復回数や並列数の指定、クロスバリデーションのやり方などを指定することができます。
これら以外の項目もありますが、ここでは割愛します。

様々な選択項目を紹介して設定するところが多いなと感じられたかもしれません。
しかし指定できる内容はコードで指定する部分がカバーされていて、マウスのみで指定できるため、実際コードを書くよりはかなり楽に指定ができます。
最低限、Algorithm の項目で使いたいアルゴリズムを選ぶだけでも動かすことは可能です。そのような場合の結果はベンチマークとして利用するのもよいかもしれません。

では実際に動かしてみましょう。
必要な設定が完了したら、右上にある「Train」ボタンをクリックして実際にアルゴリズムを回してみましょう。

Trainボタンをクリックすると、画面が切り替わり、しばらくすると以下のように結果を返してくれます。
左ペインには指定したアルゴリズムが表示され、指定した評価メトリックが計算されます。適応したアルゴリズムの中で、一番良いアルゴリズムには、トロフィーマーク🏆が表示されます。
また、中央ペインのグラフは時間と評価メトリックのグラフが表示されます。その下には、各アルゴリズムの影響度の高い変数が表示されます。一つの画面で各アルゴリズムの結果が分かりやすく表示されます。

各アルゴリズムの詳細な結果を見る場合には、左ペイン中の各モデルをクリックしてください。
今回は一番スコアの良かった、Random Forestを参照しています。先ほどの設定と同様に、左ペインで様々な結果を表示できます。
(今回はすべての項目を紹介するのは難しいため、主だった項目のみ紹介します)

まずはDecision Tree。 決定木のように、どの項目が分岐になったのかを確認することができ、しかも改装をインタラクティブに深堀することが可能です。

続いて、Valuable Importance。 データサイエンスをやったことがある方であれば一番最初に見る綱目ですね。重要な変数になります。
次に Confusion Matrix(混合行列)。 これもよく見るのではないでしょうか。こちらも表を見るだけでなく、Cutoff部分をスライダーにて動かすことができるため、インタラクティブにAccuracyを計算することができます。

Lift Chart はチャートが2つあり、ランダムなパターン(線形のパターン)に対して今回のモデルがどのぐらいリフトするのかを見ることができます。

ROC curv。 ROC曲線といわれるチャートもDataikuでは結果として自動で作成してくれます。


これら以外でもGrid Searchの結果や、どの変数を適応したのかなど、適応したアルゴリズムに対して、様々な情報を自動的に計算をしてくれます。

実行時間は、データセットの大きさやどのぐらいアルゴリズムを選択したか、Dataikuを動かしているマシンのスペックにもよりますので一概に言えませんが、これだけの情報(結果)をDataikuは返してくれます。

結果をスコアリングしてみる

上記のようにどのアルゴリズムが良さげなのかがわかったので、実際にデータに対して適応をしてみます。

スコアリングさせたいアルゴリズムをクリックして、詳細画面を表示させます。
そして、右上に「DEPLOY」ボタンが表示されているので、クリックします。
次の画面で新しいモデルとしてDeployするか、もしくは既存のモデルをUpdateするかを選択します。ここでは、新しいモデルとしてDeployをします。(Deploy as a new retrainable modelを選択)
そうすると、以下のようなアイコンが表示されます。これで選択したアルゴリズムをDeployできました。
続いては、Deployしたアルゴリズムを使ってスコアリングをしてみます。
スコアリングは、Deployしたアルゴリズムを選択して、右ペイン中の「Score」 アイコンを選択します。
次の画面で左ペインにインプットのデータセットの指定、その下に予測するためのモデルを選択し、右ペインにアウトプットのデータセット名を入力します。(既存のデータセットを上書きしたい場合は、下のUSE EXISTING DATASETをクリックして、既存のデータセットを選択します)
選択し終わったら、右下のCRATE RECIPE をクリックします。

次の画面では内容の確認を行います。特に問題がない場合は、右下の「RUN」ボタンをクリックするとスコアリングが始まります。
実行が終了すると、Flow上では以下のように表示されます。
結果のデータセットを見てみると、右側のほうに数列結果が追加されています。(Proba_0,Proba_1,Prediction) 

これでスコアリングまでが終了しました。

再度モデルを調整しなおしたい場合

モデルを評価したり、スコアリングの結果をやり直ししたい場合が出てくるかもしれません。
もちろん、その場合もやり直しをすることが可能です。

Deployしたモデルを再度クリックをします。
現在スコアリングに適応がされているモデルが表示されます。右上の「VIEW ORIGINAL ANALYSIS」をクリックすると、上記のアルゴリズムを設定した画面に戻ります。ここで上記と同様にアルゴリズムを選択したり、パラメータを変更したりしてみます。
変更が完了したら、前回と同様に右上の「TRAIN」ボタンをクリックします。

その後、結果が返ってきますが、異なる点が出てきます。それは、実行履歴が残るという点です。
以下の赤下線のように、SESSION1とSESSION2の項目ができています。SESSION1は初回実行、SESSION2は今回実行した結果です。

アルゴリズムのパラメータ調整や新しいアルゴリズムの適応など何回かやり直しても、前回の結果が残っているため、比較もしやすいし、元にも戻れます。

新しい結果をもとに再度スコアリングしたい場合は、上記の説明のように、再度スコアリングの操作をしてもらえれば結果が適応されます。

まとめ

ここまで、分析の醍醐味であるアルゴリズムやパラメータの設定・選択、実行、スコアリング をDataikiuでどのように行うのかを紹介しました。

説明上、複数の画面を説明をして長い説明になっていますが、実際にやってみると、とても簡単に複数の機械学習の実行がされ、スコアリングも容易に実行ができることが実感できると思います。
RやPythonなどのコードを書くよりも簡単に利用できます。

ぜひ触ってDataikuの便利さを体感してみてください。

[フリーエディション]