NumPy・pandas から、可視化・前処理・回帰・分類・モデル評価・教師なし学習、そして PyTorch と LLM まで。全50レッスンで「データを掃除し、モデルを作り、その数字を業務の言葉に翻訳できる」ところまで進みます。出力はすべて実際に実行した結果を載せています。
全50レッスンを7つの章に分けています。第1章から順に進めるのがおすすめですが、 気になるところだけ拾い読みしてもかまいません。 ※ numpy・pandas・scikit-learn を使うためブラウザ内では実行できません。第2回で作る仮想環境か Jupyter Notebook で試してください。
機械学習が何を自動化している技術なのかを整理し、環境を作って NumPy の配列を扱えるようにします。shape の読み方とブロードキャストは、この先ずっと使う土台です。
CSV を読み、集計し、結合し、欠損と外れ値を掃除して、グラフで確かめる。最後は 408 行の汚れた売上データを、把握 → 掃除 → 分析の 3 ステップで通しで扱います。
訓練データとテストデータを分ける理由から、線形回帰・評価指標・スケーリング・パイプラインまで。最後は数値とカテゴリが混在するデータで住宅価格の予測モデルを作りきります。
ロジスティック回帰から k 近傍法・決定木・ランダムフォレスト・勾配ブースティング・SVM まで、分類の主要な道具を実測で比べます。正解率が当てにならない場面の見分け方もここで扱います。
交差検証で評価の揺れを抑え、探索でパラメータを決め、過学習と不均衡に対処する。最後は解約予測モデルを、しきい値を期待利益で決めるところまで作ります。
正解ラベルの無いデータをグループに分け、次元を減らし、異常を見つける。最後は 1300 人の顧客をセグメントに分け、名前と施策をつけるところまで進みます。
NumPy だけでニューラルネットの中身を確かめてから、PyTorch で学習ループと CNN を書きます。最後はテキスト処理・LLM・モデルの保存とデプロイ、そして全50レッスンの振り返りです。
全50レッスンを終えたら、次はモデルを動かすサーバー側を Linux 入門 で、予測結果を返す Web アプリを Django 入門 で。メンバーシップで全コースが解放されます。