Ollama のセットアップから、トークンと temperature・Chat API・プロンプト設計・Tool use・RAG・本番運用、そして FastAPI の車両情報アシスタントまで。全50レッスンで、出来合いの LLM を使って「自分で AI アプリを組み立てられる」ところまで進みます。有料の API キーは使わず、手元のローカル LLM と自動車の公開データで実際に動かしたコードを載せています。
全50レッスンを7つの章に分けています。第1章から順に進めるのがおすすめですが、 気になるところだけ拾い読みしてもかまいません。 ※ Ollama やネットワークを使うコードはブラウザ内で実行できないため、第2回で用意するローカル環境(Ollama と Python)で試してください。ブラウザで実行できるのは、標準ライブラリだけで書ける部分です。
有料の API キーを使わず、手元の Ollama でローカル LLM を動かすところから始めます。トークン・出力の長さ・temperature と seed・モデルの選び方まで、LLM を部品として扱うための基礎をそろえます。
system・user・assistant の役割、マルチターン、ストリーミング、JSON 出力と、会話 API の使い方をひととおり押さえます。最後は履歴を持つターミナルチャットを組み立てます。
役割の指定・few-shot・XML タグ・出力フォーマットの固定と、プロンプトを部品として組み立てる型を身につけます。最後は小さな評価データを作り、プロンプトの良し悪しを数字で比べて改善します。
ツールを定義し、モデルからの tool_call を受けて自動車の公開 API(vPIC)を実行し、結果を返して最終回答まで回します。最後は、選び・実行し・答えるループを持つ最小のエージェントを作ります。
文書を埋め込みベクトルにし、コサイン類似度で検索し、長い文書はチャンクに切って、リコール文書を根拠に答えさせます。引用付きの回答と検索の評価を経て、資料に無いことを答えさせない落とし穴まで扱います。
コストの試算、レート制限とリトライ、タイムアウト、ログ、プロンプトインジェクションと個人情報、出力のガードレールと、公開前に要る守りを一つずつ足します。最後は決定的な出力を活かしたキャッシュで締めくくります。
ここまでの部品を組み合わせ、質問を種類ごとに振り分ける車両情報アシスタントを設計し、FastAPI のエンドポイントとして Web に出します。VIN の解読とリコールの RAG をエンドポイントに組み込み、テストで全体を確かめて締めくくります。
全50レッスンを終えたら、次はこのアシスタントをサーバーに載せて公開する サービス公開と運用 へ。メンバーシップで全コースが解放されます。