これはインタラクティブなノートブックです。ローカルで実行することも、以下のリンクから利用することもできます。
Leaderboard クイックスタート
このクイックスタートでは、W&B Weave Leaderboard を使って、複数のデータセットやスコアリング関数にまたがるモデル性能を比較する方法を紹介します。最後には、複数のモデルを共通の評価セットに対してランク付けした leaderboard を公開できるようになります。これにより、各メトリクスでどのモデルが最も優れているかを特定できます。このガイドは、Weave で評価を実行したことがあり、その結果を並べて比較したい開発者を対象としています。 具体的には、次のことを行います。- 架空の郵便番号データのデータセットを生成します。
- スコアリング関数をいくつか作成し、ベースラインモデルを評価します。
- これらの手法を使って、複数のモデルと評価の組み合わせを評価します。
- Weave UI で leaderboard を確認します。
Step 1: ダミーの郵便番号データのデータセットを生成する
まず、ダミーの郵便番号データのリストを生成する関数generate_dataset_rows を作成します。この合成データセットにより、leaderboard で各モデルをスコアリングする際に使用する、一貫した入力セットと期待値が得られます。
Step 2: スコアリング関数を作成する
次に、3 つのスコアリング関数を作成します。各 scorer はモデルの出力の異なる側面を評価するため、leaderboard では品質の異なる観点に基づいてモデルを順位付けできます。check_concrete_fields: モデルの出力が、想定される都市名と州に一致するかどうかを確認します。check_value_fields: モデルの出力が、想定される人口と世帯収入中央値の 10% 以内に収まっているかどうかを確認します。check_subjective_fields: LLM を使用して、モデルの出力が想定される “known for” フィールドに一致するかどうかを確認します。
Step 3: 評価を作成する
次に、ダミーデータとスコアリング関数を使って、評価を定義します。Evaluation オブジェクトはデータセットと scorers を組み合わせるため、同じベンチマークに対して任意のモデルを実行できます。