# モデルでサーバーを評価する

登録した MCP サーバーの評価をダッシュボードで動かし、読む方法を説明します。ケースの作り方、干渉セット、指標の意味、単位の数え方。

[リンター](https://forecall.dev/ja/docs/reading-scores)は、ツールの書き方を採点します。評価は、モデルが実際にツールをどう使うかを確かめます。ツールごとに書いた発話について、どのツールを呼ぶかをモデルに聞き、渡す引数も確かめます。評価は Pro と Team のプランで使えます。下のようにダッシュボードで動かすか、[REST API](https://forecall.dev/ja/docs/api#evaluations) で動かします。

## 評価を始める

ダッシュボード（[app.forecall.dev](https://app.forecall.dev)）の**評価**を開き、**評価を始める**を押します。[登録したサーバー](https://forecall.dev/ja/docs/dashboard)を 1 つ選ぶと、その最新の版を評価します。モデル、干渉セット（任意）、発話の言語を選んで**見積もる**を押します。始めるまで単位は使いません。始めるボタンに、使う単位が出ます。

選べるモデルは `anthropic/claude-opus-5-5`、`anthropic/claude-sonnet-5-5`、`openai/gpt-6-astra`、`openai/gpt-6.1-sol` です（`google/gemini-3.8-flash` はいまは止めています）。最初は中くらいの `anthropic/claude-sonnet-5-5` と `openai/gpt-6.1-sol` を選んだ状態です。

評価には数分かかります。評価の画面は、実行中はひとりでに更新され（JavaScript が動かないときは再読み込みします）、モデルごとに実行が終わりしだい結果を出します。

## ケース

モデル（`anthropic/claude-sonnet-5-5`）が、ツールの名前、説明、入力のスキーマからケースを作ります。種類は 3 つです。

- **ツール向け**: 1 つのツールを呼ぶべき発話。ツールごとに Pro で 8 個、Team で 20 個
- **取り違えやすい**: リンターが[取り違えやすい](https://forecall.dev/ja/docs/reading-scores)とみなしたツールの組ごとに、2 つのツールのそれぞれに 2 個ずつ
- **ツールを呼ばない**: どのツールも答えるべきでない発話。ツール向けの 5 分の 1 の数

発話は英語で、Team なら日本語も選べます。ケースは評価と一緒に残ります。同じ版を同じ設定で評価し直すと同じケースを使うので、2 つの評価を公平に比べられ、ケースを作る分も数え直しません。

## 干渉セット

モデルが見るツールは、たいてい自分のサーバーのものだけではありません。干渉セットは、公開サーバーのツールを自分のツールと並べて見せます: `bhived`、`context7`、`debugbase`、`filesystem`、`firecrawl`、`memory`、`notion`、`playwright`。最初はどれも選んでいません。干渉セットのツールを呼んだら、別のツールを呼んだと数えます。

干渉セットに自分のツールと同じ名前のツールがあるとき（どちらが呼ばれたか見分けられません）と、モデルに見せるツールが合わせて 60 個を超えるとき（モデルがうまく扱えなくなります）は、見積もりで知らせます。

## 結果を読む

評価の画面には、モデルごとに 3 つの指標と、その元の数が出ます。

| 指標 | 意味 |
|---|---|
| ツールの選択（`selectionAcc`） | ツールのために書いたケースのうち、そのツールを呼んだ割合 |
| 引数（`argValidity`） | その呼び出しのうち、引数がツールの入力のスキーマに合った割合。読めないスキーマは除く |
| 誤った呼び出し（`falseCallRate`） | どのツールも呼ぶべきでないケースのうち、ツールを呼んだ割合。低いほどよい |

長さの上限で切れた答えは、3 つとも数えません。数えるものがない指標は「—」です。

画面では、同じサーバーの、結果のある前回の評価とモデルごとに比べます。**呼ばれたツール**の表は、モデルごとに、行がケースを書いたツール、列が呼ばれたツールで、対角線が正解です。ツールが 12 個を超えると、誤りのある行と誤って呼ばれたツールの列だけを出し、**すべてを表示**で残りも出せます。**ケースを 1 つずつ見る**では、発話ごとに各モデルが呼んだツールと判定を出します。どれかのモデルが外したもの、1 つのモデルが外したもの、誤りの種類ごとに絞り込めます。引数の誤りには、どの引数がどう違ったか（ない、型が違う、許された値でない）を添えます。発話はサーバーのツールから作るので、組織の人だけが見られます。

## 単位

モデルの実行は、モデルの単価と、聞く内容の大きさ（見せるツール（自分のものと干渉セット）と発話）に応じた単位を使います。ケースを作る分も単位を使い、最初のモデルの分に足します。組織がすでに持っている結果（同じモデル、ツール、発話）は使い回し、数え直しません。見積もりには、合計、内訳、今月の残りの単位とクレジットが出ます。

評価は、先に今月の枠から、次にクレジット（期限の近いものから）から単位を使います。両方を合わせても足りなければ始めません。組織の直前の支払いに失敗している間も、支払いが済むまで始めません。評価が失敗したら、終わらなかったケースの分の単位を、6 か月有効のクレジットで返します。
