ドキュメントの一覧

モデルでサーバーを評価する

登録した MCP サーバーの評価をダッシュボードで動かし、読む方法を説明します。ケースの作り方、干渉セット、指標の意味、単位の数え方。

このページの内容

リンターは、ツールの書き方を採点します。評価は、モデルが実際にツールをどう使うかを確かめます。ツールごとに書いた発話について、どのツールを呼ぶかをモデルに聞き、渡す引数も確かめます。評価は Pro と Team のプランで使えます。下のようにダッシュボードで動かすか、REST API で動かします。

評価を始める

ダッシュボード(app.forecall.dev)の評価を開き、評価を始めるを押します。登録したサーバーを 1 つ選ぶと、その最新の版を評価します。モデル、干渉セット(任意)、発話の言語を選んで見積もるを押します。始めるまで単位は使いません。始めるボタンに、使う単位が出ます。

選べるモデルは anthropic/claude-opus-5-5、anthropic/claude-sonnet-5-5、openai/gpt-6-astra、openai/gpt-6.1-sol です(google/gemini-3.8-flash はいまは止めています)。最初は中くらいの anthropic/claude-sonnet-5-5 と openai/gpt-6.1-sol を選んだ状態です。

評価には数分かかります。評価の画面は、実行中はひとりでに更新され(JavaScript が動かないときは再読み込みします)、モデルごとに実行が終わりしだい結果を出します。

ケース

モデル(anthropic/claude-sonnet-5-5)が、ツールの名前、説明、入力のスキーマからケースを作ります。種類は 3 つです。

  • ツール向け: 1 つのツールを呼ぶべき発話。ツールごとに Pro で 8 個、Team で 20 個
  • 取り違えやすい: リンターが取り違えやすいとみなしたツールの組ごとに、2 つのツールのそれぞれに 2 個ずつ
  • ツールを呼ばない: どのツールも答えるべきでない発話。ツール向けの 5 分の 1 の数

発話は英語で、Team なら日本語も選べます。ケースは評価と一緒に残ります。同じ版を同じ設定で評価し直すと同じケースを使うので、2 つの評価を公平に比べられ、ケースを作る分も数え直しません。

干渉セット

モデルが見るツールは、たいてい自分のサーバーのものだけではありません。干渉セットは、公開サーバーのツールを自分のツールと並べて見せます: bhived、context7、debugbase、filesystem、firecrawl、memory、notion、playwright。最初はどれも選んでいません。干渉セットのツールを呼んだら、別のツールを呼んだと数えます。

干渉セットに自分のツールと同じ名前のツールがあるとき(どちらが呼ばれたか見分けられません)と、モデルに見せるツールが合わせて 60 個を超えるとき(モデルがうまく扱えなくなります)は、見積もりで知らせます。

結果を読む

評価の画面には、モデルごとに 3 つの指標と、その元の数が出ます。

指標 意味
ツールの選択(selectionAcc) ツールのために書いたケースのうち、そのツールを呼んだ割合
引数(argValidity) その呼び出しのうち、引数がツールの入力のスキーマに合った割合。読めないスキーマは除く
誤った呼び出し(falseCallRate) どのツールも呼ぶべきでないケースのうち、ツールを呼んだ割合。低いほどよい

長さの上限で切れた答えは、3 つとも数えません。数えるものがない指標は「—」です。

画面では、同じサーバーの、結果のある前回の評価とモデルごとに比べます。呼ばれたツールの表は、モデルごとに、行がケースを書いたツール、列が呼ばれたツールで、対角線が正解です。ツールが 12 個を超えると、誤りのある行と誤って呼ばれたツールの列だけを出し、すべてを表示で残りも出せます。ケースを 1 つずつ見るでは、発話ごとに各モデルが呼んだツールと判定を出します。どれかのモデルが外したもの、1 つのモデルが外したもの、誤りの種類ごとに絞り込めます。引数の誤りには、どの引数がどう違ったか(ない、型が違う、許された値でない)を添えます。発話はサーバーのツールから作るので、組織の人だけが見られます。

単位

モデルの実行は、モデルの単価と、聞く内容の大きさ(見せるツール(自分のものと干渉セット)と発話)に応じた単位を使います。ケースを作る分も単位を使い、最初のモデルの分に足します。組織がすでに持っている結果(同じモデル、ツール、発話)は使い回し、数え直しません。見積もりには、合計、内訳、今月の残りの単位とクレジットが出ます。

評価は、先に今月の枠から、次にクレジット(期限の近いものから)から単位を使います。両方を合わせても足りなければ始めません。組織の直前の支払いに失敗している間も、支払いが済むまで始めません。評価が失敗したら、終わらなかったケースの分の単位を、6 か月有効のクレジットで返します。