はじめに
Forecall が何を測るのか、エージェントのための Failure KB を含めて無料でできること、有料のプランで増えること、静的な採点で分からないことを説明します。
このページの内容
AI エージェントは、ツールの名前、説明文、入力のスキーマを読んで、どのツールを使うかを決めます。書き方があいまいだと、違うツールを選んだり、引数を間違えたり、そもそもツールを呼ばなかったりします。Forecall は、あなたの MCP ツールがこの読み手にとって分かりやすく書かれているかを測り、直すべき点を示します。
Forecall が測るもの
Forecall は、MCP サーバーが tools/list に返す内容を読み、ツールごとに 100 点満点で採点します。見るのは、モデルがツールを選んで呼ぶのに必要な次の 6 つです。
- 目的
- いつ使うか、いつ使わないか
- 引数
- 戻り値
- 制約と副作用
- 例
サーバー全体も見ます。ツールが多すぎないか、取り違えやすいツールの組がないか、同じ説明文のツールがないか、です。指摘にはそれぞれ指摘コードと重大度(重大、要対応、軽微)が付くので、重いものから直せます。項目とすべての指摘コードは採点の読み方で説明しています。
これは静的な採点です。Forecall は文章を読むだけで、サーバーもモデルも動かしません。実際のモデルがツールを正しく選び、正しく呼ぶ割合を測るのは評価の役目です。
無料と有料
無料で、登録なしで使えるもの:
- Web のリンター:
tools/listの JSON をリンターに貼ります。結果のページの URL は共有できます。URL を知っている人なら誰でも見られ、検索エンジンには載らず、30 日で消えます。 - CLI:
npx forecall lint tools.jsonは、手元のファイルを同じ規則で採点し、どこにも送りません。CI で使えば、点数が下がるのを防げます。
無料で、app.forecall.dev のアカウントで使えるもの:
- サーバーと履歴: サーバーを登録し、点数の移り変わりを追えます。
- API キー: REST API を通して、手元のスクリプトや CI から採点できます(月の小さな枠の中で)。
- Failure KB:
npx forecall setupで AI エージェントをつなぐと、エージェントがツールを呼ぶ前と後に、MCP ツールの既知の失敗と回避策を調べます(月の照会の枠の中で)。
有料の Pro と Team のプランで増えるもの:
- 評価: 実際のモデルにツールを選ばせて呼ばせ、正しくできた割合を測ります。
- サーバーに報告された失敗: エージェントがあなたのサーバーのツールについて報告した失敗を、エラーの種類、ツール、モデル、クライアントごとに見られます。
- 大きな枠: API キーの月の単位と、Failure KB の照会の枠が増えます。
プランと価格の比較はプランと支払いにあります。
静的な採点で分からないこと
点数は説明文とスキーマの文字だけを読んで付けます。次の点に気をつけてください。
- 名前で意味が明らかな短いツール(例:
browser_close)は、モデルがうまく使えていても低く出ます。 - 点数が高くても、モデルがそのツールをうまく選ぶとは限りません。必要な情報が文章に書かれている、という意味です。点数が低ければ、直す価値のある文章を指しています。
- 点数を比べられるのは、採点の規則の版が同じものどうしだけです。結果には、採点した規則の版が必ず出ます。
試してみる
サーバーが tools/list に返す JSON をリンターに貼るか、ファイルを CLI で採点します。JSON の取り出し方はtools/list の出し方にあります。
npx forecall lint tools.json