AI評価ツールが新しくなった
Prime Intellect Releases Verifiers v1: Composable Tasksets, Harnesses, and Runtimes for Agentic RL Training and Evaluations

Prime IntellectがAIエージェントの評価ツール「Verifiers v1」を公開。作業内容、実行方法、実行環境を分離し、AIの学習と評価を効率化します。
Prime Intellectはverifiers 0.2.0をリリースしました。これは、新しいverifiers.v1名前空間で提供される、書き直されたコアのプレビューです。現代の評価では、ツール、コンパクション、サブエージェントを備えたコーディングエージェントが実行されます。したがって、v1はこれらのagenticなワークロードを大規模に実行するための環境を再構築します。何がverifiers v1なのでしょうか?まず、verifiersとは何かを考えてみましょう。それはPrime Intellectのagentic reinforcement learningと評価のための環境スタックです。以前は、環境がデータ、エージェントロジック、インフラストラクチャをまとめてバンドルしていました。対照的に、v1はそのバンドルを3つの組み合わせ可能なピースに分割します。tasksetは、データ、ツール、スコアリングといった「作業」を定義します。harnessはタスクを解決し、rolloutを生成します。そのharnessは、ReActループ、CLI agent、または独自のものでも構いません。rolloutは、ローカルまたはサンドボックス内のruntime内で実行されます。これらのピースが分離されているため、任意のtasksetは互換性のある任意のharnessの下で実行できます。アーキテクチャはどのように機能するのでしょうか?これらのピースが定義されたら、次の疑問はそれらがどのように通信するかです。中心となるピースは、verifiersが管理するinterception serverです。これはエージェントのruntimeとinference serverの間に位置します。具体的には、inferenceへのリクエストとinferenceからのレスポンスをプロキシします。その間、トレースを記録し、サンプリングパラメータを設定し、ツールからのレスポンスを書き換えることができます。この書き換えは、トレーニング中のreward hacksを軽減するのに役立ちます。スケールのため、各サーバーは一定数のrolloutsを多重化し、デフォルトは32です。その後、プールは観測された並行性に応じて弾力的にスケールします。サーバーは、これらのリクエストを中継するクライアントも所有しています。評価中、EvalClientはブラインドなHTTPプロキシとして機能します。トレーニング中、TrainClientは忠実なtoken-in RLトレーニングのためにレンダラーをラップします。harnessesは異なるdialectsを話すため、verifiersは現在3つをサポートしています。これらはOpenAI Chat Completions、OpenAI Responses、Anthropic Messagesです。dialect adapterは、各ワイヤーフォーマットを標準的なvf.typesに正規化します。結果として、スコアリングロジックはテストされるエージェントから独立したままになります。Run rol
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。