Perplexity AIが調査AIの評価基準を発表
Perplexity AI Releases WANDR: An Open Benchmark Evaluating Research Agents That Must Search Wide And Deep

Perplexity AIが、広く深く情報を集める調査AIの性能を測る新しい評価基準「WANDR」を公開。AIがより信頼性の高い調査結果を出すために重要です。
調査を行うAIは、すでに今日の実際の知識労働を処理しています。チームは、競合他社のマッピング、デューデリジェンス、文献レビューなどをAIに任せています。しかし、ほとんどの評価基準は単一の回答をテストするだけで、大量の証拠に裏付けられた情報の収集は対象としていません。Perplexityはこのギャップを埋めるため、新しいオープンな評価基準を発表しました。PerplexityはWANDR(Wide ANd Deep Research)をリリースしました。これはオープンな評価基準であり、評価ツールです。知識労働のための500の現実的で挑戦的なデータ収集タスクを中心に構築されています。WANDRは、Perplexityの深い調査のためのDRACO評価基準の「広範囲」版です。DRACOは、AIが正確で完全かつ客観的な長文レポートを作成するかどうかを問います。WANDRは、代わりに証拠を伴う大規模なコレクションを構築できるかどうかを問います。WANDRとは その核心において、WANDRは2つの要求を同時にテストします。「Wide(広範囲)」とは、多くの場合、オープンエンドな、条件を満たす大量のエンティティを発見することを意味します。「Deep(深掘り)」とは、各主張を証拠で裏付けるのに十分なほど、すべてのエンティティを調査することを意味します。この両方を組み合わせることで、AIにとっての問題が変わります。ここでは、いくつかの説得力のある例だけでは不十分です。不完全な調査に基づいて構築された洗練された物語もまた不十分です。これを捉えるために、WANDRは構成可能な資格キー階層を使用します。あるタスクでは、company(n) -> employee(m) -> url(k) を要求するかもしれません。これは、n個の条件を満たす企業、各企業にm人の従業員、そして各従業員にk個の裏付けとなるページを意味します。ツリーを介したすべての完全なパスは個別に検証されます。同じ構造で、フラットなリスト、ネストされた検索、またはマトリックスを表すことができます。具体的なタスク例 この階層を具体的に示すために、リリースされたceo_cfo_appointmentsタスクを考えてみましょう。これは、少なくとも70社の米国拠点の企業を要求します。各企業は、2026年3月1日から4月30日の間に最初に発表されたCEOまたはCFOの任命を持っている必要があります。それぞれについて、AIは1つの信頼できる任命ページを提供します。サブタスクとして、企業ごとにリスト掲載の権威ページが追加されます。合計で、このタスクは140のソースに裏付けられた記録を必要とします。具体的には、2つの階層と1つの提出された記録は次のようになります: Copy Code Copied Use a different Browser # Task hierarchies company(7
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。