研究tldr-ai2026-07-15
調べ物AIの能力を測る新基準
WANDR Benchmark: Evaluating Research Agents That Must Search Wide and Deep

AIが幅広い情報を深く正確に調べる能力を評価する新しい基準「WANDR」が公開され、AIがより信頼性の高い情報収集を行えるようになります。
WANDR(Wide ANd Deep Research)は、知識労働における現実的で困難なデータ収集タスクを中心に構築された、オープンなベンチマークおよび評価ハーネスです。 広範かつ深い調査により、エージェントは次の記録へと事実の品質を犠牲にすることなく、幅広い発見を維持できます。 WANDRは、柔軟で構成可能な資格キー階層によってその構造を捉えています。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。