Harness-1登場!AI検索を効率化
Meet Harness-1: A 20B Retrieval Subagent Trained With Reinforcement Learning Inside a Stateful Search Harness on gpt-oss-20b

Harness-1という新しいAIが、情報を探すAIの負担を減らす新しい仕組みを提案。AIがより賢く効率的に情報を集められるようになります。
ほとんどの検索エージェントは、増え続けるトランスクリプト(記録)上でpolicyとして訓練されます。モデルはどのように検索するかを決定します。また、何を見たか、どの証拠が重要か、どの主張を確認したかを記憶する必要もあります。イリノイ大学アーバナ・シャンペーン校、UCバークレー校、Chromaの研究者チームは、これはあまりにも多くのことをAIに求めすぎると主張しています。reinforcement learningは、検索の決定と日常的な簿記(記録管理)の両方を一度に最適化することになります。彼らの答えは、gpt-oss-20b上に構築された20Bのretrieval subagentであるHarness-1です。これはstateful search harness内でreinforcement learningを使って訓練されました。harnessが簿記(記録管理)を担当し、policyが意味的な決定を保持します。weightsとharness codeは公開されています。https://arxiv.org/pdf/2606.02373
Harness-1とは何か
Harness-1は、下流の回答モデルのために、ランク付けされた一連の文書を生成します。それ自体は質問に答えません。これは、エピソードごとのWORKINGMEMORYを中心としたstate-machine harness内で動作します。各ターンはループとして機能します。harnessは、最近のアクションとともにコンパクトな検索stateをレンダリングします。モデルは1つの構造化されたアクションを出力します。harnessはそれを実行し、stateを更新し、次のobservationをレンダリングします。
stateful harness:policyから何が移動するか
研究チームは、その原則をstateful cognitive offloadingと呼んでいます。policyは、何を検索し、キュレーションし、検証し、いつ停止するかを決定します。harnessは、これらの決定に関する回復可能なstateを維持します。そのstateにはいくつかの要素が含まれます。candidate poolは、圧縮され重複排除された文書を保持します。importance-tagged curated setは最終出力であり、最大30の文書に制限されます。タグは、very_high、high、fair、lowの4つの値を取ります。full-text storeは、プロンプトの外にあるすべての取得されたチャンクを保持します。evidence graphは構造を追加します。regex extractorは、各チャンクをスキャンして固有名詞、年、日付を抽出します。その後、harnessは頻繁なエンティティ、bridge documents、およびsingletonsをレンダリングします。bridge documentsは2つ以上の頻繁なエンティティを含みます。singletonsは1つの文書に現れ、フォローアップを示唆します。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。