AIが同じこと繰り返すのを減らす技術
Liquid AI Open-Sources Antidoom: A Final Token Preference Optimization (FTPO) Method that Reduces Doom Loops in Reasoning Models

Liquid AIが、AIが同じことを繰り返し続ける「破滅ループ」を減らす新技術Antidoomを公開。AIがより正確な答えを出せるようになり、発生率が大幅に低下しました。
Liquid AIは、推論モデルにおける一般的な失敗モードを対象としたオープンソースメソッドであるAntidoomをリリースしました。その失敗モードは「doom loop」です。doom loopでは、モデルがあるスパンを出力し、それを何度も繰り返します。出力はコンテキストウィンドウが使い果たされるまで続きます。小さな推論モデルは、特に長い思考の軌跡や難しい問題において、この現象に陥りやすいです。LFM2.5-2.6Bの初期チェックポイントでは、難しい数学やコーディングのプロンプトに対する完了の10.2%が反復ループを生成しました。Antidoomによるトレーニング後、その割合は1.4%に減少しました。評価スコアは全体的に向上し、これは完全にループの減少によるものです。TL;DR Antidoomは、最初のループ開始トークンのみを再トレーニングすることでdoom loopを削減します。FTPOは、単一の置き換えではなく、複数の整合性のある代替案に確率を分散させます。LFM2.5-2.6Bのループは10.2%から1.4%に、Qwen3.5-4Bは22.9%から1%に減少しました。このパイプラインは数時間で実行でき、フルスタックはオープンソースです。Antidoomとは何ですか?Antidoomは、広範なサンプリング変更ではなく、ターゲットを絞った修正です。ループを開始する正確なトークンを見つけます。そして、その単一の位置でモデルが整合性のある代替案を好むようにトレーニングします。残りの分布はほとんど手つかずのままです。このメソッドはAntislopを適応させています。これは、単一の完了トークンを表す選択/拒否ペアでトレーニングします。トレーニングアルゴリズムはFinal Token Preference Optimization (FTPO)であり、DPOに似ています。このトレーニングは、モデルに数学やコードについて新しいことを何も教えません。モデルがすでに生成できたはずの回答を妨げていたループを解消します。Doom Loopの解剖 Liquid AIチームは、doom loopが3つのメカニズムが連携して機能することに起因すると考えています。メカニズム1:過剰にトレーニングされたトークンと不確実性。一部のトークンは、一般的に選択される可能性が高いです。よく知られている例としては、「delve」や「testament」などがあります。Liquid AIチームは、これがトレーニングセット内の合成データにまで遡ることができると指摘しています。推論の軌跡では、優先度の高い継続にはしばしば談話マーカーが含まれます。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。