AIが自分で試行錯誤する技術
Guide to Loop Engineering: How ‘autoresearch’ and ‘Bilevel Autoresearch’ Turn AI Agents Into Autonomous Machine Learning ML Research Loops

AIが自分で計画・実行・評価を繰り返す「ループ」技術が登場。これにより、人間が指示しなくてもAIが自律的に研究を進め、開発効率が大きく向上します。
ほとんどの人は、いまだにAIを2015年の検索ボックスのように使っています。入力し、読み、また入力する。新しいパターンは、この手動でのやり取りをループに置き換えます。このガイドでは、2つの検証済み成果物を使ってループエンジニアリングを説明します。情報源はAndrej Karpathy氏のautoresearchリポジトリとBilevel Autoresearch論文です。この枠組みは@0xCodila氏の解説に倣っています。ループエンジニアリングとは?まず、2つのモードを比較してみましょう。プロンプトは1つの指示であり、その後、あなたが次のステップを決定します。対照的に、ループはモデルが目標に到達するまで追求する目標です。モデルは計画し、実行し、自身の結果をチェックし、そして繰り返します。あなたは目標を一度定義すれば、ループが繰り返しを処理します。重要なのは、ループはその作業が測定可能である場合にのみコストに見合うということです。ループを機能させる3つの要素では、実際のループとチャットボットの繰り返しを分けるものは何でしょうか?信頼できるすべてのループには3つのコンポーネントがあります。検証器は各試行を評価します。このチェックは、合格テスト、変動する指標、またはビルドである場合があります。検証器がなければ、エージェントは単に繰り返し自分自身に同意するだけです。状態は、何が試され、何が失敗し、何が残っているかを記録します。小さな補助ファイルにより、次回の実行は再開でき、最初からやり直す必要がありません。停止条件は暴走するコストを防ぎます。ループは目標が達成されたとき、またはN回の試行後に停止します。Karpathyループ: autoresearchの内部これらの3つの要素は理論的なものではありません。2026年3月7日、Karpathy氏はMITライセンスの下でオープンソースリポジトリautoresearchをリリースしました。これは3つのコアファイルと約630行のコードで構成されています。このプロジェクトは数日で急速に広まり、現在GitHubで90,000近くのスターを獲得しています。後に「Karpathyループ」というパターンとして発表されました。この設計は意図的に小規模ですが、厳格です。エージェントはtrain.pyのみを編集します。これにはGPTモデル、オプティマイザ(MuonおよびAdamW)、およびトレーニングループが含まれています。prepare.pyにある評価ユーティリティには触れることができません。この分離により、エージェントがモデルを改善する代わりにテストを簡単にすることを防ぎます。一方、人間はprogram.mdを作成します。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。