シスコAI、FAPOでAI指示を自動最適化
Cisco AI Introduces FAPO: Pipeline-Aware Prompt Optimization With Step-Level Failure Attribution and Claude Code Orchestration

シスコAIのFAPOは、AIへの指示を自動最適化し、AIアプリの精度を大幅に向上させるオープンソースのシステムです。既存ツールより最大33.8%高い精度を達成。
信頼性の高いLLMアプリケーションを開発する上で、プロンプトを適切に作成することは依然として最も難しい部分です。わずかな言葉の変更で精度が20パーセントも変動することがあります。いくつかの例で機能するものが、大規模になるとしばしば破綻します。多段階のパイプラインが誤った回答を返した場合、失敗しているステップを見つけるには、中間出力を手作業で検査する必要があります。シスコAIは、このボトルネックに対処するためにFAPOを導入しました。FAPOはFully Automated Prompt Optimizationの略です。これはClaude Codeによって駆動されるシステムで、ベースラインのプロンプトから目標精度までLLMパイプラインを最適化します。データセットと初期プロンプトを提供すると、FAPOは評価、失敗の分類、バリアントの提案、それらの検証、そして反復を行います。このループ全体はClaude Codeエージェントによってオーケストレーションされます。このプロジェクトはApache 2.0ライセンスの下でオープンソースとして提供され、最適化エージェントとしてCodexもサポートしています。シスコの報告された評価では、FAPOは18のモデルベンチマーク比較のうち15で、最先端のプロンプト最適化ツールであるGEPAを上回りました。FAPOがパイプライン変更にエスカレートした2つのベンチマークでは、GEPAに対する平均ゲインは+33.8ppに達しました。TL;DR FAPOは、Claude Codeによって駆動されるシステムで、ベースラインのプロンプトから目標精度まで多段階のLLMパイプラインを自律的に最適化し、Apache 2.0ライセンスの下でオープンソースとして提供されます。これは、ステップレベルの失敗帰属を使用して次に変更するものを決定し、プロンプト、パラメーター、そしてチェーン構造の3つのレベルを通じてエスカレートします。シスコの評価では、FAPOは18のモデルベンチマーク比較のうち15でGEPAを上回り、平均+14.1ppのゲインを達成しました。HoVerとIFBenchでは、パイプライン変更にエスカレートしたFAPOが6つのペアすべてで勝利し、平均+33.8ppのゲインを達成しました。AIMEはGEPAの唯一の勝利でしたが、これはサンプリングノイズの範囲内でした。過学習を防ぐためのガードレールには、トレーニング分割のみの検査、不変のバリアントファイル、およびすべての提案に対する独立したレビューアが含まれます。FAPOとは FAPOはマルチテナントの評価および最適化フレームワークです。テナントは自己完結型の最適化プロジェクトです。各テナントディレクトリには、1つのタスクのプロンプト、データセット、チェーン定義、スコアラーが格納されます。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。