アリババのAIが言葉でウェブ操作
Meet Alibaba’s Page Agent: A JavaScript In-Page GUI Agent That Controls Web Interfaces With Natural Language Through the DOM

アリババが公開した「Page Agent」は、ウェブページ内で動き、言葉で画面を操作できるAI。ユーザーの権限を継承し、アプリ内の作業を効率化できるため重要です。
ほとんどのブラウザ自動化は外部から実行されます。Playwright、Puppeteer、Selenium、browser-useはすべて、外部プロセスからブラウザを操作します。これらはスクリーンショットやChrome DevTools Protocolを通じてページを読み取ります。アリババのPage Agentは逆のアプローチを取ります。このエージェントは、プレーンなJavaScriptとしてウェブページ内に存在します。ライブDOMをテキストとして読み取り、実際のユーザーとして動作します。ヘッドレスブラウザも、スクリーンショットも、マルチモーダルモデルも不要です。このプロジェクトはMITライセンスの下でオープンソースとして公開されています。コードベースはTypeScriptファーストです。これはbrowser-useに基づいて構築されており、そのDOM処理とプロンプトはそこから派生しています。TL;DR Page AgentはJavaScriptとしてページ内で実行され、スクリーンショットではなくライブDOMをテキストとして読み取ります。DOM dehydrationはページをFlatDomTreeに圧縮し、より小さなテキストモデルでも正確に動作できるようにします。任意のOpenAI互換エンドポイントを通じてモデルに依存せず、MITライセンスの下で提供されます。プロンプトレベルの安全性と単一ページスコープは実際の制限事項です。危険なアクションに対してはサーバーサイドの検証を維持してください。最適な用途:外部サイトやロックダウンされたサイトではなく、所有するアプリ内のコパイロットやフォーム入力。 Page Agentとは? Page Agentは、ウェブアプリにエージェント動作を追加するためのクライアントサイドライブラリです。これを組み込み、自然言語でコマンドを発行します。エージェントはページ内から要素を見つけ、ボタンをクリックし、フォームに入力します。ブラウザセッション内で実行されるため、ユーザーのクッキー、セッション、認証を継承します。別途バックエンドを記述する必要はありません。既存のUI検証とセキュリティルールはそのまま維持されます。デザインはモデルに依存しません。任意のOpenAI互換エンドポイントを通じて、独自のlarge language modelを持ち込むことができます。モデルにはテキストのみが送信されるため、強力なテキストモデルで十分です。 DOM Dehydrationの仕組み コアとなる技術は、チームがDOM dehydrationと呼ぶものです。現代のページは何千ものノードを持つことがあります。生のHTMLをモデルに送信すると、遅く、費用がかかります。コマンドが到着すると、エージェントはDocument Object Modelをスキャンします。そして、すべてのインタラクティブな要素を特定し、
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。