Google、ブラウザでAI動かす新技術
Google Releases LiteRT.js: A JavaScript Binding of LiteRT That Runs .tflite Models in Browsers via WebGPU

GoogleがLiteRT.jsを公開し、AIプログラムをブラウザで直接動かせるようになりました。これにより、AIが個人情報を守りながら、速く、安く使えるようになります。
GoogleはLiteRTのJavaScriptバインディングであるLiteRT.jsをリリースしました。LiteRTはGoogleのオンデバイス推論ライブラリで、以前はTensorFlow Liteと呼ばれていました。LiteRT.jsは.tfliteモデルをブラウザ内で直接実行します。推論がローカルで行われるため、Googleはユーザープライバシーの強化、サーバーコストのゼロ化、超低レイテンシを挙げています。 LiteRT.jsとは何でしょうか?これは新しいモデル形式ではありません。むしろ、Googleは既存のネイティブランタイムをWebAssemblyにコンパイルし、JavaScriptに公開しました。TensorFlow.jsを含む以前のウェブAIソリューションは、JavaScriptベースのカーネルに依存していました。Googleはこれらをパフォーマンスが低いと説明しています。LiteRT.jsは代わりに、最適化がそのまま維持されたネイティブのクロスプラットフォームランタイムを提供します。その結果、ウェブアプリは他の場所で行われた作業を引き継ぎます。Android、iOS、デスクトップ向けに構築されたパフォーマンスのアップグレード、量子化の改善、ハードウェアの最適化もウェブに適用されます。 仕組み:1つのランタイム、3つのバックエンド そのランタイムの下で、LiteRT.jsは3つのバックエンドをターゲットにしています。CPUはGoogleの最適化されたCPUライブラリであるXNNPACKを使用し、マルチスレッドサポートと緩和されたSIMDビルドを備えています。GPUはGoogleのオンデバイスGPUソリューションであるML DriftをWebGPU経由で実行します。NPUはWebNN APIを使用しますが、これは現在ChromeとEdgeで実験的です。 ディスパッチには2つの関連するルールがあります。まず、LiteRT.jsは部分的な委任をサポートしていません。グラフをCPUとGPUに分割することはできません。次に、委任はモデルごとにすべてかゼロかです。モデルが選択されたアクセラレータに完全に委任できない場合、LiteRTはwasm実行にフォールバックします。CPUパスは最も広範なオペレーターカバレッジを持っています。 パフォーマンス これらのバックエンドを考慮すると、Googleチームは2つの異なる結果を報告しています。他のウェブランタイムと比較して、LiteRT.jsはCPUおよびGPU推論全体で最大3倍高速です。この数値は、古典的なコンピュータービジョンおよびオーディオ処理モデルをカバーしています。独自のCPU実行と比較して、GPUまたはNPUは5〜60倍の高速化を実現します。これは、オブジェクト追跡やオーディオ転写のような要求の厳しいリアルタイム作業に適用されます。両方のベンチマークは、制御されたブラウザ環境で実行されました。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。