Google、表データ解析AI「TabFM」発表
Google AI Introduces TabFM: A Hybrid-Attention Tabular Foundation Model for Zero-Shot Classification and Regression

Googleが表データを学習なしで分析するAI「TabFM」を発表。データ分析の準備時間を大幅に削減し、素早く予測できる点が重要です。
Google Researchは、表形式データのために構築された基盤モデルであるTabFMを発表しました。TabFMは、データセット固有のトレーニングなしで分類と回帰を実行します。すべての予測は単一のフォワードパスから得られます。このモデルは、表形式の予測をin-context learningの問題として再構築します。現在、Hugging FaceとGitHubで利用可能です。TL;DR TabFMは、トレーニング、チューニング、または特徴量エンジニアリングなしで、未知の表を予測します。データセット全体を一つのプロンプトとして読み込み、in-context learningを介して予測します。このアーキテクチャは、TabPFNスタイルの行/列アテンションとTabICLスタイルのin-context learningを組み合わせています。トレーニングには、構造的因果モデルからの数億もの合成データセットが使用されました。Google BigQueryはまもなくAI.PREDICT SQLコマンドを通じてTabFMを公開する予定です。What is TabFM?表形式データは、企業のデータインフラストラクチャの基盤を形成しています。顧客離反や金融詐欺検出のようなタスクは表の中に存在します。長年にわたり、ツリーベースの手法がこの分野を支配してきました。XGBoost、AdaBoost、およびrandom forestsは、構造化データに対して堅牢な結果を提供しました。GoogleはTabFMを、そのzero-shot時系列モデルであるTimesFMの表形式版として位置付けています。その信頼性にはコストがかかりました。新しいデータセットにXGBoostを適合させることは、めったに一度の.fit()呼び出しでは終わりません。データサイエンティストは、生データから信頼できるシグナルを抽出するためだけに、ハイパーパラメータ最適化と特徴量エンジニアリングに何時間も費やします。TabFMはまさにそのボトルネックをターゲットにしています。TabFMは、大規模言語モデルがおなじみにしたzero-shotロジックを適用します。LLMは、重みを更新することなく、in-contextの例から新しいタスクを学習します。この手法はin-context learning (ICL)と呼ばれます。TabFMは同じアイデアを表にもたらします。以前に見たことのない表に対して、一度のパスで予測を生成します。How It Works従来のモデルは、各データセットの分布に合わせてパラメータを更新します。TabFMはそのステップを完全にスキップします。データセット全体を単一の統一されたプロンプトとして受け取ります。そのプロンプトには、トレーニング例とターゲットのテスト行の両方が含まれます。モデルは列と行を読み取ります。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。