坂AI、脳の仕組みでAIを学習し高精度
Sakana AI’s Error Diffusion Trains Dale-Compliant Dual-Stream Networks, Reaching 96.7% MNIST and 61.7% CIFAR-10 Without Backpropagation

坂AIが、AIが間違いを直す「バックプロパゲーション」を使わない新しい学習方法を開発。これは脳の仕組みに近く、より人間らしいAIの実現につながる可能性があります。
Backpropagationはディープラーニングを支配していますが、脳ではおそらく不可能なメカニズムを使用しています。具体的には、逆方向パスは順方向の重み行列の正確な転置を必要とします。これが weight transport problem です。Sakana AIの新しい論文「Diffusing Blame」は、この制約に直接立ち向かっています。研究チームは、weight transportを完全に回避しながら、Dale's principleに従うネットワークを訓練しています。 Error Diffusionとは何か? Error Diffusion (ED) は、金子 (2000) によって最初に提案された局所的な学習ルールです。各重みの更新は、3つの信号のみに依存します。これらは、前シナプス活動、後シナプス活性化導関数、および単一のグローバルなエラー符号です。その結果、EDは転置された順方向の重みを転送したり、ランダムなフィードバック行列を使用したりすることはありません。その局所性により、EDはDale's principleと自然に互換性があります。しかし、これまでの研究では、EDは二値分類とMNISTでのみ実証されていました。 デュアルストリームアーキテクチャ その制約を満たすために、研究チームは各層を2つのストリームに分割しました。1つのストリームは興奮性 ( p ) であり、もう1つは抑制性 ( n ) です。順方向パスは、各ストリームの興奮性マイナス抑制性の事前活性化を計算します。 p_i = φ_i( +p_{i-1} Wpp − n_{i-1} Wnp + bp ) n_i = φ_i( +n_{i-1} Wnn − p_{i-1} Wpn + bn ) ここで、4つの重み行列はすべて要素ごとに非負のままです。バイアス b p と b n は非負である必要がないため、例外です。さらに、W np と W pn の前の否定符号は構造的なものであり、学習されるものではありません。したがって、クロスストリーム接続は抑制性のままであり、すべての学習可能な重みは非負のままです。この設計では、層ごとに4つの重みサブ行列が必要です。その結果、単一ストリームネットワークよりも約4倍多くのパラメータを使用します。同じアーキテクチャの場合、DFAでは約8Mに対し、約32Mです。 Modulo Error Routing そのアーキテクチャが整った上で、主な拡張は modulo error routing です。これにより、Error Diffusion (ED) は二値分類を超えて適用されます。隠れユニット i について、再
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。