研究tldr-ai2026-07-09
AIの危険な知識を消す仕組み
An off switch for dual use knowledge in AI models
AIが学習した悪用されうる知識を、後から削除できる新技術GRAMが登場。AIの安全性を高め、危険な情報の拡散を防ぐのに役立ちます。
GRAM (Gradient-Routed Auxiliary Modules)は、多くのフィルターをかけたモデルを個別に学習させる利点を、たった一つのモデルを学習させるコストで実現します。 この技術は、悪用されうる知識の各カテゴリごとに、AIモデルに専用の取り外し可能な「知識の区画」を与え、悪用されうるデータから学習する際にのみ、それらの区画を更新します。 これにより、モデルの知識の一部を学習後に削除することが可能になり、モデルの安全性を高めるためのより強力な枠組みを提供します。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。