脳画像AI、大量データで学習
Meet NeuroVFM: A New Neuroimaging Foundation Model Trained With Vol-JEPA on Uncurated Clinical MRI and CT Volumes

ミシガン大学が、脳のMRIやCT画像を大量に学習するAI「NeuroVFM」を発表しました。これにより、脳の病気の診断や研究が大きく進む可能性があります。
最先端のモデルは主に公開されているインターネットデータから学習します。しかし、臨床の神経画像データは、MRIやCTスキャンに識別可能な顔の特徴が含まれるため、インターネット上にはほとんど存在しません。その結果、一般的なモデルは脳画像処理タスクにおいて性能が低い傾向にあります。ミシガン大学の研究チームは、このギャップを埋めるため、Nature Medicine誌でNeuroVFMを発表しました。 NeuroVFMとは何でしょうか?その核心において、NeuroVFMは神経画像処理のための汎用的なビジュアルfoundation modelです。具体的には、524万件の臨床MRIおよびCTボリュームで学習されました。これらはUM-NeuroImagesデータセット内の566,915件の研究から得られたものです。このデータは、Michigan Medicineでの20年以上にわたる日常的なケアにわたっています。研究チームは彼らのアプローチを「health system learning」と呼んでいます。要するに、このモデルは通常の臨床業務中に生成された未整理のデータから学習します。そのため、ペアになった放射線レポートのボトルネックを回避します。また、狭い分類器で使用される疾患特異的なキュレーションも回避します。 特筆すべきは、ベースモデルがVol-JEPAと呼ばれていることです。これは、以前のI-JEPAおよびV-JEPAの手法を体積医療画像に拡張したものです。これは、JEPAスタイルの学習が医療画像分野に拡大しているという広範なトレンドを反映しています。 Vol-JEPAはどのように機能するのでしょうか?Vol-JEPAは自己教師ありの、視覚のみのアルゴリズムです。ピクセルを再構築するのではなく、学習されたlatent space内の表現を予測します。その結果、ラベル、レポートテキスト、voxelデコーダーは必要ありません。まず、各3Dボリュームは、重複しない4×16×16-voxelのパッチにトークン化されます。次に、ボリュームは小さな可視コンテキストと大きなマスクされたターゲットに分割されます。その後、student encoderがコンテキストパッチを処理します。一方、predictorはコンテキストのlatentsとターゲットの位置エンコーディングを組み合わせます。これにより、マスクされた領域のlatentsを予測します。teacher encoderは、ground-truthのターゲットlatentsを生成します。このteacherは、studentの指数移動平均(EMA)です。学習は、予測されたlatentsとteacherのlatents間のスムーズなL1 lossを最小化し、teacherを介して勾配が停止されます。重要なことに、maskin
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。