AIが薬探しを手伝う仕組み
Building a Scaffold-Split Random Forest QSAR Co-Scientist for EGFR Inhibitor Discovery Using ChEMBL, RDKit, SHAP, and BRICS

AIが肺がん治療薬の候補を効率的に見つけるためのシステムが開発され、新薬開発のスピードアップに貢献します。
このチュートリアルでは、次世代のEGFR阻害剤発見のためのエンドツーエンドの自律型AI共同研究者ワークフローを構築します。特に非小細胞肺がんにおけるC797S osimertinib-resistance mutationに焦点を当てます。私たちはまず、ChEMBLとUniProtを通じて生物学的ターゲットを特定し、次に厳選されたEGFR IC50 bioactivity recordsを採掘し、それらをクリーンなpIC50モデリングデータセットに変換します。私たちはRDKitを使用して分子を標準化し、塩を除去し、繰り返し測定値を集約し、Morgan fingerprintsを計算し、physicochemical descriptorsを抽出し、scaffold diversityを分析します。これにより、私たちのモデルは生の文字列ではなく、化学的に意味のある表現から学習します。そこから、scaffold-split Random Forest QSARモデルを訓練し、未知のchemotypesへの汎化能力を評価し、SHAPまたはmodel importancesを用いてpotency-driving featuresを解釈し、影響力のある分子substructuresを可視化します。最後に、予測を超えてgenerative designへと進みます。これは、強力なdrug-like activesからのBRICS fragmentsを再結合し、結果として得られるvirtual analogsをpotency、drug-likeness、synthesizability、novelty、developabilityの各ゲートでスコアリングし、最終候補をPubChemと相互参照することで行われます。EGFR Target Setup Copy Code Copied Use a different Browser import sys, subprocess, importlib, warnings, time, os, random, json warnings.filterwarnings("ignore") def _pip(*pkgs): subprocess.run([sys.executable, "-m", "pip", "install", "-q", *pkgs], check=False) for mod, pkg in [("rdkit", "rdkit"), ("shap", "shap"), ("requests", "requests")]: try: importlib.import_module(mod) except Exception: print(f"Installing {pkg} ...") _pip(pkg) import numpy as np import pandas as pd import requests import matplotlib.pyplot as plt from scipy.stats import spearmanr from sklearn.ensemble import RandomForestRegressor from sklearn.metrics import r2_score, mean_squared_error, roc_auc_score from sklearn.decomposition import PCA from rdkit import Chem, DataStructs, RDLogger from rdkit.Chem import Descriptor
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。