AIの弱点を探すNVIDIAツール
NVIDIA garak Tutorial: Build a Complete Defensive LLM Red-Teaming Workflow with Custom Probes and Detectors

NVIDIAがAI(文章を書くAI)の安全性をテストするツール「garak」の詳しい使い方を公開し、AIの弱点を見つけて安全性を高めるのに役立ちます。
このチュートリアルでは、防御的なLLM red-teaming(AIの弱点を探すテスト)のための実用的なフレームワークとしてNVIDIA garakを分析します。まずGarakのセットアップから始め、プラグインの発見、ドライラン、実際のモデルスキャン、マルチプローブ評価、レポート分析、カスタムプローブの作成、カスタム検出器の作成、AVIDエクスポートへと進みます。単一のスキャンを実行するだけでなく、Garakをエンドツーエンドで使用して、プローブ、検出器、ジェネレーター、レポート、脆弱性スコアが完全なLLMセキュリティテストワークフローでどのように連携するかを理解します。全てのコードはこちらから確認できます。NVIDIA garakのセットアップとヘルパー関数の定義。コピーコードコピー済み。別のブラウザを使用してください。import os, sys, json, glob, subprocess, importlib def sh(cmd, capture=False): print(f"\n$ {cmd}") return subprocess.run(cmd, shell=True, text=True, capture_output=capture) sh(f"{sys.executable} -m pip install -q -U garak") os.environ.setdefault("TOKENIZERS_PARALLELISM", "false") os.environ.setdefault("HF_HUB_DISABLE_TELEMETRY", "1") import garak, garak.cli from garak import _config print("\n=== garak version:", garak.__version__, "===") def run_garak(args): print("\n>>> garak " + " ".join(args)) try: garak.cli.main(args) except SystemExit as e: if e.code not in (0, None): print(f"[garak exited {e.code}]") try: return _config.transient.report_filename except Exception: return None まず、必要なライブラリをインポートし、ノートブックから直接シェルコマンドを実行するためのヘルパー関数を作成します。garakをインストールし、基本的な環境変数を設定し、チュートリアルに必要な主要なgarakモジュールをインポートします。また、garakをプログラムで実行し、生成されたレポートへのパスをキャプチャできる再利用可能な関数も定義します。garakのプローブと検出器のリスト表示とモデルスキャンの実行。コピーコードコピー済み。別のブラウザを使用してください。print("\n########## 1. PLUGIN INVENTORY ##########") for kind in ["probes", "detectors", "generators", "buffs"]: out = sh(f"{sys.executable} -m garak --list_{kind} 2>/dev/null", capture=True) lines = [l for l in (out
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。