OpenAI、生命科学AIの評価基準を公開
OpenAI Releases LifeSciBench, a 750-Task Benchmark Grading AI Models on Real Life-Science Research With Expert-Written Rubric

OpenAIが750の専門課題でAIの生命科学能力を測る「LifeSciBench」を公開。現在のAIが苦手な分野を示し、今後の研究開発の方向性を示す重要な指標です。
ほとんどの生物学の評価基準は、明確な答えを持つ狭い事実に基づいた質問をします。科学者は不完全な証拠を検討し、意思決定を行います。OpenAIはLifeSciBenchをリリースし、このギャップを直接的に狙っています。最も強力なモデルでさえ、およそ3つのタスクのうち1つしか合格しません。このベンチマークはまだ飽和状態にはほど遠いです。What is LifeSciBench LifeSciBenchには750の専門家が作成したタスクが含まれています。これらは7つのワークフローと7つの生物学的ドメインにまたがっています。各タスクには、プロンプト、サポートとなるartifacts、および採点rubricがセットになっています。7つのワークフローは、証拠の処理と分析をカバーしています。また、設計と最適化、科学的推論、検証と運用、翻訳、科学的コミュニケーションも含まれます。7つのドメインは、genomicsやmedicinal chemistryからclinical and translational scienceに及びます。タスクは、科学者が同僚に説明するように書かれています。これらは自由回答形式であり、多肢選択式ではありません。約79%のタスクが複数の推論または意思決定ステップを必要とし、平均で4つのステップが含まれます。How the Benchmark was Built A cohort of 173 expert scientists wrote the tasks。彼らは全員Ph.D.を持ち、biotechnologyまたはpharmaceuticalの経験がありました。承認されたタスクは、平均して6回の自動レビューサイクルと少なくとも2回の専門家によるレビューを受けました。多くのタスクにはartifactsが付属しています。ベンチマークには合計1,062の添付artifactsが含まれています。約53%のタスクが少なくとも1つのartifactを必要とします。種類には、sequences、figures、tables、PDF、およびchemical structuresが含まれます。別のcohortが品質を検証しました。453人のレビューアがおり、97%が博士号を持っていました。関連性、推論、根拠、有用性に関する全体的な合意は96%を超えました。The Rubric System Rubricsはここでの核となるメカニズムです。ベンチマーク全体で19,020の基準が含まれています。これは、タスクあたり約25の基準に相当します。各基準は1つの具体的な特性を評価します。例としては、特定の事実、推論ステップ、または許容範囲内の数値回答などがあります。採点は、単一の参照文字列ではなく、rubricに対して実行されます。2つの指標がパフォーマンスを要約します。Normalized rubric score divide
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。