Google、データベース命令文生成AIで新記録
Google Releases Gemini-SQL2: Gemini 3.1 Pro Text-to-SQL Scores 80.04% on BIRD Single-Model Leaderboard

Googleが文章からデータベースの命令文を作るAI「Gemini-SQL2」を発表し、80.04%の精度で過去最高を記録。これにより、データ操作がより簡単になることが期待されます。
Google ResearchチームはXでGemini-SQL2の発表を行いました。彼らはこのシステムを、Gemini 3.1 Proを搭載した画期的なtext-to-SQL機能と説明しています。Gemini-SQL2は、BIRD Text-to-SQL Leaderboard(Single Model)で80.04%の実行精度を記録しました。Googleのグラフでは、以前のトップであった自社のGemini-SQLを上回っています。この指標は、生成されたSQLが見た目上有効かどうかではなく、実行されて正しい結果を返すかどうかを測定します。https://x.com/GoogleResearch/status/2065475343205740911
Gemini-SQL2は、単独の基盤モデルのリリースではなく、text-to-SQL機能です。これは、自然言語の質問をGoogleが「実行可能なSQLクエリ」と呼ぶものに変換します。この機能はGemini 3.1 Proをベースに構築されています。Xでの発表によると、「データの微妙なニュアンスや複雑なビジネスコンテキストにより、自然言語から正確なSQLを生成することは非常に困難です。」Xの投稿では、「SQLの理解が向上することで、Googleのデータサービス全体で自然言語スキルが向上する可能性がある」とも述べられています。これは、すでにGeminiベースのSQL生成を提供しているBigQuery Studio、AlloyDB AI、Cloud SQL Studioなどの統合対象を示唆しています。Googleは、どの製品がGemini-SQL2を受け取るかをまだ確認していません。
ベンチマーク BIRD(BIg Bench for LaRge-scale Database Grounded Text-to-SQL Evaluation)は、このタスクにおける業界標準です。これは、37の専門分野にわたる95のデータベースにまたがる12,751の質問-SQLペアを含み、合計33.4GBに及びます。このデータベースには、Spiderのような古いベンチマークとは異なり、ダーティな値が含まれており、外部知識の根拠付けが必要です。BIRDは実行精度(EX)を測定します。生成されたSQLは、実行され、正解のクエリと一致する結果を返す必要があります。Googleはこれを直接述べています。「実行検証済みの精度を測定するBIRDベンチマークによると、GeminiSQL-2のSQLは見た目が正しいだけでなく、正常に実行されます。」Single Trained Model Trackは、前処理、検索、およびエージェントフレームワークを制限しています。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。