研究tldr-ai2026-06-30
AIのプログラミング能力を評価
RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades

AIが複数のファイルをまたぐ長期的なプログラミング能力を測る「RoadmapBench」が登場。実際のバージョンアップを基に、平均3700行の修正をAIに求め、現実のソフトウェア開発でのAIの役立ち度を正確に評価できます。
RoadmapBenchは、17のリポジトリにわたる実際のバージョンアップに基づき、複数のファイルと言語にまたがる長期的なコーディングタスクを評価します。このベンチマークは115のタスクをテストし、エージェント(AI)が51ファイルにわたる平均3,700行の修正を伴う機能を実装することを要求します。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。