AIがコードを書く能力を比較
Mistral Vibe for Code vs Claude Code vs Cursor vs Codex: Four Agents Scored on One Scaffold-to-PR Task

4つのAI開発ツールが実際のプログラミング作業で比較され、Mistral Vibe for Codeが最高評価。AIによる開発自動化の可能性を示しました。
現在、コーディングAIエージェントは開発者ツールの中で最も競争の激しい分野です。主要な4つのツール、Mistral Vibe for Code、Claude Code、Cursor、そしてOpenAI Codexが注目されています。それぞれがプロンプトからプルリクエストまで機能を作成できると主張しています。今回の比較では、これら4つを1つの実用的なワークフローで評価しました。これはおもちゃのようなスクリプトではなく、複数のファイルにわたる機能の骨組み作成、テストの生成と実行、そしてプルリクエストの作成という、実際のエンジニアリング作業単位です。 任務のプロンプトは、『既存のPython/FastAPIサービスに/subscriptionsエンドポイントを追加してください。ルート、Pydanticモデル、およびサービスレイヤーを適切なファイルにわたって構築してください。単体テストと結合テストを生成し、実行し、失敗があれば修正し、明確な説明を付けてプルリクエストを開いてください。』というものでした。このプロンプトは、すべてのエージェントがクリアしなければならない3つの段階、すなわち、骨組み作成(scaffold)、テスト(test)、出荷(ship)に当てはまります。 誠実に述べられた方法論: これは単一のマシンでの単一のタイムランではなく、能力比較です。スコアは、2026年7月14日時点の文書化された機能、公開されたベンチマーク、およびベンダー仕様を反映しています。各項目は1から5で評価され、最大25点です。すべてのスコアには1行の理由が付けられています。スコアよりも重要な3つの注意点があります。ここでのベンチマーク数値は直接比較できません。SWE-bench VerifiedとSWE-Bench Proは異なる難易度の異なるスイートです。Terminal-Benchは3つ目です。これらを単一の尺度として読み取らないでください。ベンダーの主張はそのようにラベル付けされています。Mistralのコスト効率の数値は、Mistral自身の公開された主張であり、独立した結果ではありません。これらの製品は毎週出荷されます。本日検証されたモデルのデフォルト設定と価格は変更される可能性があります。以下のすべての主張は、再確認できるようにその情報源にリンクしています。5つの評価項目は、機能の骨組み作成(feature scaffolding)、テスト生成と実行ループ(test generation and run loop)、PRと非同期ワークフロー(PR and async workflow)、表面的なカバレッジ(surface coverage)、およびコスト/オープン性/制御(cost/openness/control)です。 結果 ランク ツール スキャフォールド テストループ PR/非同期 サーフェスカバレッジ コスト&制御 合計 1 Mistral Vibe for Code 4 4 4 5 5 22 2 Claude Code 5 5 5 4 2 21 2 OpenAI Codex 4 4 5 5 3 21 4 Cursor 4 3 3 3 3 16 Vibe for Code
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。