SpaceXAIが新しいAI「Grok 4.5」発表
SpaceXAI Releases Grok 4.5, a Cursor-Trained Model for Coding, Agentic Tasks, and Knowledge Work at $2/M Input

SpaceXAIが最新AI「Grok 4.5」を発表。プログラミングや事務作業に特化し、高い効率と低価格で利用できるため、開発や業務を大きく変える可能性を秘めています。
SpaceXAIはGrok 4.5をリリースしました。同社はこれをこれまでで最も賢いモデルと呼んでいます。これはcoding、agentic tasks、そしてknowledge workを対象としています。SpaceXAIによると、Grok 4.5はAI coding editorであるCursorと共に学習されました。要するに、Grok 4.5はcoding、agentic tasks、knowledge workを対象とし、Cursorと共に学習されました。SpaceXAI自身のチャートでは、Fable (max)が4つのベンチマークすべてでリードしていますが、Grok 4.5はTerminal Bench 2.1で最も近い位置にいます。Token efficiencyが際立っており、SWE Bench ProではOpus 4.8 (max)と比較して約4.2倍少ない出力トークンで済みます。価格は入力が100万トークンあたり2ドル、出力が100万トークンあたり6ドルで、80 TPSで提供されます。これはHarvey's Legal Agent Benchmarkで1位を獲得し、Grok Buildのデフォルトモデルとなっています。Grok 4.5とは何か?Grok 4.5は、実際のengineering work向けに調整されたgeneral-purpose modelです。SpaceXAIは、coding、science、engineering、mathにわたるデータセットでこれを学習させました。研究チームは、そのreasoningがintelligentかつefficientであると説明しています。SpaceXAIは、office-workの強みとして、Harvey's Legal Agent Benchmarkで1位を獲得したことを挙げています。SpaceXAIはGrok 4.5をどのように学習させたのか?Trainingは数万台のNVIDIA GB300 GPUsで行われました。SpaceXAIは、large-scale runs向けに設計されたtrainingおよびstability techniquesを使用しました。raw token volumeだけでなく、チームはdata filteringとcurationに投資しました。これには、deduplication、quality scoring、domain-focused selectionが含まれます。SpaceXAIチームはその後、reinforcement learningをper-token intelligenceに焦点を当ててスケールさせました。RLは何十万ものtasksをカバーしました。そのほとんどは、multi-step software engineeringやその他のtechnical workに集中しました。Gradingはautomatedおよびmodel-based methodsを組み合わせて行われました。このstackは、highly asynchronous trainingをサポートしています。Agentic rolloutsは、learningが継続している間、何時間も実行できます。Benchmark performance SpaceXAIチームは、4つのcoding benchmarksでスコアを発表しました。Competitor figuresは、公開されているsystem cardsまたはleaderboardsからのものです。SpaceXAIの記述では、Grok 4.5が同等のleading modelsを上回るとされています。自身のチャートはよりmixedな結果を示しています。Fable (max)が最高のスコアを記録しました。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。