モデルtldr-ai2026-07-21
AIが賢く動く設計の秘密
Sparse By Design

AIモデルは、全体は大きくても一部だけを動かす「疎な設計」を採用することで、少ない計算力で賢くなることが分かりました。これにより、同じコストでAIの能力を大幅に高める重要な方法です。
Kimi K3は、1トークンあたり896の専門家のうち16をアクティブにします。過去3回のリリースで、総parameters数は増加しましたが、アクティブなparameters数はほとんど増加していません。この戦略は、トークンあたりのcomputeをほぼ一定に保ちながら、総capacityを容赦なく増大させることにあるようです。固定されたtraining compute budgetにおいて、より多くのexpertsはより低いlossを意味し、モデルは同じFLOPsからより多くを学習します。オープンソースの研究機関は、知能を獲得する最も安価な方法はcapacityを費やすことだと発見しました。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。