大型AIがスマホで動く超小型版登場
PrismML Releases Bonsai 27B: 1-bit and Ternary Builds of Qwen3.6-27B That Run on Laptops and Phones

PrismMLが大型AIモデルを大幅に小型化し、スマートフォンやノートPCで動くBonsai 27Bを公開。これにより、高性能なAIがより多くのデバイスで手軽に使えるようになります。
PrismMLはBonsai 27Bをリリースしました。これはQwen3.6-27Bの低ビット表現であり、新しい事前学習モデルではありません。アーキテクチャは変更されていません。2つのバリアントがApache 2.0ライセンスで提供されます。Ternary Bonsai 27Bは、真の1.71ビット/重みで{-1, 0, +1}の重みを使用します。その理想的なサイズは5.9GBです。1-bit Bonsai 27Bは、1.125ビット/重みでバイナリの{-1, +1}の重みを使用し、3.9GBです。どちらもマルチモーダルです。内訳は、約24.8Bの言語重み、0.46Bのvision tower、そしてembeddingsとLM headに2.5Bです。vision towerは4-bit (HQQ)で個別に保持されています。コンテキストは262Kトークンで、Qwen3.6-27Bのattentionの約75%が線形であるため、実用的な範囲に保たれています。このアーキテクチャが以下の圧縮方法を形成しています。圧縮の仕組み 各重みはコードであり、128のグループごとに1つの共有FP16スケールを持ちます。実効重みは w_i = s_g · t_i です。3値はlog2(3) ≈ 1.585ビットを運びます。128の重みごとに1つのFP16スケールを追加すると16/128が加算され、約1.71ビット/重みになります。これはFP16と比較して約9.4倍の削減です。バイナリは1 + 16/128 = 1.125ビットかかり、約14.2倍の削減です。この表現は、行列演算が多用されるコンポーネント全体(embeddings、attention projections、MLP projections、LM head)でエンドツーエンドに実行されます。正規化およびスケールパラメータのごくわずかな部分のみが高精度を維持します。真の平均として測定すると、Qwen3.6-27Bの"4-bit"ビルド(Q4_K_XL)は5.2ビット/重みです。"2-bit"ビルド(IQ2_XXS)は2.8です。Bonsaiは、最初から事前学習することによってのみ崩壊を回避するBitNetとも異なります。明らかな疑問は、圧縮が精度にどれだけのコストをかけるかです。パフォーマンス PrismMLは、H100 GPU上のvLLMとEvalScopeを使用して、思考モードで15のベンチマークを評価しました。Ternary Bonsai 27BはFP16ベースラインの94.6%を維持し、1-bit Bonsai 27Bは89.5%を維持します。Variant True bpw Footp
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。