2025年12月23日

## 要約:
CodeGEMMは、量子化されたLLMの推論効率を向上させる新しいGEMMカーネルです。コードブックを利用し、中間データの事前計算とコードインデックスによる直接的な集計により、従来の逐要素アクセスを排除し、レイテンシとメモリ使用量を削減します。Llama-3モデルでのベンチマークテストでは、大幅な高速化と計算効率の改善が確認されました。
---
## 翻訳:
arXiv:2512.17970v1 Announce Type: new
Abstract: ウェイトのみの量子化は、LLM推論のメモリ制約を緩和するために広く使用されています。コードブックベースの方法は、この傾向をさらに進歩させ、極端に低いビット数(例:2ビット)の領域で強力な精度を達成しています。しかし、現在のカーネルは、繰り返しセントロイドをフェッチして重みを再構築する量子化に依存しており、実質的なレイテンシとキャッシュ圧力を引き起こします。私たちは、軽量のPsumbookに格納されたセントロイドとアクティベーションのあらかじめ計算された内積で量子化を置き換える、コードブック中心のGEMMカーネルであるCodeGEMMを紹介します。推論時に、コードインデックスはこれらの部分和を直接収集し、要素ごとのルックアップを排除し、オンチップフットプリントを削減します。このカーネルは、統一された実装下で、レイテンシ-メモリ-精度のトレードオフを体系的に探求することをサポートします。Llama-3モデルでは、CodeGEMMは、同等の精度で、最先端のコードブックベースの量子化と比較して、8Bで1.83倍、70Bで8.93倍の高速化を実現し、さらに計算効率とメモリサブシステムの利用率を向上させます。
[📰 原文はこちら](https://arxiv.org/abs/2512.17970)
---
※本記事はAI(Ollama)による自動翻訳・要約です。
BittensorManがお勧めするメーカーリスト
https://exbridge.jp/xdirect/
AI時代の技術と知識のまとめ(AI生成メディア) - AIDexx
https://exbridge.jp/aidexx/
頑張って働く人に向けて、プロ用仕事アイテムを格安でネット販売しているX-Direct( https://exdirect.net )を、BittensorManは応援しています。
動画の最後にお得な情報がありますので、
最後までご覧ください。