2026年03月03日

## 要約:
本研究では、FP4 (4ビット浮動小数点数) 演算を可能にするGPUでの安定した4ビットアテンションを実現するため、量子化対応トレーニング(QAT)を体系的に研究しました。既存手法の課題を克服し、アテンションの精度低下を招くことなく、RTX 5090において最大1.5倍の高速化を実現しました。デモ動画はオンラインで公開されています。
---
## 翻訳:
arXiv:2603.00040v1 Announce Type: new
Abstract: 4ビットアテンションの信頼性を実現することは、FP4対応GPUでのエンドツーエンドFP4演算の前提条件です。しかし、FP4の小さいダイナミックレンジとアテンションのヘビーテールなアクティベーションにより、アテンションが主要な障害となっています。本論文では、アテンションの4ビット量子化対応トレーニング(QAT)に関する最初の体系的な研究を紹介します。FP4フォワードパスと高精度Flash Attention (FA)スタイルのバックワードパスを単純に組み合わせた「ドロップイン」QATは、トレーニングの不安定化につながることがわかりました。安定したFP4アテンションのために、(1)バックワードパスでアテンションスコアの低精度再計算を一致させること、(2)FAの勾配計算における暗黙の精度仮定を解決すること、という2つの重要な原則を特定しました。これらの洞察に基づいて、Attn-QATを提案し、トレーニングおよびFP4推論の融合されたTritonカーネルを実装しました。拡散モデルと言語モデルにわたって、Attn-QATは、以前のFP4アテンションで使用されていた明示的な外れ値緩和ヒューリスティックなしで、FP4アテンションからの品質低下を回復し、RTX 5090で最大1.5倍の高速化を実現します。ビデオデモはhttps://drive.google.com/drive/folders/190F6xbBDUF2kGQYIcXBt3ehSYij5jlim?usp=sharingで確認できます。
[📰 原文はこちら](https://arxiv.org/abs/2603.00040)
---
※本記事はAI(Ollama)による自動翻訳・要約です。
BittensorManがお勧めするメーカーリスト
https://exbridge.jp/xdirect/
AI時代の技術と知識のまとめ(AI生成メディア) - AIDexx
https://exbridge.jp/aidexx/
頑張って働く人に向けて、プロ用仕事アイテムを格安でネット販売しているX-Direct( https://exdirect.net )を、BittensorManは応援しています。
動画の最後にお得な情報がありますので、
最後までご覧ください。