「Quantization-Aware Healing」という新技術により、高度に圧縮された4ビットモデルでありながら、非圧縮のフルプレシジョンと同等の性能を発揮することが可能になりました。この技術は、AIモデルの効率的な軽量化と高精度な維持を両立させるための重要な進展です。
OpenAI独自の「Jalapeño」チップに関するベンチマークで、大規模なAI推論におけるユーザーあたりのトークン数やスループット効率において、現行の最先端ソリューションを大幅に上回ることが示されました。これにより、より高速かつ効率的な大規模AIサービスの提供が加速すると期待されます。
Appleは、最新のM5 MaxおよびM5 Ultraチップを搭載した新しいMac Studioを発表しました。高度なSSDアーキテクチャや高いパフォーマンス性能など、AI/MLシステムを支える強力なハードウェア基盤として大きな注目を集めています。
HuggingFaceにおいて、極めて高速かつ正確な音声認識を実現する「Granite Speech 5.0 Turbo CTC」モデルが登場しました。
この記事は要約版です。続き(残りの話題・実装の詳細)は元記事でどうぞ: