TurboQuant:KVキャッシュを3ビットに圧縮しても精度を維持
GoogleのTurboQuantが示すPolarQuant+QJL手法の仕組みを解説。KVキャッシュメモリ6倍削減・ アテンション8倍高速化が推論コストに持つ本当の意味。
タグ
4件の記事
GoogleのTurboQuantが示すPolarQuant+QJL手法の仕組みを解説。KVキャッシュメモリ6倍削減・ アテンション8倍高速化が推論コストに持つ本当の意味。
arXivの論文に基づくAgent Workflow Optimization(AWO)フレームワークを分析します。反復的なツール呼び出しパターンをメタツールにコンパイルしてLLM呼び出しを12%削減します。
ggerganovがllama.cppのコンピュートグラフを再構成し、Qwen3 Coder Next 80Bモデルの推論速度を最大38%向上させた最適化手法とベンチマーク結果を解析します。
GPUなしCPUのみで1.2時間、1,360万パラメータの言語モデルを訓練したFlashLM v3を分析します。乗算を排した三値重みによるMatMul-Freeアーキテクチャの原理とメモリ・省エネ効果、エッジAIや低コスト学習への示唆までを整理しました。