Google TurboQuant — KV Cache를 3비트로 압축해도 정확도가 안 떨어진다고?
Google이 발표한 TurboQuant의 PolarQuant+QJL 기법을 분석한다. KV cache 메모리 6배 절감, 어텐션 8배 가속이 실제로 의미하는 것.
태그
4개 글
Google이 발표한 TurboQuant의 PolarQuant+QJL 기법을 분석한다. KV cache 메모리 6배 절감, 어텐션 8배 가속이 실제로 의미하는 것.
"길게 생각하면 좋다"는 AI 상식을 뒤집는 Google·UVA 공동 연구. DTR(Deep-Thinking Ratio)를 활용하면 추론 품질을 유지하면서 LLM 추론 비용을 50% 절감할 수 있습니다. 연구 방법론·실험 결과·프로덕션 DTR 기준 설계법까지 총정리합니다.
ASIC 전용 칩 스타트업 Taalas가 GPU 없이 Llama 3.1 8B를 16,000 tok/s로 구동합니다. GPU 의존 탈피와 추론 비용 구조 변화를 분석합니다.
ggerganov가 llama.cpp 컴퓨트 그래프를 재구성하여 Qwen3 Coder Next 80B 모델의 추론 속도를 최대 38% 향상시킨 최적화 기법과 벤치마크 결과를 분석합니다.