Google TurboQuant — KV Cache를 3비트로 압축해도 정확도가 안 떨어진다고?
Google이 발표한 TurboQuant의 PolarQuant+QJL 기법을 분석한다. KV cache 메모리 6배 절감, 어텐션 8배 가속이 실제로 의미하는 것.
태그
4개 글
Google이 발표한 TurboQuant의 PolarQuant+QJL 기법을 분석한다. KV cache 메모리 6배 절감, 어텐션 8배 가속이 실제로 의미하는 것.
Anthropic Science 블로그 첫 글에서 하버드 물리학 교수 Matthew Schwartz가 Claude를 "대학원생"처럼 지도한 실험을 분석합니다. 110번의 드래프트, 36M 토큰, 그리고 2주 만에 나온 논문.
Google이 발표한 첫 네이티브 멀티모달 임베딩 모델 Gemini Embedding 2의 핵심 기능과 기존 텍스트 전용 임베딩 대비 아키텍처 변화, RAG 파이프라인 실전 적용법을 EM 관점에서 정리한다.
블로그 콘텐츠 추천 시스템에서 78,000 토큰을 완전히 제로화하고 실행 시간을 99% 단축한 메타데이터 기반 최적화 실전 사례를 소개합니다. post-metadata.json 캐싱 전략과 해시 비교 기반 증분 처리로 추천 비용을 획기적으로 절감한 전 과정을 설명합니다.