KaniTTS2 — 3GB VRAM으로 보이스 클로닝이 가능한 오픈소스 TTS 모델
4억 파라미터 경량 TTS 모델 KaniTTS2가 오픈소스로 공개되었습니다. 3GB VRAM으로 제로샷 보이스 클로닝이 가능하며 사전학습 코드까지 완전 공개되었습니다. MOS 스코어와 음성 품질을 분석하고, 로컬 AI 환경에서의 실용적 활용 가능성을 상세히 살펴봅니다.
archive
356 · 페이지 20
4억 파라미터 경량 TTS 모델 KaniTTS2가 오픈소스로 공개되었습니다. 3GB VRAM으로 제로샷 보이스 클로닝이 가능하며 사전학습 코드까지 완전 공개되었습니다. MOS 스코어와 음성 품질을 분석하고, 로컬 AI 환경에서의 실용적 활용 가능성을 상세히 살펴봅니다.
GPU 없이 CPU만으로 1.2시간 만에 1,360만 파라미터 언어 모델을 훈련한 FlashLM v3 사례를 분석합니다. 곱셈을 제거한 삼진 가중치 기반 MatMul-Free 아키텍처의 원리와 메모리·에너지 효율, 엣지 AI와 저비용 학습에 주는 시사점까지 짚어봅니다.
GitHub 6만 개 이상 리포지토리가 쓰는 AGENTS.md, 정말 효과가 있을까. ETH Zürich의 첫 실증 논문은 LLM 생성 파일이 성공률을 3% 낮추고 개발자 작성 파일도 4% 오르는 데 그쳤으며 추론 비용은 20% 늘었다고 밝혔다. 결과와 원인을 분석한다.
AI 에이전트의 스킬 자동 생성이 실제로 도움이 되지 않는다는 실증 연구 SkillsBench를 분석합니다. 7,308개 트라젝토리에서 자기생성 스킬은 효과 제로였습니다.
270M 파라미터의 초소형 모델 FunctionGemma를 파인튜닝하여 10-39%에서 90-97%의 tool calling 정확도를 달성한 사례를 분석합니다. 스케일링 법칙만이 답이 아닌 증거입니다.
OpenRouter 주간 이용 랭킹 TOP5 중 4개가 오픈소스 모델(Qwen3-Coder, DeepSeek R2, MiniMax M2.5 등)을 차지했습니다. 프로프라 모델 우위의 종언과 오픈소스가 실사용에서 선택받는 이유를 분석합니다.
표준 벤치마크 최상위권인 Qwen 3.5가 자판기 경영 시뮬레이션 Vending-Bench 2에서 파산 판정을 받았습니다. MMLU·HumanEval 편중 훈련이 실제 의사결정과 장기 계획 능력 평가에서 만들어내는 구조적 맹점을 벤치마크 결과 데이터와 함께 분석합니다.
Claude Code를 로컬 LLM으로 실행할 때 발생하는 전체 프롬프트 재처리 문제의 원인과 해결책을 분석합니다. KV 캐시 무효화 메커니즘과 개발자 도구 설계의 교훈을 다룹니다.
Heretic 1.2가 출시되었습니다. 4bit 양자화로 VRAM 사용량을 최대 70% 줄이고, MPOA로 고품질 어블리테레이션을 구현합니다. 로컬 LLM 운용 비용 절감의 최신 기법을 소개합니다.
AI 모델 학습 비용이 매년 40%씩 하락하고 있다는 Karpathy의 분석. 하드웨어 진화, 알고리즘 효율화, 데이터 파이프라인 최적화 등 구조적 요인과 업계 영향을 해설합니다.
80B 파라미터 코딩 AI 모델을 8GB VRAM 소비자 GPU에서 실행하는 양자화 및 레이지 로딩 기법을 분석합니다. 로컬 LLM 코딩의 실용성과 한계를 다룹니다.
Claude, Codex, Gemini 6대가 병렬로 Rust SQLite 클론 19,000줄을 구현. 멀티 에이전트 분업과 조정 비용의 현실을 분석합니다.