ARCHIVE
아카이브
기존에 공개한 글을 원래 주소 그대로 보관합니다.
과거의 글에는 작성 당시의 기술과 관점이 담겨 있습니다.
356개 글 · 8 / 12 페이지
· KO
GitHub Agentic Workflows — CI/CD에 AI 에이전트가 합류하다
GitHub의 Agentic Workflows 기술 프리뷰를 분석합니다. Markdown으로 자동화를 정의하고, AI 에이전트가 이슈 분류·코드 리뷰·테스트 생성을 수행하는 Continuous AI 패러다임을 소개합니다.
· KO
MIT TLT: 추론 LLM 훈련 속도를 2배로 끌어올리는 적응형 드래프터
MIT가 발표한 TLT 기법은 유휴 GPU를 활용해 추론 LLM의 RL 훈련을 70〜210% 가속합니다. 적응형 드래프터와 롤아웃 엔진의 작동 원리를 분석합니다.
· KO
Claude Code Remote Control 완전 가이드 — 설정부터 모바일 원격 제어까지
Claude Code Remote Control 기능의 설정 방법과 활용법을 정리합니다. 데스크톱에서 시작한 작업을 모바일로 모니터링하고 제어하는 워크플로우를 실전 예제와 함께 소개합니다.
· KO
OpenClaw 모델을 OpenAI Codex로 전환하기 — ToS 혼란 이후 실전 가이드
Claude·Gemini 이용약관 변경 이후 OpenClaw 사용자를 위한 OpenAI Codex 전환 실전 가이드입니다. 백업, OAuth 인증, 에이전트별 모델 설정, 레이어 전략, Claude API 키 방식과의 비용 비교까지 커뮤니티 검증 15분 절차로 완전히 정리했습니다.
· KO
소금을 믿지 마라 — 다국어 LLM 안전성과 가드레일의 사각지대
다국어 환경에서 LLM 가드레일이 무력화되는 실태를 분석합니다. 영어 외 언어에서 안전성 검증이 실패하는 구조적 문제와 실무 대응책을 제시합니다.
· KO
GGML/llama.cpp가 Hugging Face에 합류 — 로컬 AI 인프라의 구조적 전환점
ggml.ai 팀이 Hugging Face에 합류하여 llama.cpp의 장기적 지속가능성을 확보합니다. 로컬 AI 추론 생태계의 구조적 변화와 기술적 의미를 분석합니다.
· KO
ASIC 추론 칩으로 Llama 3.1 8B 16,000 tok/s 달성 — GPU 없는 AI 추론 시대
ASIC 전용 칩 스타트업 Taalas가 GPU 없이 Llama 3.1 8B를 16,000 tok/s로 구동합니다. GPU 의존 탈피와 추론 비용 구조 변화를 분석합니다.
· KO
Consistency Diffusion 언어 모델: AR 대비 14배 빠른 추론
Together AI가 발표한 CDLM은 확산 기반 언어 모델의 추론 속도를 최대 14배 향상시키면서 품질 손실을 최소화합니다. 블록 단위 병렬 생성과 KV 캐싱의 결합이 핵심입니다.
· KO
Gemini 3.1 Pro 출시 — Google 차세대 모델의 성능 분석과 의미
Google이 Gemini 3.1 Pro를 발표했습니다. ARC-AGI-2에서 77.1%를 달성하며 추론 능력이 2배 이상 향상된 이 모델의 성능과 Claude와의 비교를 분석합니다.
· KO
llama.cpp에 IQ*_K/IQ*_KS 양자화 통합 — ik_llama.cpp 성과가 메인라인으로
ik_llama.cpp에서 개발된 IQ계 양자화 기법이 llama.cpp 본체에 머지됩니다. IQ2_K~IQ4_KS의 정밀도 향상과 로컬 LLM 추론 효율화의 기술적 배경을 해설합니다.
· KO
Qwen3 Coder Next llama.cpp 그래프 최적화 — 최대 38% 추론 속도 향상
ggerganov가 llama.cpp 컴퓨트 그래프를 재구성하여 Qwen3 Coder Next 80B 모델의 추론 속도를 최대 38% 향상시킨 최적화 기법과 벤치마크 결과를 분석합니다.
· KO
DDR5 RDIMM vs RTX 3090 — 로컬 LLM의 GB 단가 역전 시대
DDR5 RDIMM의 GB 단가가 RTX 3090 VRAM을 하회하면서 로컬 LLM 하드웨어 선택의 전환점이 도래했습니다. CPU 추론과 GPU 추론의 비용 구조를 분석합니다.
· KO
Devstral Small 2 24B와 Qwen3 Coder 30B — 소형 코딩 모델 시대의 시작
Mistral Devstral Small 2 24B와 Qwen3 Coder 30B가 동시에 등장했습니다. Raspberry Pi에서도 작동하는 소형 코딩 모델의 비교 분석과 로컬 AI 코딩의 미래를 살펴봅니다.
· KO
Kitten TTS V0.8 — 25MB 미만으로 SOTA 달성한 초소형 TTS 모델 완전 해설
14M 파라미터·25MB 미만으로 클라우드 TTS 품질을 구현한 Kitten TTS V0.8을 철저히 분석합니다. 엣지 디바이스 배포 가능성과 로컬 음성 AI 최신 트렌드를 살펴봅니다.
· KO
$30 라디오 + 로컬 AI = 인터넷 불필요 스마트홈 — 에지 AI의 실용 사례
Mac mini와 $30 LoRa 라디오만으로 인터넷 없이 음성 제어와 스마트홈 조작을 구현한 실전 사례를 분석합니다. 로컬 AI × IoT의 구체적 구현과 비용을 다룹니다.
· KO
BarraCUDA — CUDA 코드를 AMD GPU에서 돌리는 오픈소스 컴파일러
CUDA 코드를 AMD GPU에서 직접 실행하는 오픈소스 컴파일러 BarraCUDA를 심층 분석합니다. LLVM 의존성 없이 15,000줄 C99로 구현된 컴파일러 아키텍처, 지원 CUDA 기능 목록, GPU 벤더 종속에서 벗어나는 전략을 실제 코드 예시와 함께 설명합니다.
· KO
Claude Sonnet 4.6 출시 — Anthropic의 중간 모델 전략과 성능 분석
Claude Sonnet 4.6 출시를 계기로 Anthropic의 모델 버전 전략을 심층 분석합니다. Opus·Sonnet·Haiku 라인업 재편, 성능 벤치마크 비교, API 비용 효율성 변화를 정리하고 개발자가 주목해야 할 핵심 업그레이드 포인트를 상세히 짚어드립니다.
· KO
DeepSeek V4 출시 임박 — 중국 AI 차세대 모델 경쟁 가속화
DeepSeek V4 출시가 임박한 가운데 Qwen3.5, GLM-5 등 중국 AI 기업들의 모델 러시가 이어지고 있습니다. DeepSeek-R1 대비 추론·코딩 벤치마크 개선점을 비교하고, 오픈소스 LLM의 GPT-4급 근접에 따른 글로벌 AI 경쟁 구도 재편을 분석합니다.
· KO
KaniTTS2 — 3GB VRAM으로 보이스 클로닝이 가능한 오픈소스 TTS 모델
4억 파라미터 경량 TTS 모델 KaniTTS2가 오픈소스로 공개되었습니다. 3GB VRAM으로 제로샷 보이스 클로닝이 가능하며 사전학습 코드까지 완전 공개되었습니다. MOS 스코어와 음성 품질을 분석하고, 로컬 AI 환경에서의 실용적 활용 가능성을 상세히 살펴봅니다.
· KO
CPU에서 1.2시간 만에 LLM 훈련 — MatMul-Free 아키텍처의 가능성
GPU 없이 CPU만으로 1.2시간 만에 1,360만 파라미터 언어 모델을 훈련한 FlashLM v3 사례를 분석합니다. 곱셈을 제거한 삼진 가중치 기반 MatMul-Free 아키텍처의 원리와 메모리·에너지 효율, 엣지 AI와 저비용 학습에 주는 시사점까지 짚어봅니다.
· KO
AGENTS.md는 정말 효과가 있을까? 첫 실증 논문이 밝힌 의외의 결과
GitHub 6만 개 이상 리포지토리가 쓰는 AGENTS.md, 정말 효과가 있을까. ETH Zürich의 첫 실증 논문은 LLM 생성 파일이 성공률을 3% 낮추고 개발자 작성 파일도 4% 오르는 데 그쳤으며 추론 비용은 20% 늘었다고 밝혔다. 결과와 원인을 분석한다.
· KO
AI가 스스로 생성한 스킬은 무의미하다 — LLM 자기개선 신화를 뒤집는 연구
AI 에이전트의 스킬 자동 생성이 실제로 도움이 되지 않는다는 실증 연구 SkillsBench를 분석합니다. 7,308개 트라젝토리에서 자기생성 스킬은 효과 제로였습니다.
· KO
FunctionGemma 270M — 초소형 모델로 멀티턴 tool calling 정확도 90-97% 달성
270M 파라미터의 초소형 모델 FunctionGemma를 파인튜닝하여 10-39%에서 90-97%의 tool calling 정확도를 달성한 사례를 분석합니다. 스케일링 법칙만이 답이 아닌 증거입니다.
· KO
OpenRouter 주간 TOP5 중 4개가 오픈소스 — 프로프라 모델 시대의 종말
OpenRouter 주간 이용 랭킹 TOP5 중 4개가 오픈소스 모델(Qwen3-Coder, DeepSeek R2, MiniMax M2.5 등)을 차지했습니다. 프로프라 모델 우위의 종언과 오픈소스가 실사용에서 선택받는 이유를 분석합니다.
· KO
Qwen 3.5가 Vending-Bench 2에서 파산 — 벤치마크 편중의 함정
표준 벤치마크 최상위권인 Qwen 3.5가 자판기 경영 시뮬레이션 Vending-Bench 2에서 파산 판정을 받았습니다. MMLU·HumanEval 편중 훈련이 실제 의사결정과 장기 계획 능력 평가에서 만들어내는 구조적 맹점을 벤치마크 결과 데이터와 함께 분석합니다.
· KO
Claude Code 로컬 모델 사용 시 전체 프롬프트 재처리 — 아키텍처 비효율성 분석
Claude Code를 로컬 LLM으로 실행할 때 발생하는 전체 프롬프트 재처리 문제의 원인과 해결책을 분석합니다. KV 캐시 무효화 메커니즘과 개발자 도구 설계의 교훈을 다룹니다.
· KO
Heretic 1.2 — 양자화로 VRAM 70% 절감과 MPOA 기술 해부
Heretic 1.2가 출시되었습니다. 4bit 양자화로 VRAM 사용량을 최대 70% 줄이고, MPOA로 고품질 어블리테레이션을 구현합니다. 로컬 LLM 운용 비용 절감의 최신 기법을 소개합니다.
· KO
Karpathy "AI 학습 비용은 연 40% 하락" — 디플레이션이 업계 구조를 바꾼다
AI 모델 학습 비용이 매년 40%씩 하락하고 있다는 Karpathy의 분석. 하드웨어 진화, 알고리즘 효율화, 데이터 파이프라인 최적화 등 구조적 요인과 업계 영향을 해설합니다.
· KO
Qwen3-Coder-Next 80B를 8GB VRAM으로 실행하는 방법
80B 파라미터 코딩 AI 모델을 8GB VRAM 소비자 GPU에서 실행하는 양자화 및 레이지 로딩 기법을 분석합니다. 로컬 LLM 코딩의 실용성과 한계를 다룹니다.
· KO
AI 스웜으로 SQLite 클론 구축 — 멀티 에이전트 분업의 현실
Claude, Codex, Gemini 6대가 병렬로 Rust SQLite 클론 19,000줄을 구현. 멀티 에이전트 분업과 조정 비용의 현실을 분석합니다.