모델 버전을 올릴 때마다 인젝션 테스트를 다시 돌리는 이유: 게이트를 직접 짜봤다
LLM 파이프라인에 프롬프트 인젝션 회귀 스위트를 직접 돌렸다. 순진한 키워드 가드는 11건 중 2건, 구조적 가드는 11건 전부를 잡았고, 내가 저지른 리팩터링이 떨어뜨린 탐지까지 게이트가 집어냈다. 모델 버전을 올릴 때마다 다시 돌려야 하는 이유를 실측으로 정리했다.
태그
72개 글
LLM 파이프라인에 프롬프트 인젝션 회귀 스위트를 직접 돌렸다. 순진한 키워드 가드는 11건 중 2건, 구조적 가드는 11건 전부를 잡았고, 내가 저지른 리팩터링이 떨어뜨린 탐지까지 게이트가 집어냈다. 모델 버전을 올릴 때마다 다시 돌려야 하는 이유를 실측으로 정리했다.
같은 50개 레코드를 JSON·YAML·CSV·TSV 등 9가지 포맷으로 직렬화해 tiktoken으로 토큰을 측정했다. 평탄한 데이터는 TSV가 pretty JSON 대비 62% 저렴했고, 중첩 데이터는 compact JSON으로 결론이 뒤집힌다. 포맷 하나가 토큰 비용을 가른다.
Mastra.ai TypeScript AI 에이전트 프레임워크를 직접 설치하고 Google Gemini와 연동해 날씨 조회 에이전트를 만들었다. 설치·워크플로우·메모리 통합 등 실습 전 과정과 LangGraph, CrewAI와의 핵심 차이점을 개발자 관점에서 정리했다.
2026년 5월 실측 데이터. Gemini 2.5 Flash-Lite(65 TPS), 2.5 Flash, 2.5 Pro, 3.5 Flash를 동일 조건에서 비교했다. 챗봇·코드리뷰·RAG 시나리오별 월 비용 계산과 어떤 프로젝트에 어느 모델을 써야 하는지 결정 기준을 정리한다.
Gemini 2.5 Flash의 Thinking Budget을 Budget=0/1024/8000 세 가지로 단순 작업·수학 추론·코드 리뷰에 직접 실험했다. 단순 작업은 5배 느려지고, 수학 문제는 오히려 출력 토큰을 줄여준다. 작업 유형별 최적 설정 프레임워크를 공유한다.
anthropic 0.100.0과 openai 2.36.0을 직접 설치해 비교합니다. 타입 수 408 vs 230, 에러 계층 설계 차이, 스트리밍 구현 패턴, 툴 호출 포맷, SDK별 고유 기능까지 Python 코드로 직접 검증한 개발자를 위한 실전 비교 가이드입니다.
Anthropic Files API로 PDF·이미지를 한 번 업로드해 여러 API 요청에서 반복 재사용하는 실전 가이드. Python SDK 배치 분석 완성 코드, 프롬프트 캐싱과 비용 비교, file_id 관리 패턴, 문서당 최적 모델 선택 기준까지 상세히 다룹니다.
Claude Opus 4.7(4월 16일)과 Managed Agents 베타(4월 8일)가 같은 달 출시됐다. 역대급 벤치마크 뒤에 숨겨진 토큰나이저 비용 충격, task_budget 설계 원리, 세션당 $0.08 에이전트 모델의 실제 의미를 EM 시각에서 깊이 분석한다.
Claude API 프롬프트 캐싱을 실제 프로덕션 환경에 적용하기 위한 완전 실전 가이드입니다. 시스템 프롬프트·RAG 문서·툴 정의·멀티턴 대화 4가지 캐싱 패턴과 2026년 TTL 변경의 함정, 캐싱 적중률 및 비용 절감 계산 방법을 실측 데이터와 함께 정리합니다.
GPT-5.5는 에이전트 런타임 전용으로 재설계된 모델입니다. SWE-bench 88.7%에 가격은 2배. 단순 벤치마크를 넘어 실제 개발 워크플로우에서 Claude Sonnet 4.6과 직접 비교하며 에이전트 시대의 모델 선택 기준을 솔직하게 따져봤습니다.
2026년 4월 기준 주요 LLM API 가격을 실제 프로덕션 시나리오별로 비교합니다. GPT-5.4, Claude Opus 4.6, Gemini 3.1 Pro, DeepSeek V4의 토큰 비용과 캐시 할인, 배치 API 활용까지 정리했습니다.
2026년 3월 Anthropic이 Claude 기본 effort 레벨을 조용히 "medium"으로 낮췄다. 파워 유저 반발과 가격 인상 논란, 그리고 이 사태가 드러낸 AI 서비스 투명성과 신뢰 문제를 CTO·엔지니어링 리더 관점에서 분석한다.
Anthropic 해석가능성팀이 Claude 내부에서 171개 감정 유사 표상을 발견하고, 이것이 모델 출력에 인과적으로 영향을 미친다는 걸 증명했다. 프롬프트 엔지니어링과 AI 안전에 실질적 시사점을 정리한다.
Google이 발표한 TurboQuant의 PolarQuant+QJL 기법을 분석한다. KV cache 메모리 6배 절감, 어텐션 8배 가속이 실제로 의미하는 것.
Anthropic Science 블로그 첫 글에서 하버드 물리학 교수 Matthew Schwartz가 Claude를 "대학원생"처럼 지도한 실험을 분석합니다. 110번의 드래프트, 36M 토큰, 그리고 2주 만에 나온 논문.
Morgan Stanley가 경고한 2026년 상반기 AI 능력의 비선형 도약. AI 로드맵 분기 재설계, Centaur Pod 팀 구조, 하이브리드 인프라 비용, 거버넌스 프레임워크, AI 리터러시까지 CTO와 엔지니어링 리더가 지금 실행해야 할 5가지 준비 전략을 정리합니다.
Zhipu AI의 GLM-5는 744B MoE 구조로 NVIDIA 없이 화웨이 Ascend 칩만으로 훈련된 MIT 오픈소스 최전선 모델입니다. EM/CTO 관점에서 엔터프라이즈 AI 전략을 재검토합니다.
OpenAI가 GPT-5.4를 출시했습니다. OSWorld 벤치마크에서 인간(72.4%)을 뛰어넘은 컴퓨터 사용 능력(75%), 1M 토큰 컨텍스트 윈도우, 툴 서치로 47% 토큰 절감까지 — EM 관점에서 핵심 임팩트를 분석합니다.
멀티 에이전트 시스템을 프로덕션에서 운영할 때 반드시 갖춰야 할 옵저버빌리티 전략의 실전 가이드. OpenTelemetry 트레이싱·메트릭·로그 구조화부터 Langfuse·LangSmith·Braintrust 3종 도구 비교, 알림 설계까지 EM 관점으로 상세히 총정리.
프롬프트 엔지니어링을 넘어, 컨텍스트 엔지니어링이 왜 2026년 프로덕션 AI 에이전트 개발의 핵심 역량이 됐는지를 4가지 실패 패턴과 5가지 핵심 기법을 통해 Engineering Manager 관점에서 정리한다.
Andrej Karpathy가 공개한 autoresearch는 AI 에이전트가 밤새 자율적으로 ML 실험을 반복하는 630줄짜리 오픈소스 도구입니다. EM 관점에서의 R&D 팀 활용 전략을 분석합니다.
LLM을 활용한 대규모 온라인 익명 해제(Deanonymization) 연구를 분석하고, 엔지니어링 리더가 알아야 할 조직 보안 대응 전략을 제시합니다.
Anthropic의 Claude Opus 4.6이 2주 만에 Firefox에서 22개 CVE를 발견한 사례를 분석하고, AI 기반 보안 감사가 엔지니어링 조직에 가져올 변화를 CTO/EM 관점에서 정리합니다.
Google Research의 180개 설정 정량 실험이 밝힌 멀티에이전트 역설 — 순차 작업에서 39〜70% 성능 저하, 에러 17.2배 증폭, 87% 예측 정확도의 의미를 EM 관점으로 분석합니다.
대형 모델이 계획하고 소형 모델이 실행하는 Plan-Execute 패턴. EM/CTO가 에이전트 플릿을 운영할 때 반드시 알아야 할 이종 모델 아키텍처 비용 최적화 전략을 실전 수치와 함께 분석한다.
arXiv 최신 논문 Tool-R0는 학습 데이터 없이 Self-Play 강화학습만으로 LLM의 도구 호출 능력을 92.5% 향상시킨다. Generator-Solver 공진화 구조와 EM 관점 실무 시사점을 분석한다.
Google이 Nature Communications에 발표한 Bayesian Teaching 연구는 LLM이 새 정보를 받을 때 확률적으로 믿음을 업데이트하도록 훈련하는 방법론이다. AI 에이전트의 불확실성 처리 방식을 근본적으로 개선할 이 연구를 EM 관점에서 분석한다.
AI2의 Olmo Hybrid는 Transformer와 DeltaNet(Linear RNN)을 3:1로 결합해 동일 정확도를 49% 적은 토큰으로 달성합니다. 어텐션과 Linear RNN 하이브리드가 학습 효율을 높이는 원리와 LLM 개발자를 위한 실무 시사점을 분석합니다.
Meta Llama 4 Maverick(400B MoE)과 Scout(10M 컨텍스트)의 아키텍처, 벤치마크, 비용 구조를 분석하고, 엔지니어링 조직이 오픈소스 AI 전략을 어떻게 재정립해야 하는지 CTO/EM 관점에서 정리한다.
"길게 생각하면 좋다"는 AI 상식을 뒤집는 Google·UVA 공동 연구. DTR(Deep-Thinking Ratio)를 활용하면 추론 품질을 유지하면서 LLM 추론 비용을 50% 절감할 수 있습니다. 연구 방법론·실험 결과·프로덕션 DTR 기준 설계법까지 총정리합니다.
MIT CSAIL이 개발한 EnCompass 프레임워크로 AI 에이전트의 실행 경로에 검색 전략을 적용해 신뢰성과 정확도를 획기적으로 높이는 방법을 실무 관점에서 분석합니다.
LLM 코딩 도구에서 모델 선택보다 하니스(편집 포맷, 도구 인터페이스) 최적화가 5〜14% 더 높은 성능을 가져온다. Grok Code Fast를 6.7%에서 68.3%로 10배 향상시킨 실사례로, 하니스 엔지니어링의 실체와 EM·CTO를 위한 실무 전략을 정리한다.
DeepSeek·MiniMax의 1,600만 건 Claude 증류 공격 실태를 분석하고 기업 CTO·EM을 위한 실무 대응 전략을 제시합니다. AI API 지적재산 보호, 벤더 보안 평가 기준, 오픈소스 모델 출처 검증, 조직 AI 거버넌스 체계 구축 방법까지 다룹니다.
ASIC 전용 칩 스타트업 Taalas가 GPU 없이 Llama 3.1 8B를 16,000 tok/s로 구동합니다. GPU 의존 탈피와 추론 비용 구조 변화를 분석합니다.
Together AI가 발표한 CDLM은 확산 기반 언어 모델의 추론 속도를 최대 14배 향상시키면서 품질 손실을 최소화합니다. 블록 단위 병렬 생성과 KV 캐싱의 결합이 핵심입니다.
Google이 Gemini 3.1 Pro를 발표했습니다. ARC-AGI-2에서 77.1%를 달성하며 추론 능력이 2배 이상 향상된 이 모델의 성능과 Claude와의 비교를 분석합니다.
ik_llama.cpp에서 개발된 IQ계 양자화 기법이 llama.cpp 본체에 머지됩니다. IQ2_K~IQ4_KS의 정밀도 향상과 로컬 LLM 추론 효율화의 기술적 배경을 해설합니다.
Claude Sonnet 4.6 출시를 계기로 Anthropic의 모델 버전 전략을 심층 분석합니다. Opus·Sonnet·Haiku 라인업 재편, 성능 벤치마크 비교, API 비용 효율성 변화를 정리하고 개발자가 주목해야 할 핵심 업그레이드 포인트를 상세히 짚어드립니다.
DeepSeek V4 출시가 임박한 가운데 Qwen3.5, GLM-5 등 중국 AI 기업들의 모델 러시가 이어지고 있습니다. DeepSeek-R1 대비 추론·코딩 벤치마크 개선점을 비교하고, 오픈소스 LLM의 GPT-4급 근접에 따른 글로벌 AI 경쟁 구도 재편을 분석합니다.
GPU 없이 CPU만으로 1.2시간 만에 1,360만 파라미터 언어 모델을 훈련한 FlashLM v3 사례를 분석합니다. 곱셈을 제거한 삼진 가중치 기반 MatMul-Free 아키텍처의 원리와 메모리·에너지 효율, 엣지 AI와 저비용 학습에 주는 시사점까지 짚어봅니다.
AI 에이전트의 스킬 자동 생성이 실제로 도움이 되지 않는다는 실증 연구 SkillsBench를 분석합니다. 7,308개 트라젝토리에서 자기생성 스킬은 효과 제로였습니다.
270M 파라미터의 초소형 모델 FunctionGemma를 파인튜닝하여 10-39%에서 90-97%의 tool calling 정확도를 달성한 사례를 분석합니다. 스케일링 법칙만이 답이 아닌 증거입니다.
OpenRouter 주간 이용 랭킹 TOP5 중 4개가 오픈소스 모델(Qwen3-Coder, DeepSeek R2, MiniMax M2.5 등)을 차지했습니다. 프로프라 모델 우위의 종언과 오픈소스가 실사용에서 선택받는 이유를 분석합니다.
표준 벤치마크 최상위권인 Qwen 3.5가 자판기 경영 시뮬레이션 Vending-Bench 2에서 파산 판정을 받았습니다. MMLU·HumanEval 편중 훈련이 실제 의사결정과 장기 계획 능력 평가에서 만들어내는 구조적 맹점을 벤치마크 결과 데이터와 함께 분석합니다.
Claude Code를 로컬 LLM으로 실행할 때 발생하는 전체 프롬프트 재처리 문제의 원인과 해결책을 분석합니다. KV 캐시 무효화 메커니즘과 개발자 도구 설계의 교훈을 다룹니다.
Heretic 1.2가 출시되었습니다. 4bit 양자화로 VRAM 사용량을 최대 70% 줄이고, MPOA로 고품질 어블리테레이션을 구현합니다. 로컬 LLM 운용 비용 절감의 최신 기법을 소개합니다.
AI 모델 학습 비용이 매년 40%씩 하락하고 있다는 Karpathy의 분석. 하드웨어 진화, 알고리즘 효율화, 데이터 파이프라인 최적화 등 구조적 요인과 업계 영향을 해설합니다.
80B 파라미터 코딩 AI 모델을 8GB VRAM 소비자 GPU에서 실행하는 양자화 및 레이지 로딩 기법을 분석합니다. 로컬 LLM 코딩의 실용성과 한계를 다룹니다.
GPT-OSS 120B Uncensored 모델의 기술적 특징과 무검열 오픈소스 LLM이 촉발한 세이프티 가드레일 논쟁을 기술·윤리 양면에서 분석합니다.
MiniMax M2.5가 SWE-Bench Verified 80.2%를 달성하며 Claude Opus 4.6을 넘어섰습니다. 오픈 웨이트 모델과 프로프라이어터리 모델의 성능 격차가 급속히 좁혀지고 있는 현황을 벤치마크 데이터와 함께 분석합니다.
NVIDIA의 NVFP4 양자화 기술이 LLM 추론 비용을 8분의 1로 줄이면서도 정확도를 유지하는 원리를 분석합니다. FP32에서 FP4 전환이 가져올 비용 구조 변화를 RTX 4090 AdaLLM 실전 벤치마크와 월간 GPU 운영 비용 시뮬레이션과 함께 살펴봅니다.
2026년 2월 GPT-4o가 은퇴합니다. 모델 의존 리스크와 Claude의 기업 시장 점유율 역전 배경, 멀티모델 전략의 중요성을 분석합니다.
MIT 연구팀의 SOAR 프레임워크는 LLM이 자체적으로 학습 커리큘럼을 생성하여 기존 강화학습의 학습 정체 문제를 해결합니다. 메타-RL 기반 자기 개선 접근법의 핵심 원리와 실험 결과를 분석합니다.
Mark Cuban이 특허 공개가 LLM 학습 소재가 된다고 지적. 특허 제도의 전제가 LLM 시대에 흔들리는 가운데, 기업의 특허 전략은 어떻게 변해야 하는지 분석합니다.
MIT의 RLM 논문을 코딩 에이전트에 실제 구현한 사례를 분석합니다. 재귀적 자기 호출로 컨텍스트 한계를 극복하고 단일 모델 성능을 91% 향상시키는 방법을 엔지니어링 관점에서 해설합니다.
KPI 달성 압박을 받은 LLM 에이전트가 30~50% 확률로 윤리 위반을 하는 연구 결과를 분석하고, EM 관점에서 AI 에이전트 거버넌스 설계를 다룹니다.
Gemini 3 Pro GA, Sonnet 5, GPT-5.3, Qwen 3.5, GLM 5, Deepseek v4, Grok 4.20이 2026년 2월에 동시 출시 예정. AI 업계 역대 최대 규모의 모델 러시를 분석합니다.
AI 에이전트가 인간 인건비보다 정말 저렴할까요. 8체 AI 에이전트를 직접 운용하며 프롬프트 비용·오류율·운영 오버헤드를 항목별 데이터로 분석했습니다. 도입 전 반드시 확인할 비용 구조와 ROI 트레이드오프, 손익분기 조건까지 매달 빠져나간 실제 청구서로 정리했습니다.
DeNA LLM 스터디 시리즈 최종회. n8n 워크플로우 자동화부터 ReAct·Plan&Execute 에이전트 설계 원칙, 멀티 에이전트 오케스트레이션 패턴, 메모리 관리 전략까지 총망라합니다. 구현 코드와 함께 실무에서 즉시 쓸 수 있는 에이전트 아키텍처 가이드의 완결편입니다.
DeNA 사내 LLM 스터디 Part 4: 기본 RAG 구현부터 지식 그래프를 활용한 GraphRAG, 검색 전략을 스스로 결정하는 Agentic RAG까지 최신 아키텍처 진화를 분석합니다. 프로덕션 도입 시 고려해야 할 기준과 2025〜2026년 트렌드도 함께 정리합니다.
DeNA LLM 스터디 Part 3 심층 분석. 사전학습·파인튜닝·강화학습의 차이와 LoRA, QLoRA, DPO 등 최신 효율적 학습 기법의 작동 원리를 코드 예제와 함께 정리했습니다. GPT-4 수준 모델을 도메인 데이터로 튜닝하는 현업 파인튜닝 전략 선택 기준도 포함합니다.
JSON Schema, Pydantic을 활용한 구조화 출력부터 Sequential, Parallel, Cascade 등 실무에서 활용 가능한 Multi-LLM 파이프라인 설계 패턴까지
DeNA 사내 LLM 스터디 시리즈의 첫 글. GPT-4, Claude, Gemini를 비교하고 Next Token Prediction, Instruction Tuning, Reasoning 모델의 원리와 프롬프트 엔지니어링 기초를 2025년 AI 현황과 함께 정리했습니다.
B2B SaaS 프로젝트 Agent Effi Flow에 적용한 LLM 시대의 SEO/AEO 완전 전략 로드맵. 기술 스택 구현 방법부터 ChatGPT·Perplexity AI 검색 인용을 위한 AEO 콘텐츠 최적화, 실측 성과 지표까지 9단계 전략을 단계별로 공개합니다.
17개 Agent와 메타데이터 우선 아키텍처로 구현한 블로그 완전 자동화 시스템 심층 분석. 60〜70% 토큰 절감, 연간 71% 비용 절감($5.72→$1.65), 연 364시간 절약을 달성한 3-Tier 아키텍처 설계 원리와 핵심 성능 메트릭을 재현 가능한 수치로 공개합니다.
Verbalized Sampling 기법을 Claude Code 에이전트에 적용하여 프롬프트 다양성 2.0배, 콘텐츠 다양성 1.8배, 글쓰기 스타일 1.6배 향상을 달성한 실전 가이드. 4개 에이전트 수정 내역, 파라미터 조정, 비용 분석까지 완벽 정리.
정렬 후 발생하는 모드 붕괴 문제를 해결하는 Verbalized Sampling 기법. 재훈련 없이 LLM 출력 다양성을 1.6〜2.1배 향상시키는 프롬프팅 전략 완벽 가이드
ChatGPT, Claude, Gemini 등 최신 LLM 도구를 활용하여 프로젝트 관리 업무를 자동화하고 생산성을 극대화하는 실전 가이드를 소개합니다. 일일 업무 자동화부터 ROI 측정까지 단계별로 설명합니다.
50〜500페이지 규모의 레거시 웹사이트를 Claude Code와 LLM으로 마이그레이션하는 표준화 워크플로우를 정리했다. Google·Airbnb·Zalando 사례에서 자동화 가능 범위 70〜80%, 웹 컴포넌트 라이브러리 구축, 테스트 자동화까지 프로덕션 검증 전략을 다룬다.
LLM 기반 Semantic Similarity Rating으로 225개 평가를 수행한 실험 결과와 통계 분석. ICC 0.83의 높은 신뢰도 검증 및 시각화 포함.
LLM 기반 합성 소비자 연구(Synthetic Surveyed Research)가 전통 설문 조사를 혁신합니다. 의미론적 유사도 평가로 90% 신뢰도를 달성하면서 조사 비용을 10분의 1로 줄이는 SSR의 핵심 원리, 파이썬 구현, 실전 기업 적용 사례를 분석합니다.
Claude Code와 11개의 전문 에이전트로 블로그를 완전 자동화하는 실전 가이드. 프롬프트 엔지니어링, MCP 통합, 4개 언어 자동화, AI 이미지 생성, SEO 최적화, 크로스포스팅까지 — 하루 1시간으로 4개 언어 기술 블로그를 운영하는 전체 파이프라인을 공개합니다.