AI가 스스로 생성한 스킬은 무의미하다 — LLM 자기개선 신화를 뒤집는 연구
AI 에이전트의 스킬 자동 생성이 실제로 도움이 되지 않는다는 실증 연구 SkillsBench를 분석합니다. 7,308개 트라젝토리에서 자기생성 스킬은 효과 제로였습니다.
태그
3개 글
AI 에이전트의 스킬 자동 생성이 실제로 도움이 되지 않는다는 실증 연구 SkillsBench를 분석합니다. 7,308개 트라젝토리에서 자기생성 스킬은 효과 제로였습니다.
표준 벤치마크 최상위권인 Qwen 3.5가 자판기 경영 시뮬레이션 Vending-Bench 2에서 파산 판정을 받았습니다. MMLU·HumanEval 편중 훈련이 실제 의사결정과 장기 계획 능력 평가에서 만들어내는 구조적 맹점을 벤치마크 결과 데이터와 함께 분석합니다.
MiniMax M2.5가 SWE-Bench Verified 80.2%를 달성하며 Claude Opus 4.6을 넘어섰습니다. 오픈 웨이트 모델과 프로프라이어터리 모델의 성능 격차가 급속히 좁혀지고 있는 현황을 벤치마크 데이터와 함께 분석합니다.