태그

LLM평가

2개 글

11 분 소요

로컬 추론 모델은 추론값을 하는가 — gemma4:12b로 thinking ON/OFF를 직접 잰 기록

gemma4:12b의 빈 응답을 패키징 버그로 단정했다가 사실은 추론(thinking) 모델이었음을 뒤늦게 알았다. 추론 ON/OFF로 13문제를 돌려보니 정답은 1개 더 맞혔지만 출력 토큰을 68배, 시간을 19배 더 썼다. 에이전트에서 추론을 언제 켜고 끌지 실측으로 정리한다.

로컬LLM Ollama 추론모델
12 분 소요

로컬 LLM은 같은 답을 두 번 줄까 — temperature와 seed로 출력 재현성 직접 측정

같은 프롬프트를 로컬 Gemma 4에 수십 번 던져 LLM 출력 재현성을 직접 측정한 실험 기록이다. temperature=0은 완전히 결정적이었고, 온도를 올려도 seed를 고정하면 출력이 한 줄로 수렴했다. 평가와 CI 테스트에 바로 적용할 결론과 권장 설정값까지 정리한다.

로컬LLM Ollama LLM평가