タグ

推論最適化

2件の記事

13 分

ローカルLLMの最初の応答はなぜ時々10秒もかかるのか — コールドスタート(load_duration)を実測した

少し離れてからエージェントを呼び直すと、最初の応答だけやけに重い。Ollamaが応答ごとに返すload_durationをモデルサイズ別に 分解すると、2GBで1.5秒、9.6GBで最大9.7秒だった。しかも「コールド」には二種類あった。keep_alive一つでこの費用が どう分かれるかを実測してまとめた。

ローカルLLM Ollama 推論最適化
14 分

ローカルLLMはなぜ会話が長くなると遅くなるのか — prefillとgenerationを分解して測った

同じ9,700トークンのプロンプトが私のノートPCで最初のトークンまで55秒かかったのに、2回目の呼び出しは65ミリ秒だった。Ollamaのタイムスタンプを直接取り出してprefillとgenerationを分離測定し、prefixキャッシュがなぜ396倍速かったのか、エージェントのコンテキスト設計にどう活かすかをまとめた。

ローカルLLM Ollama 推論最適化