タグ

同時実行

1件の記事

11 分

ローカルLLMにエージェント8個を同時接続してみた — Ollama同時実行スループット実測

サブエージェントを並列で回せばローカルモデルもその分速くなると思っていた。実際に測ると既定のOllamaはリクエストを順番待ちで捌くので、8個つないでも総スループットは変わらなかった。OLLAMA_NUM_PARALLELを上げたときの利得とその代償をM1 16GBで実測した。

ローカルLLM Ollama 同時実行